MoE/라우팅
희소성을 넓이에서 안정적으로 유지하는 법
지금 상태
희소성을 넓이에서 안정적으로 유지하는 법이다.
큰그림
K3 LatentMoE는 전체 2.78T 파라미터를 104.2B active로 실행한다:
- 896 experts 중 16 experts + 2 shared experts를 활성화
- LatentMoE: 라우팅 차원 7168 → 실제 expert 선택 3584
- KDA (Key-Dependency Attention) ×3, 그 다음 Gated MLA ×1
넓은 모델에서 sparse activation은 학습 불안정성을 야기한다. 해결책:
- μP (Maximal Update Parametrization): 넓이에 대한 학습률 스케일링
- Muon: Momentum-based optimizer 변형
- IndexShare: Expert 간 파라미터 공유 메커니즘
3T-class 모델을 100B active로 실행 가능하게 만드는 핵심 기술. 라우팅이 안정적이지 않으면 sparse MoE의 효율성은 무의미하다.