MoE/라우팅

희소성을 넓이에서 안정적으로 유지하는 법

지금 상태

희소성을 넓이에서 안정적으로 유지하는 법이다.

큰그림

K3 LatentMoE는 전체 2.78T 파라미터를 104.2B active로 실행한다:

  • 896 experts 중 16 experts + 2 shared experts를 활성화
  • LatentMoE: 라우팅 차원 7168 → 실제 expert 선택 3584
  • KDA (Key-Dependency Attention) ×3, 그 다음 Gated MLA ×1

넓은 모델에서 sparse activation은 학습 불안정성을 야기한다. 해결책:

  • μP (Maximal Update Parametrization): 넓이에 대한 학습률 스케일링
  • Muon: Momentum-based optimizer 변형
  • IndexShare: Expert 간 파라미터 공유 메커니즘

3T-class 모델을 100B active로 실행 가능하게 만드는 핵심 기술. 라우팅이 안정적이지 않으면 sparse MoE의 효율성은 무의미하다.