약속 지켜짐
7월 27일, Moonshot AI가 K3 가중치와 technical report를 공개했다. 11일 전 약속이 지켜졌다.
커뮤니티는 paper의 Table 1로 달려갔다.
Table 1: 숫자들
| Metric | Value |
|---|---|
| Total Parameters | 2.78T |
| Active Parameters | 104.2B |
| Total Experts | 896 |
| Active Experts | 16 + 2 shared |
| Latent Routing Dim | 7168 |
| Active Routing Dim | 3584 |
2.78T로 확정되었다. “2.8T”는 반올림이 아니라 정확한 표현이었다.
아키텍처: KDA + MLA
레이어 구조가 공개되었다.
KDA (Kimi Delta Attention) × 3
- 매 토큰을 앨범처럼 쌓지 않고, 고정 크기 상태를 갱신한다 (forget / write).
- 긴 컨텍스트에서 KV 앨범이 커지지 않게 하는 쪽.
Gated MLA × 1
- 그 사이클마다 한 번은 전체를 다시 본다.
- MLA에는 NoPE. 위치는 KDA 쪽 감쇠가 시계 역할을 한다.
4-layer cycle: KDA, KDA, KDA, MLA, 반복.
LatentMoE: 7168 → 3584
K3의 MoE 라우팅은 2단계다:
- 7168-dim latent space로 projection
- 3584-dim으로 압축하면서 expert 선택
왜 이렇게?
- 7168 차원에서 더 fine-grained representation
- 3584로 줄이면서 noise 제거
- Expert routing이 더 안정적
이게 “LatentMoE”라는 이름의 이유다.
라이선스: 조건부 MIT
가중치는 MIT 라이선스… 대부분의 경우.
예외 조건:
If MaaS (Model-as-a-Service) revenue exceeds $20M annually, contact Moonshot AI for commercial license.
즉:
- 연구용: MIT
- 소규모 상업: MIT
- 대규모 상업 (>$20M): 별도 계약
“오픈”은 여전히 조건부였다.
같은 날: Flash-0731
K3 paper와 같은 날, DeepSeek이 Flash-0731을 조용히 릴리즈했다.
핵심:
- 가중치 동일: 284B total, 13B active (V4 Flash와 같음)
- Re-post-train only: pretraining은 그대로
- DeepSWE: 12.8 → 54.4 (DeepSeek 자체 테이블)
4배 이상 점프. 같은 뇌, 다른 연습.
Post-Train의 위력
Flash-0731은 중요한 데이터 포인트였다:
- 13B active model
- Post-training만 변경
- Task-specific performance 4배 향상
이것이 “포스트트레인 vs 프리트레인” 레인의 핵심 사례가 되었다.
커뮤니티 리액션
HN/Raschka 쪽 논점은 인용 없이 요약하면 이렇다. NoPE를 글로벌 레이어에 넣으면 토큰 수프가 되는 거 아니냐는 질문이었고, paper 답은 KDA 감쇠가 위치라는 것. 웨이트는 열렸고, MaaS 연 2천만 달러가 넘으면 MIT가 아니다.
K3의 유산
K3는 최강자가 아니었다. 하지만:
- 첫 3T-class 오픈 가중치
- LatentMoE 메커니즘 공개
- KDA + MLA 조합 검증
벤치마크 리더는 아니었지만, 엔지니어링 학습 자료로서의 가치는 컸다.