2026년 7월 27일

약속 지켜짐

7월 27일, Moonshot AI가 K3 가중치와 technical report를 공개했다. 11일 전 약속이 지켜졌다.

커뮤니티는 paper의 Table 1로 달려갔다.

Table 1: 숫자들

MetricValue
Total Parameters2.78T
Active Parameters104.2B
Total Experts896
Active Experts16 + 2 shared
Latent Routing Dim7168
Active Routing Dim3584

2.78T로 확정되었다. “2.8T”는 반올림이 아니라 정확한 표현이었다.

아키텍처: KDA + MLA

레이어 구조가 공개되었다.

KDA (Kimi Delta Attention) × 3

  • 매 토큰을 앨범처럼 쌓지 않고, 고정 크기 상태를 갱신한다 (forget / write).
  • 긴 컨텍스트에서 KV 앨범이 커지지 않게 하는 쪽.

Gated MLA × 1

  • 그 사이클마다 한 번은 전체를 다시 본다.
  • MLA에는 NoPE. 위치는 KDA 쪽 감쇠가 시계 역할을 한다.

4-layer cycle: KDA, KDA, KDA, MLA, 반복.

LatentMoE: 7168 → 3584

K3의 MoE 라우팅은 2단계다:

  1. 7168-dim latent space로 projection
  2. 3584-dim으로 압축하면서 expert 선택

왜 이렇게?

  • 7168 차원에서 더 fine-grained representation
  • 3584로 줄이면서 noise 제거
  • Expert routing이 더 안정적

이게 “LatentMoE”라는 이름의 이유다.

라이선스: 조건부 MIT

가중치는 MIT 라이선스… 대부분의 경우.

예외 조건:

If MaaS (Model-as-a-Service) revenue exceeds $20M annually, contact Moonshot AI for commercial license.

즉:

  • 연구용: MIT
  • 소규모 상업: MIT
  • 대규모 상업 (>$20M): 별도 계약

“오픈”은 여전히 조건부였다.

같은 날: Flash-0731

K3 paper와 같은 날, DeepSeek이 Flash-0731을 조용히 릴리즈했다.

핵심:

  • 가중치 동일: 284B total, 13B active (V4 Flash와 같음)
  • Re-post-train only: pretraining은 그대로
  • DeepSWE: 12.8 → 54.4 (DeepSeek 자체 테이블)

4배 이상 점프. 같은 뇌, 다른 연습.

Post-Train의 위력

Flash-0731은 중요한 데이터 포인트였다:

  • 13B active model
  • Post-training만 변경
  • Task-specific performance 4배 향상

이것이 “포스트트레인 vs 프리트레인” 레인의 핵심 사례가 되었다.

커뮤니티 리액션

HN/Raschka 쪽 논점은 인용 없이 요약하면 이렇다. NoPE를 글로벌 레이어에 넣으면 토큰 수프가 되는 거 아니냐는 질문이었고, paper 답은 KDA 감쇠가 위치라는 것. 웨이트는 열렸고, MaaS 연 2천만 달러가 넘으면 MIT가 아니다.

K3의 유산

K3는 최강자가 아니었다. 하지만:

  • 첫 3T-class 오픈 가중치
  • LatentMoE 메커니즘 공개
  • KDA + MLA 조합 검증

벤치마크 리더는 아니었지만, 엔지니어링 학습 자료로서의 가치는 컸다.