EAGLE-3
핵심 아이디어
EAGLE-3는 MTP와 EAGLE-1 사이의 피드백 루프를 보여준다.
논문에서 밝히듯, EAGLE이 DeepSeek-V3의 MTP 설계에 영감을 주었고, MTP 경험이 다시 EAGLE-3의 새로운 설계를 만들었다. 이 순환이 이 노트의 핵심이다.
메커니즘
EAGLE-1이 가진 feature-level 예측 제약을 버렸다.
- 직접 토큰 예측: 다음 hidden state를 맞추는 제약을 버리고, 융합 feature에서 바로 토큰을 예측
- 다층 융합: Target의 최상위 레이어만이 아니라 저·중·고 레벨 feature를 모두 융합
- Training-time test: 학습 중에 multi-step drafting을 시뮬레이션. Draft 모델이 2단계, 3단계 이후에도 분포 안에 머물도록 훈련
EAGLE-2의 동적 draft tree와도 호환된다. EAGLE-2를 별도 키스톤으로 만들지 않는다—한 문장이면 충분하다.
성능
논문이 보고한 검증된 수치만:
- Vanilla autoregressive 대비 최대 6.5×
- EAGLE-2 대비 약 1.4×
- SGLang에서 batch size 64일 때 throughput 1.38×
참고
- 논문: EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test
- arXiv: 2503.01840