EAGLE-3

Li, Wei, Zhang, Zhang·2025·arXiv:2503.01840

핵심 아이디어

EAGLE-3는 MTP와 EAGLE-1 사이의 피드백 루프를 보여준다.

논문에서 밝히듯, EAGLE이 DeepSeek-V3의 MTP 설계에 영감을 주었고, MTP 경험이 다시 EAGLE-3의 새로운 설계를 만들었다. 이 순환이 이 노트의 핵심이다.

메커니즘

EAGLE-1이 가진 feature-level 예측 제약을 버렸다.

  1. 직접 토큰 예측: 다음 hidden state를 맞추는 제약을 버리고, 융합 feature에서 바로 토큰을 예측
  2. 다층 융합: Target의 최상위 레이어만이 아니라 저·중·고 레벨 feature를 모두 융합
  3. Training-time test: 학습 중에 multi-step drafting을 시뮬레이션. Draft 모델이 2단계, 3단계 이후에도 분포 안에 머물도록 훈련

EAGLE-2의 동적 draft tree와도 호환된다. EAGLE-2를 별도 키스톤으로 만들지 않는다—한 문장이면 충분하다.

성능

논문이 보고한 검증된 수치만:

  • Vanilla autoregressive 대비 최대 6.5×
  • EAGLE-2 대비 약 1.4×
  • SGLang에서 batch size 64일 때 throughput 1.38×

참고

  • 논문: EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test
  • arXiv: 2503.01840
← 빠른 추론 허브로 돌아가기