2026년 8월 25일 카카오의 2단계 하이퍼파라미터 전이 기술 분석 10조 토큰 거대 MoE도 작은 모델로 예측한다. 카카오 AI 연구진의 최신 논문(Let’s Scale Step by Step)을 통해, 155B 대규모 MoE 모델의 최적 학습률을 1% 미만의 적은 비용으로 사전 예측하는 μP 확장과 토큰 스케일링 법칙을 알기 쉽게 분석했다. 공부 AI 논문 MoE 카카오