던스커버리 | Dawnscovery

카카오의 2단계 하이퍼파라미터 전이 기술 분석

AI 파운데이션 모델을 처음부터(Scratch) 학습시키는 일은 수십억에서 수백억 원의 막대한 전기세와 GPU 연산 비용이 들어가는 거대한 도박과도 같다.

특히 모델의 가중치를 얼마나 큰 보폭으로 업데이트할지 결정하는 학습률(Learning Rate) 설정은 모델의 성패를 가르는 가장 치명적인 하이퍼파라미터다. 학습률이 너무 작으면 몇 달을 학습시켜도 똑똑해지지 않고, 너무 크면 중간에 손실값(Loss)이 폭발하며 학습이 완전히 망가져 버린다.

작은 모델이라면 여러 학습률로 수십 번 돌려보며(Sweeping) 최적의 값을 찾을 수 있지만, 총 파라미터 155B(1,550억 개)에 10조 개(10 Trillion) 토큰을 학습시키는 초거대 MoE(Mixture-of-Experts) 모델에서는 그런 사전 실험 자체가 불가능에 가깝다.

2026년 8월, 카카오(Kakao) AI 연구진은 이 난제를 해결한 논문 《Let’s Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts》 [1]을 발표했다.

작은 프록시 모델에서 최적의 학습률을 찾아낸 뒤, 이를 모델 크기 축10조 토큰 시간 축으로 안전하게 전이(Transfer) 및 외삽(Extrapolation)하여 155B 거대 MoE 모델을 단 한 번의 실패 없이 안정적으로 학습시키는 실전 방법론을 알기 쉽게 정리했다.


1. 왜 155B 거대 MoE 모델의 학습률을 찾기가 어려울까?

최근 DeepSeek-V3, Qwen-MoE 등 현대적인 오픈소스 프론티어 모델들은 대부분 MoE(Mixture-of-Experts) 구조를 채택한다.

[개념 짚고 가기: MoE(Mixture-of-Experts)란?]
수많은 전문가 신경망(예: 128개)을 만들어 두고, 입력된 토큰마다 가장 적합한 소수의 전문가(예: 8개)만 골라서 연산하는 기법입니다.
전체 파라미터 용량은 155B로 거대하지만, 실제 계산에 참여하는 활성 파라미터는 17B에 불과해 추론 비용과 메모리를 크게 아낄 수 있습니다.

문제는 MoE 모델이 기존 Dense(밀집) 모델보다 튜닝하기가 훨씬 까다롭다는 점이다.

  1. 2차원 탐색(2D Sweep)의 비용 폭발: 모델 크기(폭, 전문가 수) 축과 학습 토큰 수(10T 토큰) 축을 동시에 훑으면 연산량이 급증한다. 논문 기준으로 프록시 실행 자체는 64.8 ZFLOPs인데, 모델 크기 탐색을 덧붙이는 것만으로 240.3 ZFLOPs가 추가로 든다.
  2. 토큰 길이에 따른 최적 학습률의 이동: 모델을 1,000억 토큰 학습시킬 때의 최적 학습률과, 10조 토큰을 학습시킬 때의 최적 학습률이 서로 다르다.
모델 규모 (크기 축) 1,000억 토큰 (100B) 1조 토큰 (1T) 10조 토큰 (10T)
5.6B 프록시 모델 실험 가능 (저비용) 실험 가능 실험 비용 증가
20B 중형 모델 실험 가능 고비용 실험 매우 높은 비용 발생
155B 거대 타깃 모델 고비용 극단적 고비용 직접 탐색 불가 (수백억 원 소모)

2. 카카오의 2단계 하이퍼파라미터 전이 프레임워크

카카오 연구진은 복잡한 2차원 탐색을 모델 크기 축토큰 시간 축의 2단계(Two-Step)로 깔끔하게 분리하여 해결했다.

[ 카카오의 2단계 전이 프레임워크 ]

[Step 1: 모델 크기 축 전이]
  작은 프록시 MoE (10.8B) ──(μP 파라미터화)──▶ 거대 타깃 MoE (155B)
        │                                            │
        │ (최적 LR 동일하게 유지됨)                         │ (Zero-shot 전이)
        ▼                                            ▼
[Step 2: 토큰 시간 축 외삽]
  짧은 토큰 구간 (255B~500B) ──(로그 선형 회귀)──▶ 10조 토큰 (10T) 최적 LR 산출!

이 방식을 사용하면 거대 타깃 모델의 전체 학습량 대비 단 1% 수준의 작은 프록시 연산량만으로 10조 토큰에서의 최적 학습률을 정확하게 맞출 수 있다.


3. 1단계: μP(Maximal Update Parameterization)로 모델 크기 축 넘나들기

기존 딥러닝에서는 모델의 너비(Hidden dimension)를 키우면 레이어 내부의 신호 크기와 그래디언트 스케일이 달라져 학습률을 다시 튜닝해야 했다.

이를 극복하기 위해 제안된 것이 바로 μP(Maximal Update Parameterization) 기법이다. 모델 폭이 아무리 넓어져도 각 레이어가 업데이트되는 크기를 수학적으로 일정하게 맞춰주어, 작은 모델에서 찾은 최적 학습률을 큰 모델에 그대로(Zero-shot) 쓸 수 있게 만든다.

[개념 짚고 가기: μP(Maximal Update Parameterization)란?]
보통 딥러닝 모델의 너비(폭)를 키우면 각 층의 활성화 값과 그래디언트 크기가 제각각 달라져, 작은 모델에서 잘 되던 최적 학습률이 큰 모델에서는 폭발하거나 멈춰버립니다.
μP는 모델 폭이 아무리 커지더라도 각 층의 가중치 업데이트 비율이 수학적으로 일정하게 유지되도록 초기화 및 학습률 스케일을 조정해 주는 기법으로, 작은 프록시 모델에서 한 번만 최적 학습률을 찾아두면 수십 배 큰 타깃 모델에도 그 값을 그대로 적용할 수 있습니다.

카카오 연구진은 이 μP를 최신 아키텍처에 맞게 확장했다.

  1. MoE 희소성(Sparsity) 확장: 폭(hidden dimension)을 키우면서 전문가 수를 16개에서 128개까지 함께 늘리는 경로에서도 최적 학습률이 그대로 전이됨을 실험으로 확인했다. 다만 논문은 희소성을 폭과 묶어서 함께 키웠기 때문에, 희소성 축 단독의 효과는 분리해 검증하지 못했다고 결론부에서 밝힌다.
  2. MLA(Multi-head Latent Attention) 결합: DeepSeek-V3처럼 KV 캐시를 압축하는 MLA 구조에서도 학습률 전이가 안정적으로 유지됨을 확인했다.
  3. Muon 옵티마이저 적용: 최근 수렴 속도가 빨라 각광받는 Muon 옵티마이저 환경에서도 μP 전이성이 깨지지 않음을 입증했다.

4. 2단계: 10조 토큰 너머를 내다보는 스케일링 법칙

모델 크기 문제가 해결되었더라도, 10조 토큰이라는 아득한 학습량에서 최적 학습률이 어디로 이동할지 알아내야 한다.

                     [ 프록시 모델 WSD 안정 구간 학습 ]


                    [ 2B 토큰 간격 EMA 가중치 누적 ]


             [ 10B 간격 체크포인트로 학습률별 Loss 측정 ]


                  [ 2차 곡선 피팅으로 각 토큰별 최적 LR 산출 ]


             [ log(LR) vs log(Tokens) 선형 회귀 (R² = 0.95) ]


                     [ 10T 토큰 최적 LR = 3.85 × 10⁻⁴ 도출! ]
  1. EMA(지수 이동 평균) 가중치 활용: WSD 스케줄러의 안정 구간에서 매 20억 토큰마다 가중치를 평균(EMA) 내어, 불필요한 감속 실험 없이도 다양한 토큰 시점의 최적 성능을 단 한 번의 실행으로 추출했다.
  2. 2차 다항식 곡선 피팅: 각 토큰 시점마다 학습률과 검증 손실값(Loss)의 관계를 2차 포물선으로 모델링하여 꼭짓점(최적 학습률)을 정확히 찾아냈다.
  3. 로그-로그 선형 회귀(Linear Regression): 찾아낸 최적 학습률들을 토큰 수와 함께 로그 스케일로 회귀 분석한 결과, 결정계수 R² = 0.95(95%)라는 높은 적합도를 보였다.

이를 통해 5,000억 토큰 미만의 프록시 데이터로부터 10조 토큰 시점의 이상적인 학습률이 3.85 × 10⁻⁴라는 결론을 깔끔하게 도출해 냈다.


5. 실전 검증: 155B 카카오 파운데이션 모델 학습 결과

카카오 연구진은 예측된 하이퍼파라미터를 적용하여 155B 총 파라미터, 17B 활성 파라미터를 가진 MoE 파운데이션 모델의 사전학습을 수행했다.

비교 모델 총 파라미터 / 활성 파라미터 MMLU-Pro 성능 특징
카카오 MoE (본 연구) 155B / 17B 최고 수준 (Pareto Frontier) 예측된 LR 적용, 단 한 번의 Loss Spike 없이 완주
GLM-4.5-Air 100B+ MoE 동등 이하 동등 연산량 대비 카카오 모델 우세
dots.llm1 100B+ MoE 동등 이하 카카오 모델이 더 높은 효율 달성

실제 10조 토큰 학습 과정에서 학습 손실값이 튀는 현상(Loss Spike)이 단 한 차례도 발생하지 않고 완벽하게 안정적인 수렴 곡선을 그렸다.


6. 엔지니어링 시사점

핵심 개념 쉬운 설명
MoE 거대한 전체 용량 중 일부 전문가만 켜서 연산 효율을 극대화하는 모델 구조
μP 작은 모델에서 찾은 최적 학습률을 큰 모델에 그대로 전달하는 파라미터화 기술
EMA 가중치 최근 가중치를 부드럽게 평균 내어 불필요한 감속 실험을 아껴주는 기법
스케일링 법칙 작은 규모의 경향성을 선형 회귀하여 10조 토큰 너머의 최적값을 맞추는 수학적 외삽법

거대 MoE 모델을 학습시킬 때 천문학적인 비용이 드는 하이퍼파라미터 탐색을, μP와 정밀한 토큰 스케일링 법칙을 결합해 1%의 작은 연산량만으로 10조 토큰의 최적 학습률을 정확하게 예측해 낸 뛰어난 실전 엔지니어링 프레임워크다.


참고 문헌 및 원문

  • [1] Kim N, Lee H, Bak Y, Park J, Kim B. Let’s Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts. arXiv:2608.20061, 2026. (arXiv 원문)