카카오의 2단계 하이퍼파라미터 전이 기술 분석
10조 토큰 거대 MoE도 작은 모델로 예측한다. 카카오 AI 연구진의 최신 논문(Let’s Scale Step by Step)을 통해, 155B 대규모 MoE 모델의 최적 학습률을 1% 미만의 적은 비용으로 사전 예측하는 μP 확장과 토큰 스케일링 법칙을 알기 쉽게 분석했다.
3개의 글
10조 토큰 거대 MoE도 작은 모델로 예측한다. 카카오 AI 연구진의 최신 논문(Let’s Scale Step by Step)을 통해, 155B 대규모 MoE 모델의 최적 학습률을 1% 미만의 적은 비용으로 사전 예측하는 μP 확장과 토큰 스케일링 법칙을 알기 쉽게 분석했다.
H100부터 맥북까지 최대 3.2배 속도를 끌어올린 Liquid AI의 LFM2.5 전용 DSpark 추측 디코딩 모델을 살펴보고, 메모리 대역폭 병목을 넘어서는 원리와 온디바이스 에이전트 가속, MoE 모델에서의 흥미로운 한계와 시사점을 정리했다.
내 컴퓨터를 작은 GPU가 아닌 하나의 플랫폼으로 볼 때 일어나는 변화. UC Berkeley 연구진이 공개한 오픈소스 로컬 MoE 서빙 시스템 FreeToken 논문 《FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution》을 읽고, 대역폭 적응형 실행과 탄력적 캐시 원리를 정리했다.