던스커버리 | Dawnscovery

벤치마크 1등이 탈락한 이유: 독파모 4파전과 AI 생태계의 본질

최근 국내 AI 생태계에서 가장 뜨거운 논쟁을 불러일으킨 사건이 있었다. 2026년 8월 18일 발표된 정부 주도 독자 파운데이션 모델(독파모) 사업의 2차 단계평가에서, 4개 정예팀 중 업스테이지·SK텔레콤·LG AI연구원 3팀이 다음 단계로 올라가고 AAII 최고점을 받은 모티프테크놀로지스가 탈락했다 [1].

최종 2팀은 하반기 3차 평가에서 가려진다. 정부 계획은 2027년까지 글로벌 선도 모델 대비 95% 수준의 독자 모델을 개발하는 것이다 [1].

덧붙여 이 사안은 아직 닫히지 않았다. 탈락한 모티프테크놀로지스는 8월 27일 평가 점수 공개와 재심의를 요구하는 이의를 제기했고, 정부는 추가 점수 공개 범위를 검토하겠다고 밝혔다 [4].

소식을 접한 개발자들과 연구자들 사이에서는 “시험 점수 1등을 떨어뜨리는 게 말이 되느냐”는 공정성 논란부터, “벤치마크 점수와 실제 서비스 현장에서 느끼는 체감 성능의 격차를 보여준 상징적 사건”이라는 분석까지 다양한 의견이 쏟아져 나왔다.

이번 독파모 선발 결과가 왜 논란이 되었는지, 벤치마크와 실사용감 사이에는 어떤 구조적 차이가 존재하는지, 그리고 왜 미래 AI 경쟁력의 승부처가 모델 가중치 자체가 아닌 하네스(Harness)와 산업 생태계로 이동하고 있는지 깊이 있게 정리해 보았다.


1. 벤치마크 점수와 체감 성능의 괴리: ’판교어’와 하네스의 차이

그동안 많은 AI 기업들은 글로벌 지표인 AAII(Artificial Analysis Intelligence Index) 같은 공인 벤치마크 점수를 올리는 데 사활을 걸어왔다. 실제로 탈락한 모티프테크놀로지스의 ’모티프 3’는 AAII에서 47점을 받아 4개 팀 중 최고 점수를 기록했다 [1]. 4개 팀 평균은 17.6점이었고 1위와 4위의 격차는 5.0점이었다.

하지만 실제 라이브 스트리밍과 현업 엔지니어들의 실사용 테스트에서는 사뭇 다른 양상이 나타났다.

모델 구분 벤치마크(AAII) 성향 실제 서비스 체감 성능 관찰된 주요 특징
모티프 (Motif) AAII 47점, 4개 팀 중 최고 [1] 정부 설명: 기술력은 뛰어나나 사용성·활용성에서 낮은 평가 [1] 필자가 써 본 인상으로는 추론·메타인지가 좋고 헛소리 억제력이 뛰어나다

네 번째 칸은 필자가 직접 써 보며 남긴 주관적 관찰이다. 공개된 평가 수치와는 성격이 다르다. | 솔라 (Solar / 업스테이지) | 실용 영역 집중 | 다음 단계 진출 [1] | 필자가 써 본 인상으로는 도구 연결, 웹 검색, 전후처리 하네스가 잘 갖춰져 비즈니스 작업에 맞다 |

실제 사용자들이 체감하는 성능 차이는 모델의 순수한 파라미터 지능보다, 그 앞뒤를 감싸고 있는 포스트 튜닝과 서빙 하네스(Harness)에서 비롯되었다.

  1. 벤치마크 게이밍(Benchmark Gaming)의 한계:
    • 정형화된 객관식 문제나 정형 데이터셋에서는 높은 점수를 받더라도, 실제 사용자가 던지는 모호하고 비정형적인 자연어 질문 앞에서는 어색한 문장이나 한국어와 영어가 뒤섞인 응답이 튀어나오기 쉽다.
  2. 하네스 처리의 결정적 역할:
    • 모델이 아무리 똑똑해도 외부 웹 검색, 파일 읽기, API 호출 결과를 깔끔하게 정제해 주는 하네스 레이어가 빈약하면 실전 생산성 도구로 쓰이기 어렵다.

[개념 짚고 가기: 하네스(Harness)란 무엇인가?]
야생마에게 고삐와 안장을 얹어야 사람이 안전하게 탈 수 있듯, LLM 두뇌가 실제 컴퓨터 환경에서 도구를 부르고 에러를 복구하며 안전하게 작업하도록 감싸주는 런타임 제어 인프라를 의미합니다.


2. 정부 평가 기준의 본질: ’단일 모델 1등’이 아닌 ‘산업 생태계’

이번 선발에서 많은 이들이 의아해했던 부분은 “왜 벤치마크 1등이 탈락했는가”였다. 하지만 공공 정책과 국가 주도 R&D의 관점에서 들여다보면 평가의 잣대가 완전히 달랐음을 알 수 있다.

평가 관점 벤치마크 중심 시각 정부 및 국가 전략 중심 시각
최우선 목표 특정 테스트 데이터셋 점수 극대화 국내 AI 산업 생태계 및 인프라 자립 기반 구축
핵심 평가 요소 단일 모델의 수학/코딩/추론 점수 벤치마크 40점(AAII 25 + NIA 15) + 전문가 35점 + 사용자 25점 [1]
인프라 활용 연구소 내부 GPU 연산 효율성 국가 단위 GPU 허브 구축(팀당 B200 768장에서 1,000장으로 확대) [1]
최종 지향점 세계 1위 모델 타이틀 온프렘·망분리 환경에서 작동하는 주권적 AI 역량

정부의 독파모 사업은 단순한 ’AI 경진대회’가 아니다.

  • 엔비디아 B200 GPU를 상반기 팀당 768장 지원했고 하반기에는 팀당 1,000장 수준으로 늘릴 계획이며(6개월 1,000장 임차 기준 팀당 약 400억 원) [1],
  • 국내 기업들이 프론티어급 모델을 처음부터 끝까지 직접 학습시켜 보는 대규모 엔지니어링 경험을 축적하게 하며,
  • 금융, 공공, 국방 등 민감한 망분리·온프레미스(On-premise) 환경에서도 독립적으로 돌릴 수 있는 AI 주권 인프라를 확보하는 것이 핵심 목표다.

다만 정부는 특정 한 항목이 당락을 갈랐다기보다 평가 항목이 종합적으로 반영된 결과라고 설명했다. 류제명 제2차관은 모티프의 상대적 약점으로 사용성·활용성을 지목했는데, 이 계열에 배정된 배점이 전문가 35점과 사용자 25점을 합쳐 60점이다 [1]. 사용자 평가에는 AI 전문 사용자진 49명과 일반 국민 185명이 참여했다.


3. 후보 모델들의 기술적 스펙과 물리적 현실

이번 독파모에 출사표를 던진 모델들은 글로벌 수준과 비교해도 결코 작지 않은 체급을 자랑한다.

구성 항목 공개 자료로 추정한 대략적 범위 (필자 정리) 의미 및 시사점
모델 파라미터 규모 200B ~ 750B (2,000억~7,500억 개) 글로벌 프론티어 모델에 준하는 대규모 밀집/MoE 구조
컨텍스트 윈도우 256k ~ 1M 토큰 책 수십 권 분량의 문서를 한 번에 읽고 추론 가능
사전학습 데이터양 약 10조 ~ 20조 토큰 한국어 코퍼스 + 대규모 다국어/코드 데이터 결합
개발 팀 규모 팀마다 편차가 크다 (대기업 연구원부터 소규모 스타트업까지) 조직 규모보다 레시피 최적화가 성능을 가르는 국면

주목할 점은 약 30명 수준의 작은 스타트업 팀이라도, 잘 정제된 데이터 파이프라인과 하이퍼파라미터 전이 레시피만 갖추면 수천억 개 파라미터의 대형 모델을 성공적으로 빚어낼 수 있다는 사실을 증명했다는 점이다.

하지만 이 오픈 웨이트 모델들을 일반 기업이나 개인이 직접 호스팅(서빙)하려면 막대한 VRAM과 인프라 비용이 든다. 결국 모델 가중치를 공짜로 배포하더라도, 이를 효율적으로 경량화하고 서비스로 패키징하는 능력이 시장의 성패를 가르게 된다.


4. 왜 결국 ’하네스(Harness)’와 ’서빙 인프라’가 승부처인가?

최근 AI 산업계의 가장 중요한 흐름 중 하나는 “파운데이션 모델 자체는 점차 범용재(Commodity)가 되어가고 있다”는 점이다.

패러다임 핵심 가치 집중 영역 시스템 구성 형태
과거 (모델 중심) 모델 가중치 (Weights) 단일 파운데이션 모델의 파라미터 크기와 순수 벤치마크 점수
현재 (시스템 중심) 엔터프라이즈 하네스 (Harness) [모델][격리 샌드박스 + 도구 게이트웨이 + 체크포인트][실무 워크플로우]

오늘 1등이었던 모델이 몇 달 뒤 오픈소스 커뮤니티나 해외 빅테크의 신규 모델에 의해 따라잡히는 일이 일상화되었다.

결국 특정 모델 하나에만 기대는 비즈니스는 위태로울 수밖에 없다. 모델이 무엇으로 바뀌든 상관없이 안정적으로 작동하는 하네스 인프라와 제어판(Control Plane)을 가진 기업만이 영구적인 해자(Moat)를 갖게 된다.

시스템 요소 단순 모델 호출 방식 엔터프라이즈 하네스 통합 방식
작업 실행 환경 로컬 셸 직접 실행 (보안 위험) 격리된 일회용 샌드박스 컨테이너 구동
품질 제어 (QA) 사람이 매번 육안으로 텍스트 검수 명확한 루브릭(Rubric) 기반 자동 평가 및 재시도
장애 복구 네트워크 순단 시 처음부터 다시 시작 체크포인트 기반 상태 저장 및 무중단 재개
모델 교체 유연성 프롬프트가 특정 모델에 종속됨 하네스 인터페이스 유지로 최신 모델 무중단 교체

실제로 디자인 조판, 폰트 생성, 복잡한 멀티 에이전트 코딩 같은 실무 현장에서는 모델의 감성적인 지능보다, 작업 결과를 수치화된 루브릭으로 검증하고 불합격 시 자동으로 재시도하게 만드는 평가 루프(Evaluation Loop) 설계가 생산성을 결정짓는다.


5. 차세대 AI 연구의 화두: 리처드 서튼의 지속학습(Continual Learning)

현재 가장 흥미로운 학술적 화두는 강화학습의 아버지로 불리는 리처드 서튼(Richard Sutton) 교수가 던진 질문이다. 서튼 연구진은 표준 딥러닝이 지속학습 환경에서 가소성을 잃어 결국 얕은 신경망만도 못하게 학습한다는 것을 보이고, 이를 막는 continual backpropagation을 제안했다 [5].

[개념 짚고 가기: 고정된 가중치 vs 지속학습(Continual Learning)]
지금의 대형 언어 모델들은 사전학습이 끝나면 뇌(가중치)가 단단하게 얼어붙습니다. 대화를 나누며 새로운 경험을 쌓아도 그 경험이 모델 자체의 지능으로 흡수되지 못합니다. 인간처럼 살아가며 실시간으로 지식을 누적하는 학습 방식을 지속학습이라고 부릅니다.

현재의 트랜스포머 기반 LLM은 정적인 지식 덩어리에 가깝다. 에이전트가 자율적으로 문제를 해결하고 스스로 똑똑해지려면, 다음과 같은 차세대 연구 방향이 뒷받침되어야 한다.

  1. 파라미터별 학습률 메타학습: 각 시냅스마다 지식을 받아들이는 유연성을 다르게 조절하여 과거 기억을 지우지 않으면서 새 지식을 흡수.
  2. 지속적 역전파(Continuous Backpropagation): 일부 연결을 무작위로 재설정하여 뇌 가소성(Plasticity)을 유지.
  3. 초저전력 대규모 추론: 흔히 20W 안팎으로 추정되는 인간의 뇌처럼, 적은 에너지로 끊임없이 학습하고 작동하는 구조 설계.

6. 엔지니어링 시사점: 벤치마크의 숫자를 넘어 현장으로

이번 독파모 4파전 사태가 우리에게 던져준 교훈은 명확하다.

  • 숫자 1등이 비즈니스 1등을 보장하지 않는다: 학술 벤치마크는 훌륭한 나침반이지만, 사용자가 지갑을 여는 기준은 정제된 답변, 빠른 응답 속도, 안정적인 도구 연동성이다.
  • 국가 인프라의 가치는 생태계 확산에 있다: 모델 파일 하나를 만드는 것에 그치지 않고, 이를 활용할 국내 개발자 커뮤니티와 온프렘 망분리 인프라를 함께 육성해야 진정한 AI 주권이 완성된다.
  • 엔지니어의 역할은 루브릭과 하네스 설계다: 모델의 코모디티화가 가속될수록, 비즈니스 목적에 맞는 정밀한 평가 기준(루브릭)을 세우고 에이전트가 안전하게 달릴 수 있는 하네스 레일을 까는 엔지니어링 역량이 무엇보다 중요해질 것이다.

요약 및 용어 정리

핵심 용어 쉬운 설명
독파모 독자 파운데이션 모델. 해외 기술 종속을 벗어나 국내 자체 기술로 개발하는 대규모 기반 인공지능 모델
AAII Artificial Analysis Intelligence Index. 글로벌 AI 모델들의 추론력, 코딩, 수학 능력을 종합 측정하는 대표 벤치마크
하네스 (Harness) 모델이 안전하게 외부 도구를 쓰고 상태를 복구할 수 있도록 감싸주는 런타임 제어 인프라
지속학습 (Continual Learning) 사전학습 이후에도 모델이 새로운 상호작용과 경험을 통해 실시간으로 뇌 가중치를 업데이트하는 차세대 학습 패러다임

참고 자료

이 글의 선발 결과·평가 기준·정부 방침 서술은 2026년 8월 18일 과학기술정보통신부의 독자 AI 파운데이션 모델 2차 단계평가 발표에 대한 아래 보도를 근거로 한다.