8B 모델로 오퍼스 4.5에 필적하다: 메타의 에보하네스-RL과 BPE 3분할 아키텍처
복잡하고 긴 호흡의 업무를 수행하는 AI 에이전트의 성패를 가르는 진짜 병목은 어디에 있을까?
많은 이들이 모델의 파라미터 크기(지능)를 꼽지만, 현업 엔지니어들이 마주하는 진짜 벽은 에이전트를 둘러싼 외부 실행 환경, 즉 ’하네스(Harness)’의 조율 한계다.
수시간에 걸쳐 데이터베이스를 이전하거나 복잡한 버그를 고치는 작업에서, 모델에게 무작정 모든 로그와 메모리를 프롬프트에 쏟아부으면 컨텍스트 오염(Context Congestion)과 비용 폭발이 발생한다. 그렇다고 사람이 일일이 “이럴 땐 이 도구를 쓰고 저 메모리를 읽어라”라며 휴리스틱 규칙을 짜두면, 환경이 조금만 바뀌어도 에이전트가 삐걱거리기 일쑤다.
최근 메타(Meta AI)와 미국 일리노이대 어배너-샴페인(UIUC) 연구진이 공개한 논문 《EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents》 [1]은 이 문제를 정면으로 돌파한다.
사람이 하네스 규칙을 일일이 짜주는 대신, 에이전트 스스로 외부 메모리와 도구를 언제 읽고, 업데이트하고, 정리할지 강화학습으로 훈련시키는 에보하네스-RL(EvoHarness-RL)을 제안한 것이다.
놀랍게도 단 8B 크기의 경량 모델(Qwen3-8B)이 이 방식을 통해 ALFWorld seen split에서 96.9% 성공률을 기록하며 클로드 오퍼스 4.5(Claude Opus 4.5)의 기본 ReAct 성능(96.4%)과 대등한 수준에 올라섰다. 논문은 이를 앞섰다가 아니라 effectively match, 즉 필적으로 표현한다. 그 핵심 메커니즘과 개인 개발자가 로컬 경량 모델에 적용할 수 있는 실전 인사이트를 알기 쉽게 정리했다.
1. 기존 하네스의 3대 한계와 ’누적형 메모리’의 함정
장기 작업을 수행하는 에이전트에게 하네스는 단순한 프롬프트가 아니라, 메모리, 상태 추적기, 도구 호출, 검증기, 제어 흐름을 모두 포괄하는 외부 실행 인프라다.
하지만 지금까지의 에이전트 시스템은 다음 3가지 구조적 한계에 갇혀 있었다.
| 기존 하네스 한계 | 발생하는 문제점 | 현장 결과 |
|---|---|---|
| 수동 규칙 의존 (Hard-coded) | 개발자가 상황별 도구 사용 규칙을 일일이 하드코딩함 | 환경 변화나 새 작업에 전혀 적응하지 못함 |
| 모델 변경 시 재작업 부담 | 모델마다 프롬프트 감도와 도구 인터페이스가 다름 | 모델을 바꿀 때마다 하네스 전체를 다시 튜닝해야 함 |
| 단순 누적형 메모리 오염 | 과거의 모든 시도와 로그를 프롬프트 뒤에 계속 덧붙임 | 실패한 시도와 낡은 정보가 쌓여 모델 판단을 교란함 |
비유하자면, 서랍에 낡은 영수증과 실패한 메모를 버리지 않고 계속 쑤셔 넣다 보니, 나중에는 정작 중요한 열쇠를 찾지 못해 작업이 마비되는 것과 같다.
2. BPE 3분할 작업 공간: 신념·진행·경험의 상태 추상화
메타 연구진은 복잡하고 제각각이던 하네스 구성요소를 BPE(Belief·Progress·Experience)라는 세 가지 핵심 상태로 우아하게 단순화했다.
| BPE 상태 계층 | 해결해야 하는 핵심 질문 | 관리하는 데이터 |
|---|---|---|
| 1. 신념 (Belief) | “현재 환경과 객체에 대해 무엇을 알고 있는가?” | 현재 파일 트리, 실행 로그, 환경 변수, 관측 상태 |
| 2. 진행 상황 (Progress) | “어떤 하위 목표를 끝냈고 무엇이 남아 있는가?” | 완료된 태스크 체크리스트, 남은 작업, 종속성 추적 |
| 3. 경험 (Experience) | “과거 시도에서 재사용 가능한 지식은 무엇인가?” | 에러 해결 노하우, 실패 사례, 성공 패턴, 검색 우선순위 |
에이전트는 이 BPE 작업 공간과 상호작용하기 위해 복잡한 API 대신 4가지 메타 행동(Meta-actions)만을 수행한다.
| 메타 행동 | 담당 역할 | 동작 예시 |
|---|---|---|
| 트랙 (track) | 현재 환경 상태를 확인하여 Belief 갱신 | “조리대 위에 주전자가 있는지 확인한다” |
| 커밋 (commit) | 완료된 하위 목표를 체크하고 Progress 기록 | “1단계: 데이터 백업 완료 ➔ 2단계: 스키마 변환 시작” |
| 리콜 (recall) | 과거 경험 저장소에서 관련 스킬과 주의점 검색 | “지난번 API 연동 실패 시 어떻게 우회했는지 확인” |
| 노트 (note) | 새롭게 발견한 사실이나 교정된 지식 기록 | “조리대에 주전자가 없었음. 스토브 위에 위치함” |
이 4가지 메타 액션 덕분에 에이전트는 어떤 도메인의 작업이든 일관된 정책 인터페이스로 외부 상태를 능동적으로 제어할 수 있게 된다.
[개념 짚고 가기: BPE(Belief·Progress·Experience)란?]
인간이 복잡한 프로젝트를 할 때 ‘현재 상황 파악(Belief)’, ‘체크리스트 관리(Progress)’, ’노하우와 실패 노트(Experience)’를 머릿속에 분리해 두고 일하듯, 에이전트의 외부 인지 상태를 세 갈래로 명확히 분리한 실행 아키텍처입니다.
3. 2단계 학습 파이프라인: SFT에서 비용 고려 GRPO 강화학습으로
에보하네스-RL의 진짜 핵심은 BPE 구조를 쥐어주는 데 그치지 않고, 하네스를 사용하는 판단 능력 자체를 강화학습으로 훈련시켰다는 점이다.
[ Step 1: 하네스 지도학습 (SFT) ]
Qwen3-8B ──▶ BPE 3개 상태의 의미와 4대 메타 행동 규격 학습
[ Step 2: 비용 고려 GRPO 강화학습 (RL) ]
성공 보상 + 행동 다양성 - [불필요한 하네스 호출 패널티] ──▶ 최적의 호출 정책 완성!
1단계: 하네스 지도학습 (Harness SFT)
먼저 경량 모델(Qwen3-8B)에게 BPE 상태의 의미와 track, commit, recall, note 4대 메타 행동을 언제 어떻게 호출해야 하는지 기초적인 행동 양식을 학습시킨다.
2단계: 비용을 고려한 GRPO 강화학습 (Cost-aware GRPO)
외부 하네스를 조회하는 것 역시 컴퓨팅 자원과 토큰 예산을 소비하는 행위다. 연구진은 GRPO(Group Relative Policy Optimization) 강화학습을 적용하면서, 단순 작업 성공뿐 아니라 불필요한 하네스 남발에 비용 패널티를 부여했다.
이를 통해 모델은 “무조건 외부 메모리를 뒤적거리는 것”이 아니라, “지금 외부 상태를 확인하는 것이 토큰 비용 대비 진짜 가치가 있는가”라는 판단을 스스로 저울질하며 행동하도록 진화했다.
4. 놀라운 벤치마크 결과와 2대 발현 현상
가정 내 복합 장기 작업 벤치마크인 ALF월드(ALFWorld)의 seen split에서 측정한 결과는 충격적이었다.
| 모델 및 시스템 | 파라미터 체급 | 성공률 (Success Rate) | 비고 |
|---|---|---|---|
| 기본 Qwen3-8B (ReAct) | 8B | 47.9% | 기본 ReAct 프롬프트 |
| + BPE Base (추론 전용) | 8B | 56.4% | 학습 없이 BPE 하네스만 장착 |
| + BPE SFT (지도학습) | 8B | 68.6% | 1단계 지도학습 적용 |
| + EvoHarness-RL (최종) | 8B | 96.9% | SFT + GRPO 강화학습 결합 |
| SkillOS | Qwen 계열 동급 | 80.2% | 기존 최고 스킬 에이전트 (원저 보고 수치) |
| SkillRL | Qwen 계열 동급 | 89.9% | 기존 강화학습 에이전트 (원저 보고 수치) |
| 클로드 오퍼스 4.5 (ReAct) | 초거대 플래그십 | 96.4% | 8B가 필적한 기준선 |
| 클로드 오퍼스 4.5 + BPE 하네스 | 초거대 플래그십 | 98.5% | 같은 하네스를 프론티어 모델에 적용한 최고치 |
단 8B 크기의 오픈소스 경량 모델이 거대 플래그십 모델인 클로드 오퍼스 4.5의 기본 성능(96.4%)에 도달했다. 차이는 0.5%포인트이고, 논문은 이를 통계적 우위가 아니라 필적으로 표현한다. 반복 실행에 따른 편차는 보고되지 않았다. 다만 같은 하네스를 오퍼스 4.5에 적용하면 98.5%로 여전히 앞선다. 하네스의 이득은 모델 체급과 무관하게 작동했다.
여기서 조건 하나를 분명히 해둬야 한다. 위 수치는 전부 학습 때 접한 환경(seen split) 기준이다. 처음 보는 환경(unseen split)에서는 기본 ReAct 50.0%, 프롬프트 전용 BPE 77.6%, SFT 69.4%, EvoHarness-RL 86.6%로 떨어지고 이 구간에는 프론티어 비교군이 아예 없다. 눈여겨볼 것은 unseen에서 SFT(69.4%)가 학습 없는 프롬프트 하네스(77.6%)보다 낮다는 점이다. 본문의 단조 상승 서사는 seen split에서만 성립한다.
또 하나. 논문의 실험은 ALFWorld 단일 벤치마크에 한정된다. 도입부에서 예로 든 DB 이전이나 버그 수정 같은 작업과는 성격이 다르다.
특히 학습 과정에서 두 가지 매우 흥미로운 창발적 현상이 관찰되었다.
[ 1. 하네스 어닐링 (Harness Annealing) ]
초기: [매 스텝마다 하네스 호출 / 외부 의존 극심]
➔ 학습 후: [내부 가중치로 체화되어 에피소드당 ~1회 꼭 필요할 때만 호출]
[ 2. 하네스 진화와 자기교정 (Harness Evolution) ]
경험 저장소의 중복·저효율 지식 자동 가지치기 + 환경 충돌 시 기존 기억 즉시 덮어쓰기(Note)
- 하네스 어닐링 (Harness Annealing):
- 초기에는 에이전트가 매 스텝마다 외부 메모리를 조회하며 불안해했지만, 반복적인 절차가 모델의 신경망 가중치 내부에 자리 잡자 하네스 호출이 급감하여 에피소드당 평균 1회 수준으로 최적화되었다.
- 하네스 진화와 자기교정 (Harness Evolution & Self-Correction):
- 과거 경험(Experience)에 “주전자는 조리대에 있다”고 적혀 있었더라도, 실제로 조리대에 없으면 과거 기억을 맹신하지 않고 스토브를 뒤진 뒤
note명령으로 기억의 오류를 스스로 정정했다.
- 과거 경험(Experience)에 “주전자는 조리대에 있다”고 적혀 있었더라도, 실제로 조리대에 없으면 과거 기억을 맹신하지 않고 스토브를 뒤진 뒤
5. 개인 개발자를 위한 로컬 경량 모델 BPE 적용 가이드
이 연구가 개인 개발자에게 주는 가장 큰 영감은 추론 시점의 BPE 하네스는 로컬 경량 모델만으로도 즉시 적용할 수 있다는 점이다.
다만 학습 과정까지 그대로 재현하려면 이야기가 다르다. 논문은 SFT 궤적 수집의 교사 모델이자 경험 저장소 통합 모델로 클로드 오퍼스를 사용했다(Appendix C). 96.9%를 낸 8B는 사실 오퍼스에서 증류된 8B이며, 같은 파이프라인을 돌리려면 프론티어 API가 필요하다.
개인 PC(RTX 3090 / 4090 단일 GPU 환경)에서 이 BPE 시스템을 구현하고 지속적으로 발전시키는 3단계 로드맵을 제안한다.
1단계: 파일 기반 BPE 작업 공간 설계 (Zero-Shot / In-Context)
별도의 모델 학습 없이도, 시스템 프롬프트와 파일 구조만으로 즉시 BPE를 구현할 수 있다.
/my-agent-workspace/
├── belief.json # 현재 프로젝트 상태, 파일 목록, 변수값
├── progress.md # 체크리스트, 완료된 서브태스크, 현재 진행 단계
└── experience/ # 자주 발생하는 에러 해결법, 성공한 코드 스니펫
실제로 논문에서도 모델을 재학습하지 않고 추론 시점에 BPE 인터페이스만 제공했을 때 GPT-4.1의 성공률이 47.9% ➔ 70.0%로, GPT-5가 60.7% ➔ 85.0%로 20%포인트 이상 급등했다.
2단계: 4대 메타 도구 파이썬 함수화
에이전트가 호출할 파이썬 REPL 도구로 4대 함수를 등록한다.
track(): 프로젝트 디렉터리 상태와 git status를 읽어belief.json반환.commit(task_id):progress.md의 완료 체크박스를 갱신.recall(query):experience/폴더 내 과거 트러블슈팅 마크다운 검색.note(title, solution): 새로운 에러 해결 패턴을 마크다운 파일로 저장.
3단계: 로컬 QLoRA + TRL 기반 GRPOTrainer 파이프라인
더 나아가 오픈소스 라이브러리(Unsloth, Hugging Face TRL)를 사용하면 24GB VRAM을 가진 로컬 그래픽카드 1장으로도 Qwen3-8B 또는 Llama-3.1-8B 모델에 비용 고려 GRPO 강화학습을 직접 올려볼 수 있다.
# 로컬 GRPOTrainer 개념 예시 (TRL 라이브러리 활용)
from trl import GRPOTrainer, GRPOConfig
def reward_function(completions, **kwargs):
rewards = []
for completion in completions:
success = evaluate_task_success(completion)
harness_calls = count_meta_actions(completion) # track, recall 호출 횟수
# 성공 보상 + 불필요한 하네스 남발 패널티
reward = (1.0 if success else 0.0) - (0.05 * harness_calls)
rewards.append(reward)
return rewards
이렇게 학습된 로컬 8B 모델은 외부 API 호출 비용 없이도, 자신의 하네스를 능동적으로 관리하며 복잡한 코딩과 장기 연구 작업을 스스로 완수하는 든든한 개인 비서로 진화하게 된다.
6. 결론: 하네스를 다루는 지능이 진짜 경쟁력이다
에보하네스-RL이 우리에게 던지는 메시지는 명확하다.
- 모델 크기보다 인터페이스와 훈련 방식이 중요하다: 무조건 수천억 개 파라미터의 거대 모델을 쓸 필요 없이, 잘 설계된 3분할 BPE 상태와 의사결정 강화학습만으로 8B 모델이 플래그십 수준의 성능을 낼 수 있다.
- 메모리는 누적이 아니라 정제와 교정이다: 모든 것을 무식하게 기억하는 메모리는 독이 된다. 환경과 충돌할 때 과거 지식을 덮어쓰고 불필요한 정보를 버리는 자기교정 루프가 핵심이다.
- 하네스 관리 능력 자체가 새로운 지능의 척도다: 프롬프트 엔지니어링의 시대를 지나, 에이전트가 자신의 외부 도구와 인지 작업 공간을 스스로 조율하는 메타 정책 학습이 차세대 AI 개발의 표준이 될 것이다.
요약 및 용어 정리
| 핵심 용어 | 쉬운 설명 |
|---|---|
| 하네스 (Harness) | 모델이 외부 도구, 메모리, 상태 추적기를 다룰 수 있도록 감싸주는 런타임 제어 계층 |
| BPE 작업 공간 | 에이전트의 인지 상태를 신념(Belief)·진행(Progress)·경험(Experience)의 3가지로 단순화한 통합 인터페이스 |
| 하네스 어닐링 | 학습 초기에는 외부 메모리를 남발하다가, 점차 지식이 모델 내부에 체화되면서 꼭 필요할 때만 호출하도록 안정화되는 현상 |
| GRPO | Group Relative Policy Optimization. 가치 신경망(Critic) 없이 후보군 간 상대적 보상을 비교해 효율적으로 정책을 최적화하는 강화학습 기법 |
참고 문헌 및 원문
- [1] Ning, X., Fu, D., Wei, T., Zeng, H., Bei, Y., Li, B., Li, Z., Wang, Q., Shen, X., & Wu, Y. (2026). EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents. Meta AI · UIUC. arXiv:2608.05446