목록으로

AI

Arbor, 같은 예산에서 Claude Code·Codex보다 2.5배 높은 최적화 성과

BeanCon
AI 최적화 프레임워크가 여러 격리 실험 브랜치를 검증해 성능을 개선하는 모습을 표현한 유사 이미지

Renmin University와 Microsoft Research가 제안한 Arbor는 가설 트리와 격리된 작업 트리를 활용해 AI 에이전트의 장기 최적화 성능을 끌어올리는 프레임워크다.

AI 에이전트 최적화의 병목: 반복은 많지만 학습은 적다

AI 에이전트가 코드베이스나 검색 파이프라인을 자동으로 개선하는 시대가 열리고 있지만, 단순히 더 오래 실행한다고 더 나은 결과가 나오지는 않는다. 여러 실험이 뒤섞이면 어떤 변경이 성능 향상에 기여했는지 추적하기 어렵고, 실패에서 얻은 교훈도 다음 시도에 제대로 반영되지 않는다.

VentureBeat 보도에 따르면 Renmin University of China와 Microsoft Research 연구진은 이 문제를 해결하기 위해 Arbor라는 AI 최적화 프레임워크를 제안했다. Arbor는 실험을 단순한 반복이 아니라 누적되는 연구 과정으로 다루도록 설계됐다.

Arbor의 핵심: 코디네이터와 실행자를 분리

Arbor는 전략을 담당하는 장기 실행 코디네이터와, 개별 실험을 수행하는 단기 실행자로 역할을 나눈다. 코디네이터는 직접 코드를 수정하지 않고 전체 연구 상태를 관리하며, 어떤 가설을 다음에 실험할지 결정한다.

실행자는 코디네이터가 지정한 하나의 가설만 맡아 격리된 git worktree에서 코드를 수정하고 평가를 실행한다. 이 구조 덕분에 여러 아이디어를 서로 섞지 않고 검증할 수 있으며, 어떤 변경이 실제 성능 향상으로 이어졌는지 더 명확하게 추적할 수 있다.

가설 트리로 실패와 성공을 모두 기억한다

Arbor의 중심에는 Hypothesis Tree Refinement, 즉 가설 트리 정제 방식이 있다. 각 노드는 가설, 실행 가능한 산출물, 실험 증거, 요약된 통찰을 함께 보관한다. 성공한 실험뿐 아니라 실패한 실험도 “다시 반복하지 말아야 할 조건”으로 남는다.

예를 들어 RAG 파이프라인을 최적화한다면, 하나의 에이전트가 청킹 전략, 검색 방식, 프롬프트를 한꺼번에 바꾸는 대신 Arbor는 각각을 별도 가설로 분리한다. 각 가설은 독립 환경에서 검증되고, 결과는 트리에 축적된다.

검증 게이트로 과적합과 보상 해킹을 줄인다

AI 에이전트 최적화에서 자주 발생하는 문제는 개발 지표만 좋아지는 ‘가짜 진전’이다. Arbor는 이를 줄이기 위해 검증 게이트를 둔다. 실행자가 높은 개발 점수를 보고하더라도, 코디네이터는 별도 격리 환경에서 보류된 평가 데이터로 다시 검증한다.

테스트 점수가 실제로 개선될 때만 해당 결과가 현재 최선의 trunk에 병합된다. 이 방식은 자동화된 실험이 단순히 평가 지표를 속이는 방향으로 흐르지 않도록 제어하는 역할을 한다.

동일 예산에서 2.5배 이상 성능 향상

연구진은 Arbor를 실제 AI 개발 과제와 MLE-Bench Lite 같은 머신러닝 엔지니어링 벤치마크에서 평가했다. VentureBeat는 Arbor가 Codex와 Claude Code 같은 강력한 코딩 에이전트와 동일한 자원 예산에서 평균 상대 향상 폭이 2.5배 이상 컸다고 전했다.

BrowseComp 과제에서는 기준 정확도 45.33%를 67.67%까지 끌어올렸고, Codex와 Claude Code는 각각 50%, 53.33% 수준에서 멈췄다고 소개됐다. Terminal-Bench 2.0 실험에서도 개발 점수보다 보류 데이터에서 더 잘 일반화되는 결과를 보였다는 점이 강조됐다.

기업 도입 시 장점과 비용

Arbor는 기존 Git 워크플로 위에 얹을 수 있도록 설계됐다. 결과물은 일반적인 git branch 형태로 나오므로, 기존 코드 리뷰와 CI, 사람의 검토 과정을 그대로 거칠 수 있다. 메인 저장소는 개발자가 명시적으로 승격하기 전까지 건드리지 않는다.

하지만 비용도 있다. 장기 실행 코디네이터를 유지하고 여러 격리 worktree에서 실험을 돌리려면 토큰 비용, 계산 자원, 디스크 리소스가 필요하다. 따라서 실시간 응답이 필요한 작업이나 명확한 한 줄 수정에는 맞지 않는다.

어디에 적합한가

Arbor가 잘 맞는 영역은 신뢰할 수 있는 평가 지표가 있고, 여러 실험 방향을 탐색할 가치가 있으며, 긴 시간 동안 누적 개선을 시도할 수 있는 작업이다. 예를 들면 RAG 파이프라인 최적화, 데이터 합성 품질 개선, 모델 학습 레시피 튜닝, 검색 에이전트 개선 등이 있다.

반대로 평가 지표 자체가 부정확하면 Arbor도 그 잘못된 지표를 더 빠르게 최적화할 뿐이다. 결국 이 프레임워크의 성능 상한은 평가자의 품질에 묶인다. AI 에이전트 자동화가 실질적인 엔지니어링 성과로 이어지려면, 반복 루프뿐 아니라 무엇을 검증할지에 대한 설계가 함께 필요하다.

댓글

0

댓글을 불러오는 중입니다.