​


AI 모델에 한 시간 동안 ‘스타크래프트: 브루드 워’ 봇을 제작하게 한 벤치마크에서 GPT-6 Astra가 1위를 차지했다. 클로드 오퍼스 5.5가 근소한 차이로 뒤를 이었지만, 인간 개발자가 만든 최상위 봇에는 두 모델 모두 크게 미치지 못했다.


카이 맥피터스는 26일 AI 모델의 장기 추론과 코딩 에이전트 성능을 평가하는 ‘스타스커미시 벤치(StarSkirmish Bench)’ 결과를 공개했다.


스타스커미시 벤치는 AI가 게임을 실시간으로 직접 조작하는 방식이 아니다. 각 AI 모델에 한 시간의 제한 시간을 주고 C++로 프로토스 봇을 작성하게 한 뒤, 완성된 봇을 다른 AI 모델 및 인간 개발자가 만든 기존 봇과 대결시켰다.


AI에는 코드 컴파일과 연습 경기 실행, 경기 기록 분석 도구가 제공됐다. 연습 경기에서 확인한 빌드 순서와 전투 결과, 자원 상황을 바탕으로 코드를 수정하는 과정도 한 시간 안에 스스로 진행했다.


이번 평가에는 총 10개 AI 모델이 참가했다. 각 모델은 동일한 환경에서 다섯 차례 봇을 제작했으며, 이렇게 만들어진 AI 봇 50개와 인간이 작성한 경쟁용 봇 9개, 기본 예제 봇 3개가 경기를 치렀다.


전체 참가 봇은 62개로, ‘하트브레이크 리지’, ‘벤젠’, ‘데스티네이션’ 등 3개 전장에서 모두 프로토스 대 프로토스 방식으로 경쟁했다. 모든 봇이 상대마다 6경기씩 치르며 총 1만 1,346경기가 진행됐다.


벤치마크 점수는 인간이 작성한 최상위 봇 ‘스타더스트’를 100점, 가장 약한 기본 예제 봇 ‘포 게이트 드라군’을 0점으로 놓고 산정했다.

GPT-6 Astra는 51점으로 AI 모델 가운데 가장 높은 점수를 기록했다. 클로드 오퍼스 5.5가 50점으로 뒤를 이었고, GPT-6 Sol이 46점으로 3위에 올랐다. 운영진은 GPT-6 Astra와 클로드 오퍼스 5.5가 사실상 동률이며, GPT-6 Sol까지 세 모델이 나머지 참가 모델보다 뚜렷하게 앞섰다고 평가했다.


이어 GLM 5.3이 19점, 제미나이 3.8 플래시가 18점을 기록했다. GPT-6 Luna와 그록 4.7은 각각 14점, 뮤즈 스파크 1.3은 10점, MiMo V2.6 Pro는 9점, 딥시크 V4.1 플래시는 4점에 그쳤다.


전체 경기 성적에서는 클로드 오퍼스 5.5가 1,830경기 중 1,444승을 거둬 78.9%의 승률을 기록했다. GPT-6 Astra는 1,441승과 78.7%의 승률을 올렸다. 단순 승률은 클로드 오퍼스 5.5가 조금 높았지만, 상대 전력까지 반영한 평균 Elo에서는 GPT-6 Astra가 1,992점으로 클로드 오퍼스 5.5의 1,979점을 앞섰다.


모델마다 선호하는 전략도 달랐다. GPT-6 Astra는 빠르게 가스를 채취하고 다양한 고급 유닛을 확보하는 운영을 선보였으며, 특히 리버를 다른 모델보다 적극적으로 사용했다.


클로드 오퍼스 5.5는 상대 병력보다 충분한 우위를 확보한 뒤 공격하는 신중한 모습을 보였다. 옵저버를 적극적으로 배치해 다크 템플러에 대응했고, GPT-6 Astra와의 직접 대결에서는 60%의 승률을 기록했다.


GPT-6 Sol은 다섯 차례의 제작 과정에서 모두 드라군 중심의 정석적인 운영을 선택했다. 완성한 봇 사이의 Elo 편차도 참가 모델 가운데 가장 작아 비교적 안정적인 성능을 보였다. 비용 대비 성능에서도 높은 평가를 받았다.


반면 그록 4.7은 하이 템플러와 캐리어를 포함한 여러 전략을 시도했지만, 가장 좋은 성적을 기록한 봇은 단순한 질럿 4기 러시를 사용했다. 제미나이 3.8 플래시는 개발 도중 실패한 변경 사항을 되돌린 뒤 기본 다크 템플러 예제에 약 30줄의 코드를 추가한 봇으로 두 번째로 좋은 결과를 냈다.


다만 AI가 인간 개발자의 최상위 봇을 넘어선 것은 아니다. 스타더스트는 366경기에서 365승을 기록했으며 Elo는 2,779점에 달했다. GPT-6 Astra가 작성한 봇들도 스타더스트를 상대로는 한 번도 승리하지 못했다.


이번 결과는 제한된 맵에서 진행된 프로토스 동족전과 한 시간의 개발 시간에 기반한다. 스타크래프트 전체 실력이나 일반적인 프로그래밍 능력을 그대로 의미하지는 않는다. 운영진은 앞으로 AI에 더 긴 추론 및 개발 시간을 제공하는 새로운 버전의 벤치마크를 선보일 계획이다.



출처:
https://starskirmish.com/bench/