하네스 설정 두 개가 ARC-AGI-3 점수를 바꿨다

TL;DR

openai.com의 「How enabling two settings tripled our scores on the ARC-AGI-3 benchmark」는 ARC-AGI-3 분석입니다.

GPT-5.6 Sol은 7.8%에서 13.3%, 38.3%로 달라졌고, 출력 토큰은 6x 줄었습니다.

내일 점검할 것은 모델보다 평가 하네스와 배포 하네스의 설정 일치 여부입니다.

ARC-AGI-3의 낮은 점수는 모델만의 문제가 아니었습니다

openai.com의 「How enabling two settings tripled our scores on the ARC-AGI-3 benchmark」는 ARC-AGI-3 분석입니다. 원문은 두 설정이 점수를 바꿨다고 밝힙니다. ARC-AGI-3는 2D 퍼즐 게임 벤치마크입니다.

GPT-5.6 Sol은 7.8%에 그쳤습니다. GPT-5.5는 0.4%에 머물렀습니다. OpenAI는 이 차이가 모델 능력만으로 설명되지 않는다고 봤습니다.

핵심은 유지된 추론과 압축입니다. 이 둘을 켜자 점수는 크게 올랐고, 출력 토큰은 6x 줄었습니다.

모델 점수와 하네스 설정의 비교 구조
모델 점수와 하네스 설정의 비교 구조

숫자는 모델 성능보다 하네스 차이를 더 크게 보여줍니다

원문은 점수와 하네스 조건을 함께 제시합니다. 점수는 사람 기준과 비교되는 방식으로 읽어야 합니다. 모델은 채점 방식을 미리 알지 못하고, 중간 점수도 보지 못합니다.

항목 무엇을 재는 값인지
GPT-5.6 Sol의 기본 점수 7.8% ARC-AGI-3에서의 기본 성능입니다.
GPT-5.5의 기본 점수 0.4% 같은 벤치마크에서의 기본 성능입니다.
공식 하네스의 GPT-5.6 Sol 13.3% 공개 집합에서 공식 하네스를 쓴 성능입니다.
유지된 추론과 압축 후 점수 38.3% 공개 집합에서 설정을 바꾼 뒤의 성능입니다.
출력 토큰 변화 6x 감소 같은 과제에서의 토큰 사용량 변화입니다.
문맥 한도 175,000 문자 오래된 메시지가 사라지는 기준입니다.
구현 한도 175,000 토큰 실제 구현이 둔 한도입니다.
평균 인간 테스터 48% 공식 게임 로그로 추정한 인간 기준입니다.

원문은 이렇게 적습니다.

With the official harness, GPT‑5.6 Sol scored 13.3% on the ARC-AGI-3 public set. With retained reasoning and compaction, it scored 38.3%. When the conversation context exceeds 175,000 characters, the oldest messages are discarded. our implementation uses a limit of 175,000 tokens instead of characters

원문은 점수를 사람 기준과 비교하는 지표로 설명합니다. 또한 모델은 채점 방식을 미리 알지 못하고, 중간 점수도 보지 못합니다.

공식 하네스는 기억을 지우고 오래된 행동도 숨겼습니다

ARC-AGI-3 하네스는 의도적으로 단순하게 설계됐습니다. 도구도 없고, 특별한 기능도 없습니다. ARC는 이런 하네스가 모델의 약점을 더 잘 드러낸다고 봤습니다.

상용 개발자는 반대로 모델 특징에 맞춰 하네스를 바꾸기도 합니다.

OpenAI는 문제의 일부가 모델이 아니라 하네스라고 봤습니다. 기존 하네스는 각 행동 뒤에 비공개 추론을 버렸습니다. 그래서 GPT-5.6 Sol은 매번 처음부터 게임을 다시 해석해야 했습니다.

과거의 계획과 통찰도 볼 수 없었습니다. 기록에는 이전 행동과 짧은 메모만 남았습니다. 하네스는 또 순환 절단을 썼습니다.

문맥이 길어지면 오래된 메시지가 사라졌습니다. 그래서 이전의 행동도 보이지 않게 됐습니다. 결국 추론과 기억이 동시에 끊겼습니다.

원문은 이것이 학습 저하를 설명한다고 말합니다.

기억 보존 방식 비교 구조
기억 보존 방식 비교 구조

평가 설정을 배포 설정과 맞춰야 결과가 흔들리지 않습니다

원문이 주는 실무적 메시지는 분명합니다. 모델 비교는 모델만 보는 일이 아닙니다. 하네스 설정도 함께 봐야 합니다.

내일 점검할 항목은 세 가지입니다. 첫째, 장기 작업에서 추론 기록을 버리고 있지 않은지 봅니다. 둘째, 긴 문맥에서 오래된 메시지를 어떻게 줄이는지 봅니다.

셋째, 평가 하네스가 배포 하네스와 같은지 봅니다.

원문은 Responses API 하네스로 전환했을 때 추론이 이어진다고 설명합니다. 또한 압축을 켜자 학습한 내용을 더 잘 보존했다고 밝힙니다. 점수도 올라갔고, 출력 토큰도 줄었습니다.

즉, 성능 저하는 모델 한 줄이 아니라 설정 묶음에서 나올 수 있습니다.

평가 설정 점검 흐름
평가 설정 점검 흐름

자주 묻는 질문

ARC-AGI-3에서 GPT-5.6 Sol 점수가 낮았던 이유는 무엇입니까?

원문은 하네스 설정이 원인이라고 밝힙니다. 비공개 추론이 버려지고 오래된 메시지도 사라졌습니다.

유지된 추론과 압축을 켜면 점수는 얼마나 오릅니까?

원문에 따르면 GPT-5.6 Sol의 점수는 38.3%까지 올라갑니다. 출력 토큰도 6x 줄어듭니다.

순환 절단은 왜 문제입니까?

원문은 175,000 문자을 넘기면 오래된 메시지가 사라진다고 밝힙니다. 그 결과 이전 행동과 맥락을 다시 볼 수 없습니다.

원문: 「How enabling two settings tripled our scores on the ARC-AGI-3 benchmark」