카테고리
에이전트 실행 환경
-

AI 채점관은 반박 한 번에 판정을 25~71% 뒤집는다
AI 성능을 비교할 때 다들 벤치마크 점수부터 본다. 그런데 그 점수 자체가 흔들린다면 어떨까. Meta Superintelligence Labs가 공개한 실험 결과가 딱 그 지점을 찔렀다 — AI가 다른 AI의 답을 채점할 때, 반박을 한 번 던지는 것만으로…
카테고리

AI 성능을 비교할 때 다들 벤치마크 점수부터 본다. 그런데 그 점수 자체가 흔들린다면 어떨까. Meta Superintelligence Labs가 공개한 실험 결과가 딱 그 지점을 찔렀다 — AI가 다른 AI의 답을 채점할 때, 반박을 한 번 던지는 것만으로…