
핵심 내용
- GPT-5.6 Sol은 대부분의 직접 비교 벤치마크에서 앞섰지만, Grok 4.5는 가격과 속도, 토큰 사용량에서 우위를 보였다.
- 독립 평가기관은 Grok 4.5를 지능 부문 4위로 평가했으며, 환각 비율이 두 배 이상 증가한 54%를 기록했다고 밝혔다.
- 평가자들은 글쓰기와 장시간 코딩 작업에는 GPT-5.6을, 비용을 낮춰 대량의 작업을 처리하는 용도에는 Grok 4.5를 선호했다.
Grok 4.5와 GPT-5.6은 하루 차이로 출시됐다. OpenAI가 에이전트 코딩 평가에서 기록한 91.9%의 점수와 SpaceXAI가 제시한 입력 토큰 100만 개당 2달러의 가격을 두고 평가자들의 의견도 엇갈렸다.
Grok 4.5와 GPT-5.6 벤치마크 비교
SpaceXAI는 7월 8일 Grok 4.5를 출시했다. OpenAI는 하루 뒤 플래그십 모델 Sol과 더 저렴한 Terra, Luna 등급으로 구성된 GPT-5.6 제품군을 공개했다.
벤치마크 평가기관 Artificial Analysis는 새로운 Grok을 Intelligence Index에서 54점으로 평가했다. Grok 4.5는 Claude Fable 5, GPT-5.5, Opus 4.8에 이어 4위에 올랐다.
두 모델의 직접 비교에서는 OpenAI가 앞섰다. 한 잠정 점수표에서 GPT-5.6 Sol은 86점, Grok 4.5는 82점을 기록했다. 터미널 기반 에이전트 작업에서는 GPT-5.6 Sol이 91.9%, Grok 4.5가 83.3%를 기록하며 격차가 벌어졌다. 반면 코딩 평균 점수는 각각 64.7점과 64.6점으로 거의 차이가 없었다.
OpenAI는 최대 추론 설정을 적용한 Sol이 독립적인 Coding Agent Index에서 역대 최고인 80점을 기록했다고 밝혔다. Grok 4.5는 Grok Build 실행 환경에서 76점을 기록했다.
경제성에서는 반대 결과가 나타났다. Grok 4.5의 입력 가격은 토큰 100만 개당 2달러로, Sol의 5달러보다 낮다. 완료된 코딩 작업 하나에 들어간 비용도 Grok 4.5는 2.49달러였지만, Fable 5는 11.80달러였다.
코딩과 글쓰기, 일상 업무
실제 사용 평가에서도 비슷한 차이가 나타났다. 한 장기 작업용 평가 환경에서 Sol은 실제 코드 저장소를 이용한 100개 이상의 작업 가운데 63.7%를 시행착오 없이 완료했다. 복잡한 여러 단계의 체크리스트를 수행하면서도 작업의 방향을 놓치지 않았다.
별도의 독립 코딩 테스트에서는 Sol이 100점 만점에 92점, Grok 4.5가 87점을 기록했다. Grok 4.5의 점수는 성능이 가장 뛰어난 오픈 웨이트 모델들과 비슷한 수준이었다.
글쓰기 평가에서도 GPT-5.6 Sol을 선호하는 흐름이 나타났다. 초기 평가자들은 Sol을 일상적으로 사용하는 주력 모델로 설명했으며, 일반적인 지식 업무의 약 80%를 처리할 수 있다고 평가했다. 경쟁 모델보다 스타일 가이드도 더 충실하게 따르는 것으로 나타났다.
Grok 4.5는 속도와 지시 이행 능력으로 맞섰다. 실제 업무에 적용한 평가자들은 첫 시도에서 깔끔한 결과물을 만들었고, 구조화된 출력도 안정적으로 제공했다고 밝혔다. 응답 시간은 5초 미만이었으며 출력 속도는 초당 약 80토큰이었다.
문제는 정확도였다. Grok 4.5의 측정된 환각 비율은 25%에서 54%로 증가했다. 사실 정확도 역시 52%로 개선됐지만, 환각 비율도 두 배 이상 높아졌다.
전문가 평가와 신뢰성 논쟁
일론 머스크는 Grok 4.5를 “Opus급 모델이지만 더 빠르고, 토큰 효율이 높으며, 비용도 낮다”고 소개했다.
일부 분석가들은 벤치마크 점수의 차이보다 가격 차이가 더 중요하다고 주장했다. 작업 하나를 처리할 때 Grok 4.5는 약 190만 토큰을 사용한 반면, Fable 5는 약 720만 토큰을 사용했기 때문이다.
회의적인 평가자들은 신중하게 볼 만한 이유가 있다고 지적했다. 출시 당시 공개된 일부 점수가 개발사 자체 발표에 의존했고, 별도의 모델 카드도 제공되지 않았다는 것이다.
Cursor는 Grok 4.5가 실수로 자사 코드베이스를 학습한 사실이 확인된 뒤 내부 벤치마크 하나를 철회했다.
GPT-5.6에도 별도의 문제가 있다. OpenAI는 시스템 카드를 통해 GPT-5.6이 이전 모델보다 지시 범위를 넘어서는 행동을 더 자주 보인다고 인정했다.
두 모델의 경쟁은 업계가 크게 흔들린 시기의 마지막을 장식했다. SpaceX는 2월 xAI를 흡수했고, 6월에는 Cursor를 600억 달러에 인수했다. 이후 Grok 4.5 출시 이틀 전 AI 조직의 명칭을 SpaceXAI로 변경했다.
OpenAI의 Sol은 6월 말 정부 검토로 인해 공개가 제한된 상태였다. 공개 벤치마크 선두를 유지하고 있던 Anthropic의 Fable 5도 19일간의 이용 중단을 거친 뒤 7월 1일에야 다시 제공되기 시작했다.