Grok 4.7 출시, 무엇이 달라졌나? 핵심 변화·벤치마크 총정리

SpaceX의 xAI가 새로운 AI 모델 Grok 4.7을 공개했습니다. 코딩 성능으로 호평을 받았던 Grok 4.6이 나온 지 불과 한 달여 만인데요.
지난 버전이 코딩 능력을 높이는 데 집중했다면, 이번에는 복잡한 과제를 더 오랜 시간 안정적으로 처리하는 능력을 강화했다고 합니다.
OpenAI의 Astra와 Anthropic의 Fable 5.1에 이어 등장한 Grok 4.7은 어떤 변화를 보여줄까요? 이전 버전에서 달라진 점과 주요 기능을 함께 살펴보겠습니다.
Grok 4.7 핵심 요약
- 오래 걸리는 코딩 작업에 강해졌습니다. 여러 단계로 이어지는 개발 과제를 처리하고, 작성한 코드를 스스로 검토하며 작업의 맥락을 유지하는 능력을 개선했습니다.
- 문서와 발표 자료 작성 능력도 좋아졌습니다. 전문 업무 수행 능력을 평가하는 GDPval과 AA Briefcase에서 Grok 4.6보다 높은 성과를 보였습니다.
- 코딩 평가에서 주요 프론티어 모델과 경쟁할 만한 성능을 보였습니다. 공개된 CursorBench 4.0 평가에서 Grok 4.7은 46.3%를 기록하며 GPT-5.6 Sol의 41.7%를 웃돌았습니다.
- 성능은 높이고 기본 모델의 API 가격은 그대로 유지했습니다. Grok 4.6과 같은 요금으로 이용할 수 있습니다. 별도로 제공하는 Fast 버전은 출력 속도가 두 배 빠르고, 요금도 두 배입니다.
Grok 4.7이란?
Grok 4.7은 SpaceXAI가 2026년 9월 21일 공개한 최신 AI 모델로, 코딩과 문서 작성처럼 여러 단계를 거쳐 오랜 시간 수행해야 하는 업무에 초점을 맞췄습니다.
이전 버전보다 큰 기반 모델을 사용하고, 해결에 수 시간이 필요한 어려운 과제를 더 많이 학습했습니다. 작업 중 결과를 스스로 점검하고, 앞서 처리한 내용을 이어받아 다음 작업을 진행하는 능력도 높여, 여러 과정을 수행하는 AI 에이전트에 한층 더 친화적인 모델로 출시되었습니다.
Grok 4.6 vs Grok 4.7, 무엇이 달라졌을까?
1. 복합 코딩 에이전트 작업의 완성도를 높습니다.
Grok 4.6은 코드베이스를 읽고 기능을 구현하는 긴 개발 작업을 처리했습니다. Grok 4.7은 여기서 더 나아가 코드 탐색, 수정, 테스트, 오류 원인 분석, 재수정까지 이어지는 작업 흐름을 더 오래 유지하도록 개선했습니다.
긴 문맥을 관리하고 자체 검증하는 능력도 강화해, 코드 수정, 테스트, 오류 원인 분석, 재수정이 이어지는 개발 작업에서 이전 단계의 판단을 이어가며 결과를 점검하는 AI 에이전트 작업에 더 안정적인 모습을 보입니다.
2. Grok Bot 실행 환경을 모델 학습에 직접 반영했습니다
Grok 4.6도 다양한 에이전트 환경과 코딩·지식 업무를 학습했습니다. Grok 4.7은 여기에 Grok Bot 하네스를 이해하도록 학습을 추가했습니다.
사용자의 지시를 받고 작업을 진행하며, 결과를 확인한 뒤 후속 작업을 이어가는 이 환경에 맞춰 학습해, 단발성 질문 답변보다, 업무 맥락을 이어가며 여러 차례 지시와 피드백을 주고받는 작업에 더 적합하도록 개선했습니다.
3. 안전장치를 새로 구성했습니다
Grok 4.7은 Grok 4.6보다 보안 분야의 판단 기준을 강화했습니다. 단순히 위험한 단어를 포함했는지 확인하는 수준을 넘어, 요청이 취약점을 해결하려는 방어 업무인지 실제 공격에 활용하려는 요청인지 구분하도록 요청의 의도와 맥락을 판단하는 능력을 높였습니다.
그래서 사용자의 지시가 실제 공격이나 위험한 행위로 이어질 경우 자체적으로 거절하거나 제한해 보안 사고 위험을 줄이면서, 취약점 원인 분석, 보안 코드 수정, 점검 결과 정리처럼 업무상 필요한 작업은 AI에 맡기고 위험한 요청은 통제할 수 있게 개선했습니다.
Grok 4.7의 벤치마크 성능
평가 항목 | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 | 1,657점 | 1,546점 | 1,487점 | 1,678점 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
Grok 4.7은 공개된 모든 비교 항목에서 Grok 4.6보다 높은 수치를 기록했습니다.
특히 장기 코딩 작업을 평가하는 CursorBench 4.0에서는 46.3%로 4.6보다 5.9%p, 실제 터미널 환경에서 여러 단계를 수행하는 Terminal-Bench 4.0에서는 38.0%로 17.7%p 높은 수치를 보였습니다.
이는 코드 생성 후 끝나는 작업보다 코드베이스를 확인하고, 명령어를 실행하고, 오류를 수정한 뒤 결과를 검증하는 AI 에이전트 작업에서 개선 폭이 컸다는 의미입니다.
장기간 AI 에이전트 업무에 맞춰 개선된 모델답게 작업 실행 능력이 모두 높아졌습니다.
전기공학과 법률 업무에서
비교 모델 중 가장 높은 성능을 보였습니다
전기공학 문제를 평가하는 EEBench에서 64.0%로 비교 모델 중 가장 높은 점수를 기록했습니다. Grok 4.6보다 11.0%p 높고, GPT-5.6 Sol과 Fable 5.1도 앞섰습니다.
기술 문서를 해석하고, 공학적 제약을 고려해 해결 방향을 제시해야 하는 업무에서 강점을 보입니다.
법률 업무를 평가하는 Harvey Legal Agent Benchmark에서도 19.6%로 비교 모델 가장 높은 수치를 기록했습니다. Grok 4.6보다 3.8%p 높은 수치로, 전문 자료를 읽고 핵심 조건을 정리하며, 여러 정보를 바탕으로 판단을 내려야 하는 지식 업무의 처리 능력이 강화됐습니다.
반면 모든 항목에서 좋은 성적을 보이지는 않았습니다. CursorBench, AA Briefcase, Terminal-Bench, HealthBench에서는 Fable 5.1 보다 낮게 측정되었고, DeepSWE에는 GPT-5.6 Sol이 더 높은 점수를 기록했습니다.
모든 분야에서 성능를 압도하기보다 장기 에이전트 작업과 전문 지식 업무의 성능을 집중적으로 높여 이전보다 실무 활용도를 한 층 높인 모델임을 볼 수 있습니다.
Artificial Analysis의 종합 평가 결과

* 이미지 출처: Artficial Analysis X 계정 게시물
Artificial Analysis의 종합 평가에서 Grok 4.7 xhigh는 Intelligence Index 46점을 기록했습니다. Fable 5.1과 GPT-6 Astra의 53점보다는 낮은 수치입니다. 다만 종합 점수만으로 모델의 활용도를 판단하기보다, 실제 업무와 가까운 개별 평가를 함께 볼 필요가 있습니다.
지식 업무와 장기 에이전트 작업에서는 Grok 4.7의 강점이 뚜렷합니다. 실제 업무 결과물을 만드는 능력을 평가하는 GDPval-AA v2.1에서 1,695 Elo를 기록해 GPT-6 Astra의 1,542 Elo를 앞섰고, Fable 5.1의 1,735 Elo와도 40 Elo 차이로 근접했습니다.
장기 지식 업무를 평가하는 AA-Briefcase v1.1에서도 1,657 Elo를 기록했습니다. Fable 5.1의 1,678 Elo와 21 Elo 차이이며, GPT-6 Astra의 1,569 Elo보다 높습니다. 자료를 조사하고 분석한 뒤 문서, 스프레드시트, 발표 자료처럼 바로 활용할 수 있는 결과물로 완성하는 업무에서 경쟁력을 보인 수치입니다.
업무 자동화 평가인 AutomationBench-AA에서는 66%를 기록해 Fable 5.1의 59%를 앞섰고, GPT-6 Astra의 68%와도 근접했습니다. 여러 서비스에서 정보를 확인하고, 조건에 맞춰 다음 작업을 수행하는 흐름에서 강점을 보입니다.
반면 터미널 기반 코딩 작업인 Terminal-Bench 4.0에서는 26%로 Fable 5.1의 52%, GPT-6 Astra의 59%보다 낮았습니다. 긴 문서를 지속적으로 참조하는 AA-LCR v1.1에서도 두 모델에 뒤처졌습니다.
Grok 4.7은 모든 작업에서 최고 성능을 보이는 모델은 아니지만, 코드 작업부터 자료 분석과 업무 자동화까지 폭넓은 업무 흐름에 활용할 수 있는 모델입니다.
Grok 4.7의 비용
모델 | 프롬프트 길이 | 입력 토큰 | 캐시 입력 토큰 | 출력 토큰 |
Grok 4.7 | 200K 토큰 미만 | $2 / 100만 토큰 | $0.50 / 100만 토큰 | $6 / 100만 토큰 |
Grok 4.7 | 200K 토큰 이상 | $4 / 100만 토큰 | $1 / 100만 토큰 | $12 / 100만 토큰 |
Grok 4.7 Fast | 200K 토큰 미만 | $4 / 100만 토큰 | $1 / 100만 토큰 | $12 / 100만 토큰 |
Grok 4.7 Fast | 200K 토큰 이상 | $6 / 100만 토큰 | $1.50 / 100만 토큰 | $18 / 100만 토큰 |
- Grok 4.7의 기본 API 가격은 Grok 4.6과 같습니다. 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러이며, 20만 토큰 이상 장문 컨텍스트 요청은 입력 4달러, 출력 12달러가 적용됩니다. 모델을 4.6에서 4.7로 변경해도 토큰당 단가는 오르지 않습니다.
- 단가는 같지만 실제 작업 비용은 늘어날 수 있습니다. Grok 4.7은 긴 작업에서 더 많은 추론 토큰을 사용할 수 있으므로, 장기 리서치나 복잡한 AI 에이전트 작업에서는 요청당 총 토큰 사용량을 함께 확인해야 합니다.
- Grok 4.7 Fast는 응답 속도가 두 배 빠른 대신 토큰당 비용이 더 높습니다. 긴 작업을 빠르게 끝내야 하는 긴급한 코딩·에이전트 업무에는 적합하지만, 장시간 실행되는 작업에서는 일반 Grok 4.7보다 총비용이 커질 수 있습니다.
Grok 4.7 사용시 주의사항
1. xhigh 설정은 작업당 비용과 응답 시간을 키울 수 있습니다
Grok 4.7은 복잡한 작업에서 더 오래 추론하는 방식으로 성능을 높입니다. Artificial Analysis 평가에서 xhigh 설정은 작업당 약 8만 1,000개의 출력 토큰을 사용했습니다.
간단한 문서 정리, 코드 설명, 초안 작성까지 xhigh를 적용하면 성능 대비 비용과 응답 시간이 불필요하게 커집니다.
일반 업무에는 medium이나 high를 사용하고, 여러 단계의 분석·구현·검증이 필요한 작업에만 xhigh를 적용하는 방식이 적합합니다.
2. 500K 컨텍스트를 무제한 대화처럼 사용하면 안 됩니다
Grok 4.7은 500K 토큰 컨텍스트를 지원하지만, 프롬프트가 200K 토큰을 넘으면 장문 컨텍스트 요금이 적용됩니다. 대화와 도구 실행 결과를 계속 누적하면 비용과 응답 지연이 함께 커집니다.
장기 AI 에이전트 작업에서는 이전 대화 전체를 반복해서 전달하기보다, 완료한 작업·결정 사항·남은 작업을 압축해 다음 단계로 넘겨야 합니다.
컨텍스트가 한도를 넘은 뒤에는 압축 기능으로 복구할 수 없으므로, 초과하기 전에 관리해야 합니다.
3, Grok 4.7 Fast는 공개 xAI API에서 사용할 수 없습니다
Grok 4.7 Fast는 일반 모델과 같은 성능을 더 빠르게 제공하지만, Cursor와 Grok Build에서만 사용할 수 있습니다. 공개 xAI API 기반 서비스에는 일반 Grok 4.7을 적용해야 합니다.
최신 AI 에이전트 소식이 궁금하다면
GPT-6 Astra 사용법, 주요 성능부터 실제 활용 사례, 주의사항까지 총정리
Gemini 3.8 Flash 출시, 빠른 속도로 제공되는 프론티어급 성능
클로드 Fable 5.1 출시, 벤치마크 성능·주요 활용 사례까지 총정리
AI 에이전트 기반 개발 환경 구축,
검증된 IT 프리랜서와 시작하세요.
대한민국 최대 IT 프리랜서 매칭 플랫폼 이랜서
이랜서는 27년간 삼성 · 현대 · SK · 카카오 등 주요 기업에 매칭하며 축적한 8만 건 이상의 IT 프리랜서 매칭 데이터를 바탕으로, AI 에이전트 시스템 구축 경험과 클라우드 실무 역량을 갖춘 검증된 전문가를 매칭합니다.
단순 이력서 연결이 아닌, 프로젝트 성격과 기술 스택, 활용 모델, 협업 방식까지 고려한 정밀 매칭으로 98%의 재의뢰율을 달성하고 있습니다.
AI 에이전트 기반 개발 환경을 기획부터 구축, 운영 자동화까지 안정적으로 추진하세요. 프로젝트에 적합한 AI 전문 프리랜서를 24시간 내, 매칭해 드립니다.

