그록 4.6(Grok 4.6) 성능은 얼마나 좋아졌을까? AI 에이전트부터 벤치마크까지 총정리

개발 테크
7시간 전
조회수
65

그록 4.6에 대해 정리했습니다.그록 4.5가 출시된 지 한 달도 되지 않아 새로운 모델 그록 4.6이 공개되며 관심을 끌고 있습니다.

그록 4.5는 빠른 속도와 비용 효율성으로 주목받았지만, 긴 작업의 안정성과 사실 정확성에서는 아쉬움이 남아 상위 프론티어 모델과 비교하면 다소 부족하다는 평가도 있었습니다.

새로 출시된 그록 4.6은 이러한 부분을 보완하면서 코딩과 AI 에이전트 작업, 복잡한 지식 업무 처리 능력을 한층 강화되며, 주요 벤치마크에서도 상위 프론티어 모델들과 비슷한 수준의 성적을 기록해 다시 한번 주목받고 있는데요.

과연 그록 4.6은 이전 모델보다 얼마나 개선됐을까요? 이번 글에서는 달라진 점과 주요 성능을 함께 정리해보았습니다.

 

그록 4.6(Grok 4.6) 핵심 요약

  • 장시간 실행되는 AI 에이전트 작업 성능이 강화됐습니다. 여러 단계에 걸쳐 조사·분석·코딩을 이어가는 긴 작업에 초점을 맞췄고, 이전 모델보다 복잡한 흐름을 안정적으로 처리하는 방향으로 개선됐습니다.
  • 주요 벤치마크에서 프론티어 모델 수준의 성능을 기록했습니다. Artificial Analysis Intelligence Index를 비롯한 여러 벤치마크에서 Fable 5와 GPT-5.6 Sol에 근접한 점수를 기록하며 상위 모델의 퍼포먼스를 보여주고 있습니다.
  • 코딩과 기술 업무 처리 능력이 한층 강화됐습니다. 코드베이스 여러 부분을 오가며 수정하거나, 복잡한 기술 문제를 여러 단계로 나눠 해결하는 능력이 개선되면서 에이전트형 코딩 작업에서 활용도가 높아졌습니다. 
  • Grok 4.6은 아직 일반 채팅 모드에는 적용되지 않았습니다. 일반 채팅에서는 현재 Grok 4.5까지만 지원해, Grok 4.6을 사용하려면 Grok Build를 이용하거나 Cursor, xAI API, OpenRouter, Vercel, Cloudflare 등 지원 플랫폼을 통해 접근해야 합니다. 

 

그록 4.6(Grok 4.6)이란?

그록 4.6의 특징을 담은 gif용 이미지입니다.

* 이미지 출처:* 이미지 출처: xAI Grok 4.6 소개 페이지 

Grok 4.6은 xAI가 공개한 프론티어급 코딩 에이전트 모델입니다. 복잡한 코드 작성과 디버깅, 여러 단계로 이어지는 에이전트 작업, 대규모 정보 분석에 강점을 보이도록 설계됐습니다.

최대 50만 토큰의 컨텍스트 윈도우를 지원해 대형 코드베이스와 여러 문서, 누적된 작업 지시를 함께 검토할 수 있습니다. 텍스트와 이미지를 이해하는 멀티모달 기능도 갖춰 이미지 자료를 분석하거나 이를 바탕으로 설명을 요청할 수 있습니다.

Low, Medium, High, xHigh로 추론 강도도 조절할 수 있어, 간단한 요약부터 복잡한 개발 작업과 장시간 에이전트 업무까지, 작업 난도와 목적에 맞춰 활용할 수 있습니다.

 

그록 4.5 vs 4.6, 무엇이 달라졌을까?

1. 복합 코딩 에이전트 작업에 더 초점을 맞췄습니다

Grok 4.5가 코드 작성과 도구 활용을 중심으로 한 모델이었다면, Grok 4.6은 여러 단계가 이어지는 개발 작업에 더 중점을 뒀습니다. 

한두 줄의 코드를 고치는 작업보다 요구사항 해석, 코드 탐색, 구현, 검증이 함께 필요한 코딩 에이전트 업무에 맞춰 발전시킨 모델로, 코드베이스를 살피고 문제 원인을 찾은 뒤, 관련 파일을 수정하고 테스트와 검증까지 마무리하는 흐름을 겨냥했습니다.

2. xHigh 추론 옵션을 추가했습니다

Grok 4.6은 기존 추론 옵션에 xHigh 옵션을 추가해 복잡한 버그 분석, 여러 모듈에 걸친 기능 구현, 설계 검토처럼 더 깊은 판단이 필요한 작업까지 처리할 수 있도록 했습니다.

단순 문서 작업이나 짧은 수정에는 Low를, 복잡한 코드 분석과 장시간 에이전트 작업에는 xHigh를 선택하는 식으로 업무 성격에 맞춘 활용 폭이 넓어졌습니다. 

3. 캐시 입력 가격이 조정됐습니다

기본 API 가격은 두 모델 모두 입력 100만 토큰당 2달러, 출력 6달러로 같습니다. 다만 반복 작업에 적용되는 캐시 입력 가격은 Grok 4.6에서 약 66.7% 높아졌습니다.

일반 컨텍스트의 캐시 입력 가격은 100만 토큰당 0.30달러에서 0.50달러로, 장문 컨텍스트는 0.60달러에서 1달러로 높아져, 같은 코드베이스와 작업 지시를 반복해서 사용하는 코딩 에이전트 환경에서는 비용 부담이 커질 수 있습니다.

 

그록 4.6(Grok 4.6)의 벤치마크 성능은?

Artificial Analysis의 종합 평가결과

Artificial Analysis에서 측정한 그록 4.6의 벤치마크 성능입니다.

* 이미지 출처: 

* 이미지 출처: artificialanalysis.ai 홈페이지

Artificial Analysis의 종합 평가에서 Grok 4.6 High는 Intelligence Index 61점을 기록하며 프론티어 모델 상위권에 근접한 성능을 보였습니다. GPT-5.6 Sol Max와 같은 점수였고, Fable 5 Max와도 1점 차이에 그쳤습니다. Grok 4.5 High와 비교하면 5점 높아진 수치로, 전반적인 성능이 크게 향상됐습니다.

지식 업무형 에이전트 성능에서도 강점을 드러냈습니다. GDPval-AA v2에서는 1,753 Elo를 기록해 Fable 5 Max의 1,741 Elo와 GPT-5.6 Sol Max의 1,728 Elo를 앞섰습니다. AA-Briefcase에서도 1,577 Elo로 Fable 5 Max의 1,574 Elo보다 높은 점수를 받았습니다.

종합 지능 점수는 Fable 5 Max보다 근소하게 낮았지만, 자료를 조사하고 분석한 뒤 결과물까지 완성해야 하는 장기 지식 업무에서는 상위 모델과 대등하거나 앞서는 성과를 냈습니다. 

Grok 4.6이 복합적인 업무를 수행하는 AI 에이전트에 초점을 맞춰 성능을 강화했음을 보여주는 결과입니다.

 

주요 벤치마크로 확인한 그록 4.6의 성능 

평가 항목

Grok 4.6 High

Fable 5 Max

GPT-5.6 Sol Max

Grok 4.5 High

AA Intelligence Index61점62점61점56점
GDPval-AA v21,753 Elo1,741 Elo1,728 Elo1,526 Elo
CursorBench v3.269.9%70.5%67.2%66.7%
DeepSWE v1.165.9%70.0%73.0%54.0%
FrontierCode v1.1 Extended61.3%64.9%60.6%56.6%
APEX-Agents57.5%59.2%56.7%47.1%
Terminal-Bench v3.026.0%34.1%34.6%15.7%
APEX-SWE56.4%58.8%-53.6%
AA-Briefcase1,577 Elo1,574 Elo1,502 Elo1,313 Elo
Harvey LAB15.8%11.3%2.5%12.9%

 

지식 업무와 장기 리서치에서 강점

AA Intelligence Index에서 Grok 4.6 High는 61점을 기록해 GPT-5.6 Sol Max와 같은 수준에 도달하는 모습을 보였습니다.종합 지능 평가에서 프론티어 모델군과 경쟁할 수 있는 수준까지 올라선 결과입니다.

실제 직무형 지식 업무를 평가하는 GDPval-AA v2에서는 1,753 Elo로 비교 모델 가운데 가장 높은 점수를 받았습니다. 문서를 검토하고 정보를 조사한 뒤 결과물을 만드는 업무 흐름에서 강점을 보였다는 뜻입니다.

장기 지식 업무를 평가하는 AA-Briefcase에서도 1,577 Elo를 기록해 Fable 5 Max의 1,574 Elo를 앞섰습니다. Harvey LAB에서도 15.8%로 가장 높은 점수를 받아, 전문 자료를 읽고 판단하는 업무형 에이전트에 특화된 성능을 보여줬습니다.

 

상위권의 코딩 에이전트 성능

Grok 4.6 High는 실제 개발 환경에서 자주 발생하는 작업을 평가하는 CursorBench v3.2에서 가장 높은 점수를 받은 Fable 5 Max와 불과 0.6% 낮은 69.9%를 기록하며 상위 프론티어 모델에 근접한 성능을 보여주었습니다. 

이 밖에도 DeepSWE v1.1, FrontierCode v1.1 Extended, APEX-SWE 등 코딩 에이전트 성능을 평가하는 항목에서 모두 이전 모델보다 높은 점수를 기록했습니다.

복합적인 개발 작업을 다루는 여러 평가에서 성능을 끌어올리며, Grok 4.6은 프론티어 모델과 경쟁하는 상위권 코딩 에이전트 모델로 자리 잡았습니다.

 

그록 4.6(Grok 4.6)의 비용은 어떻게 될까?

항목

프롬프트 20만 토큰 미만

프롬프트 20만 토큰 이상

입력 100만 토큰

$2.00

$4.00

캐시 입력 100만 토큰

$0.50

$1.00

출력 100만 토큰

$6.00

$12.00

컨텍스트 윈도우

최대 500,000토큰

최대 500,000토큰

  • Grok 4.6의 기본 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러입니다. 다만 반복 대화나 장시간 에이전트 작업에서는 출력 토큰이 빠르게 늘 수 있어 입력 가격만으로 전체 비용을 계산하면 실제 지출과 차이가 날 수 있습니다.
  • 캐시 입력 가격은 100만 토큰당 0.5달러입니다. 안정적으로 캐시를 활용하려면 설정이 필요합니다. xAI는 prompt_cache_key 등을 사용해 같은 서버로 요청을 라우팅하는 방식을 권장합니다. 캐시가 적용되지 않으면 일반 입력 가격이 적용될 수 있습니다.

 

그록 4.6(Grok 4.6) 사용 시 주의사항

1. 20만 토큰을 넘으면 요청 전체에 장문 요금이 적용됩니다

Grok 4.6은 프롬프트 토큰이 20만 개를 넘는 순간, 해당 요청의 입력·캐시 입력·출력 토큰 모두 장문 요금으로 계산됩니다.

캐시로 재사용한 토큰도 20만 토큰 기준에 포함되기에, 대형 저장소 전체나 이전 대화 내용을 매번 그대로 넣으면 비용이 빠르게 커질 수 있습니다. 

코드 검색으로 관련 파일만 선별하고, 이전 대화는 요약하거나 컨텍스트 압축 기능으로 정리해 필요한 정보만 유지하는 방식이 효율적입니다.

2. 캐시 적용 여부를 응답값으로 확인해야 합니다

코딩 에이전트 작업에서는 이미 확인한 내용이 다음 요청에도 계속 전달되어, 캐시를 적용하지 않으면 작업이 길어질수록 비용이 커집니다. 이런 불필요한 재계산을 줄이기 위해 prompt_cache_key 또는 x-grok-conv-id를 설정해야 합니다.

두 설정은 동일한 대화 흐름의 요청을 같은 서버로 라우팅해, 반복되는 코드베이스 정보와 대화 이력을 더 낮은 캐시 입력 가격으로 처리할 수 있도록 도와줍니다.

3. 민감한 데이터는 기본 보관 정책을 고려해야 합니다

xAI는 API로 보낸 프롬프트와 응답을 암호화한 상태로 30일간 보관합니다. 학습에는 사용하지 않지만, 그 기간에는 외부 서비스인 xAI 서버에 데이터가 남아 있게 됩니다.

계약상 민감한 정보를 외부 서비스에 보관할 수 없는 경우에는 ZDR을 활성화해 프롬프트와 응답이 xAI 서버에 저장되지 않도록 설정할 수 있습니다. 

다만 ZDR은 팀 단위로 적용되며, 대화 이력과 파일을 서버에 저장해야 하는 상태 저장형 Responses API, Files API, Collections API, Batch API는 사용할 수 없습니다. 

따라서 민감한 정보를 처리하는 업무와 일반 데이터를 처리하는 업무를 구분하고, 각각에 맞는 API 설정으로 운영해야 합니다.

 

AI 경쟁, '가장 똑똑한 모델’보다 

'끝까지 수행하는 모델’로

과거에는 추론 능력이나 벤치마크 점수가 모델 성능을 판단하는 핵심 기준이었다면, 이제는 여러 단계의 작업을 계획하고 실행하며 AI 에이전트 작업 끝까지 완성할 수 있는지가 더욱 중요해지고 있습니다. 

Grok 4.6 역시 단순한 답변 성능을 높이는 데서 그치지 않고, 장시간 이어지는 조사와 분석, 코드 수정, 애플리케이션 구현처럼 복잡한 작업을 안정적으로 수행하는 방향으로 발전했습니다. 

ChatGPT와 Claude, Gemini에 이어 Grok까지 가세한 AI 에이전트 경쟁. 앞으로는 어떤 모델이 더 똑똑한지를 넘어, 실제 업무를 얼마나 안정적으로 끝까지 수행할 수 있는지가 경쟁의 핵심이 될 것으로 보입니다. 

 

함께 읽으면 도움이 되는 콘텐츠

그록 AI 사용법, 이렇게까지 되는지 몰랐습니다. 이미지·영상 생성부터 마케팅 전략까지 한 번에

Grok Build, 터미널로 들어온 Grok 코딩 에이전트 사용법

Paseo란? AI 코딩 에이전트를 원격으로 관리하는 오픈소스 워크스페이스 사용법

 

AI 에이전트 기반 개발 환경 구축,

검증된 IT 프리랜서와 시작하세요.

대한민국 최대 IT 프리랜서 매칭 플랫폼 이랜서

이랜서는 27년간 삼성 · 현대 · SK · 카카오 등 주요 기업에 매칭하며 축적한 8만 건 이상의 IT 프리랜서 매칭 데이터를 바탕으로, AI 에이전트 시스템 구축 경험과 클라우드 실무 역량을 갖춘 검증된 전문가를 매칭합니다.

단순 이력서 연결이 아닌, 프로젝트 성격과 기술 스택, 활용 모델, 협업 방식까지 고려한 정밀 매칭으로 98%의 재의뢰율을 달성하고 있습니다.

AI 에이전트 기반 개발 환경을 기획부터 구축, 운영 자동화까지 안정적으로 추진하세요. 프로젝트에 적합한 AI 전문 프리랜서를 24시간 내, 매칭해 드립니다.

 

AI-전문-개발자-이랜서

FAQ

freelancerBanner
projectBanner
댓글0
이랜서에 로그인하고 댓글을 남겨보세요!
0
/200
이랜서에 로그인하고 댓글을 남겨보세요!
0
/200
실시간 인기 게시물
이랜서 PICK 추천 게시물