제미나이 4 아르곤(Argon) 출시 정리, 구글은 AI 왕좌를 되찾을 수 있을까?

밸런스 UP
6시간 전
조회수
19

구글 제미나이 4 아르곤 별자리 이미지

Google이 오랜 공백 끝에 새로운 최상위 프론티어 모델 Gemini 4 Argon을 공개했습니다. 

Gemini 3.5 Pro의 출시 계획이 무산된 뒤 Flash 계열에 집중해왔던 Google이 다시 OpenAI와 Anthropic의 최상위 모델 경쟁에 뛰어든 것인데요.

극강의 프론티어 모델들 사이에 이를 갈고 돌아온 Gemini 4가 과연 어느정도의 퍼포먼스를 보여줄 수 있을지 주요 특징부터 가격, 벤치마크와 실제 활용 가능성까지 살펴보겠습니다.

 

제미나이 4 아르곤(Argon) 핵심 요약

  • 복잡한 업무를 더 오래 이어서 처리할 수 있습니다. 최대 출력을 64K에서 1M 토큰으로 확대해 대규모 코드 수정이나 긴 리서치처럼 결과가 길어지는 작업에서 한 번에 처리할 수 있는 범위를 넓혔습니다..
  • 코딩뿐 아니라 금융·법률·업무 자동화까지 최상위 성능을 노립니다. 장시간 개발과 여러 도구를 활용한 조사·판단 능력을 높여 복잡한 전문 업무에서도 경쟁 모델보다 높은 평가를 받았습니다.
  • 사이버보안 성능도 크게 높아졌습니다. 취약점 탐색과 검증, 수정까지 이어지는 보안 업무 성능을 강화해 일반적인 범용 AI를 넘어 전문 보안 업무까지 활용 범위를 넓혔습니다. 
  • 초기 프로모션 가격을 공격적으로 낮췄습니다. 프론티어급 성능을 제공하면서도 GPT 6 Astra나 Opus 5.5 보다 약 50~80% 낮은 기본 API 가격으로 사용할 수 있습니다. 

 

제미나이 4 아르곤(Argon)이란?

제미나이 4 아르곤 공식 이미지

* 이미지 출처: Gemini 4 Argon 블로그 페이지

Gemini 4 Argon은 Google DeepMind가 공개한 Gemini 4 계열의 최상위 프론티어 모델로, 복잡하고 장시간 이어지는 업무를 깊게 추론해 끝까지 처리하는 데 초점을 맞춘 모델입니다.

지난 6월에 출시될 것으로 예상되었던 3.5 Pro가 다른 프론티어 모델의 뛰어난 성능으로 인해 출시가 미뤄지고 이후 두 차례의 Flash 모델을 출시하다 새로 공개되었는데요.

소프트웨어 개발뿐 아니라 금융·법률 같은 전문 지식 업무, 여러 문서와 시각 자료 분석, 사이버보안처럼 여러 단계의 판단과 실행이 필요한 작업에서 뛰어난 벤치마크 성능을 보여주며 프론티어 모델의 상위 성능 탈환을 예고하고 있습니다.

 

Gemini 4 아르곤(Argon), 무엇이 달라졌을까?

1. 최대 출력이 100만 토큰으로 크게 늘었습니다

Argon의 가장 특이한 변화 중 하나는 최대 출력 토큰을 기존 64K에서 1M으로 확대한 것입니다.

모델이 하나의 작업 안에서 더 많은 추론·코드·도구 실행 결과를 이어갈 수 있게 작업 처리 공간 자체를 크게 늘려

대규모 코드 마이그레이션이나 장시간 리서치처럼 길어지는 작업도 수십만 줄의 코드베이스를 분석하거나 여러 자료를 연결해 긴 보고서를 만드는 업무도 하나의 긴 작업 흐름을 유지할 수 있을 정도로 성능을 높였습니다.

 

2. 기업의 전문 업무 처리 능력을 크게 높였습니다

Argon은 실제 기업에서 사람이 처리하는 전문 업무까지 수행하는 데 초점을 맞춘 모델입니다.

금융·법률·세무 같은 전문 지식을 바탕으로 여러 자료를 찾고 → 비교하고 → 조건을 판단한 뒤 → 도구를 활용해 최종 결과물까지 만드는 연속 처리 능력을 강화했습니다.

실제 업무형 벤치마크에서도 높은 성능을 보여, 여러 단계의 확인과 판단이 필요한 복잡한 전문 업무를 더 안정적으로 처리할 수 있는 모델로 평가받고 있습니다.

 

3. 긴 문서와 영상까지 연결해서 이해하는 능력이 좋아졌습니다

Argon은 긴 문서와 영상처럼 많은 정보를 한 번에 처리하는 Long Context·멀티모달 능력도 강화했습니다.

단순히 긴 내용을 기억하는 데 그치지 않고, 앞부분과 뒷부분의 정보를 연결하고 여러 문서·차트·영상 속 내용을 함께 비교해 필요한 정보를 찾아내는 능력이 좋아졌습니다.

여러 계약서를 동시에 검토하거나, 여러 보고서와 차트를 함께 분석하고, 긴 영상 속 특정 장면과 내용을 찾아 정리하는 것처럼 많은 자료를 한 번에 확인하고 연결해서 판단해야 하는 업무에서 활용도가 높습니다.

 

4. 사이버보안까지 최상위 모델의 핵심 기능으로 가져왔습니다

Argon은 일반적인 범용 모델이면서도 사이버보안 방어 성능을 크게 강화한 모델로 개발됐습니다.

단순히 취약점을 알려주는 데서 끝나는 것이 아니라 취약점 탐색 → 검증 → 수정까지 자동으로 이어갈 수 있도록 설계돼, 보안 점검과 대응 업무를 하나의 흐름으로 처리할 수 있습니다.

Google에 따르면 이러한 높은 사이버보안 성능 때문에 Argon은 곧바로 일반 사용자에게 공개하지 않고, 검증된 사이버보안 조직부터 제한적으로 제공하고 있습니다.

 

Gemini 4 아르곤(Argon)의 벤치마크 성능은?

평가 항목

Gemini 4 Argon

GPT-6 Astra

Claude Opus 5.5

Claude Fable 5.1

DeepSWE v1.1 장기 코딩

77.9%

74.1%

74.2%

67.4%

Terminal-Bench 4.0 

터미널 에이전트

57.4%

58.2%

66.4%

57.9%

AutomationBench 

업무 자동화

51.3%

41.4%

42.5%

31.4%

Finance Agent v2 

금융 리서치

65.4%

53.5%

58.6%

58.9%

Harvey Legal Agent 

법률 업무

19.6%

5.4%

3.8%

6.7%

Terminal-Bench Science 

과학 연구

57.6%

68.1%

63.3%

52.6%

GraphWalks 256K~1M 

장문 이해

84.2%

71.8%

66.8%

65.0%

LVBench 

긴 영상 이해

91.7%

87.5%

83.7%

79.7%

CWE-bench v1

보안 취약점

68.0%

68.0%

67.0%

58.0%

 

1. 기업 업무에서는 가장 강한 모습을 보입니다

금융·법률·업무 자동화에서는 Argon이 경쟁 모델보다 가장 높은 결과를 기록했습니다.

특히 AutomationBench 51.3%, Finance Agent 65.4%, Harvey Legal Agent 19.6%를 기록해, 여러 자료를 확인하고 판단한 뒤 실제 업무까지 이어가는 기업용 AI 에이전트 성능에서 강점이 뚜렷합니다. 

2. 장기 코딩은 강하지만 모든 코딩에서 1위는 아닙니다

실제 장기간 소프트웨어 개발을 평가하는 DeepSWE에서는 77.9%로 가장 높은 성능을 기록했습니다.

반면 터미널에서 여러 명령을 실행하는 Terminal-Bench 4.0에서는 Opus 5.5의 66.4%보다 낮은 57.4%로 대규모 코드 수정과 개발에서는 강하지만 터미널 중심의 에이전틱 코딩에서는 Opus 5.5가 여전히 앞서고 있습니다.

3. 긴 자료를 처리하는 능력이 특히 돋보입니다

GraphWalks 장문 평가에서 84.2%, LVBench에서 91.7%를 기록해 경쟁 모델을 크게 앞서는 모습을 보이고 있니다.

긴 문서와 영상 속 정보를 오래 유지하고 서로 연결해 판단하는 능력이 강해, Google Drive·Docs·Sheets 같은 구글 업무 도구와 결합했을 때 여러 자료를 한 번에 분석하고 결과물까지 이어가는 활용성이 기대됩니다. 

 

Artificial Analysis에서는 어떻게 평가했을까?

Gemini 4 Artificial Analysis 벤치마크 이미지

* 이미지 출처: Artificial Analysis

Artificial Analysis에서도 최상위권 성능을 보이고 있습니다.

Artificial Analysis 평가에서 Gemini 4 Argon은 Intelligence Index 53점으로 GPT-6 Astra와 같은 최상위권 성능을 기록했습니다. 

업무 자동화에서는 경쟁 모델보다 높은 결과를 보였지만, 터미널 기반 코딩에서는 Sonnet 5.5와 Opus 5.5보다 낮아 모든 AI 에이전트 업무에서 가장 뛰어난 것은 아니었습니다. 

특히 눈에 띄는 부분은 할루시네이션입니다. 환각률이 15%로 최상위권 모델 가운데 가장 낮아, 모르는 내용을 억지로 만들어내기보다 정확하게 구분하는 능력이 강하게 나타났습니다. 

여기에 프로모션 기준 작업당 비용도 Astra보다 낮아 높은 지능과 업무 자동화 성능을 비교적 낮은 비용으로 활용할 수 있다는 점이 Argon의 강점으로 보입니다.

 

Gemini 4 아르곤(Argon) 가격은?

항목

Gemini 4 Argon

GPT-6.1 Sol

Claude Sonnet 5.5

Claude Opus 5.5

GPT-6 Astra

Claude Fable 5.1

입력 100만 토큰

$2.00

$2.00

$2.00

$4.00

$10.00

$10.00

캐시 입력/읽기

$0.10

$0.10

$0.20

$0.20

$1.00

$0.25

출력 100만 토큰

$10.00

$10.00

$10.00

$20.00

$50.00

$50.00

프로모션 종료 후 입력

$4.00

-

-

-

-

-

프로모션 종료 후 출력

$20.00

     
  • Gemini 4 Argon의 초기 API 가격은 입력 100만 토큰당 $2, 출력 $10입니다. 캐시 입력에는 95% 할인이 적용돼 $0.10 수준입니다. 
  • 현재 초기 가격 기준으로는 GPT-6.1 Sol과 동일한 수준이며, Opus 5.5보다 절반, Astra와 Fable 5.1보다 5배 낮은 기본 토큰 가격입니다.
  • 프로모션 할인 기간이 끝나면 입력은 $4, 출력은 $20으로 두 배 올라갈 예정입니다..

 

Gemini 4 아르곤(Argon) 참고사항

1. 아직 모든 사용자가 사용할 수 있는 모델은 아닙니다

Argon은일반 사용자가 바로 Gemini 앱에서 선택하거나 모든 개발자가 API를 사용할 수 있는 상태는 아닙니다.

현재 Fairwind Program의 검증된 사이버보안 조직과 Google 내부 팀부터 제공되고 있으며, 유료 API 고객과 Google AI Ultra 사용자부터 순차적으로 확대할 예정입니다.

 

2. 기간 한정 프로모션 가격 적용중입니다

Gemini 4 Argon은 현재 입력 100만 토큰당 $2, 출력 $10의 초기 프로모션 가격으로 제공됩니다.

프로모션 종료 후에는 각각 $4와 $20으로 두 배 인상될 예정이기 때문에, 장기간 API를 사용할 계획이라면 현재 할인 가격만 기준으로 비용을 계산하지 않는 것이 좋습니다.

 

다시 프론티어 모델 경쟁에 뛰어든 구글

Argon은 아직 일반 사용자가 자유롭게 사용할 수 없지만, Google 내부에서는 이미 대규모 프로젝트에 활용되고 있습니다.

실제로 Google은 Argon 에이전트를 활용해 데이터센터 전체의 데이터를 분석하고 300TiB 이상의 메모리를 절감했으며, 향후 총 500TiB~1PiB까지 절감할 수 있을 정도로 뛰어난 효과를 예상하고 있습니다.

이전보다 훨씬 길어진 출력량과 함께 장기간 작업, 문서 소화력과 저렴한 비용을 바탕으로 프론티어 모델 경쟁에 다시 돌아온 구글.

Claude와 OpenAI와의 매서운 프론티어 경쟁에서 과연 Gemini 4 Argon이 실제 업무에서 얼마나 높은 퍼포먼스를 보여줄지가 앞으로의 중요한 관전 포인트가 될 것으로 보입니다. 

 

최신 AI 출시 소식이 궁금하다면?

GPT-6.1 Sol 출시, Astra급 성능을 이 가격에? 성능부터 벤치마크까지 직접 비교했습니다

Sonnet 5.5 출시, 30% 이상 빨라지고 작업 비용까지 낮춘 핵심 변화의 비밀

Grok 4.7 출시, 무엇이 달라졌나? 핵심 변화·벤치마크 총정리

FAQ

freelancerBanner
projectBanner
댓글0
이랜서에 로그인하고 댓글을 남겨보세요!
0자
/200자
이랜서에 로그인하고 댓글을 남겨보세요!
0자
/200자
실시간 인기 게시물
이랜서 PICK 추천 게시물