GPT-6.1 Sol 출시, Astra급 성능을 이 가격에? 성능부터 벤치마크까지 직접 비교했습니다

밸런스 UP
7시간 전
조회수
66

GPT 6-1 Sol 출시 이미지

OpenAI가 새로운 GPT-6 계열의 고성능 범용 AI 모델 GPT-6.1 Sol을 출시했습니다. 

Anthropic의 Claude Sonnet 5.5가 공개된 바로 다음 날 등장한 모델이라 두 모델의 성능 비교에도 관심이 쏠리고 있습니다.

GPT-6.1 Sol은 최상위 모델인 GPT-6 Astra에 가까운 수준의 성능을 훨씬 낮은 비용으로 제공한다는 점에서 특히 주목받고 있는데요. 코딩과 컴퓨터 사용, 전문 업무까지 성능을 높이면서도 실제 작업당 비용은 줄여 가격 대비 성능을 크게 끌어올렸습니다.

그렇다면 GPT-6.1 Sol은 이전 GPT-6 Sol과 비교해 무엇이 달라졌고, 성능과 비용 효율은 얼마나 개선됐을까요? 주요 변화와 벤치마크, 가격을 중심으로 살펴보겠습니다.

 

GPT-6.1 Sol 핵심 요약

  • Astra에 가까운 성능을 훨씬 낮은 비용으로 제공합니다. 일부 코딩·에이전트 평가에서는 Astra와 비슷하거나 더 높은 결과를 보이면서도, 작업당 비용은 약 1/4 수준에 그쳤습니다.
  • 코딩·컴퓨터 사용·전문 업무 성능이 크게 높아졌습니다. 기존 GPT-6 Sol보다 복잡한 개발 작업과 여러 도구를 사용하는 AI 에이전트 업무까지 맡길 수 있는 범위가 넓어졌습니다.
  • 같은 작업을 더 적은 비용으로 처리합니다. 기본 입력·출력 가격은 GPT-6 Sol과 같지만, Max 기준 작업당 비용은 약 31% 낮아져 같은 예산으로 더 많은 업무를 처리할 수 있습니다.
  • 긴 프로젝트를 반복할수록 비용 부담이 더 줄어듭니다. 캐시 입력 가격이 100만 토큰당 $0.20에서 $0.10으로 절반으로 낮아져, 같은 코드베이스나 업무 지침을 반복해서 불러오는 AI 에이전트 작업에 유리합니다.

 

GPT-6.1 Sol이란?

GPT-6.1 Sol의 소개페이지 메인 이미지

* 이미지 출처: GPT 6.1 Sol 소개 페이지

GPT-6.1 Sol은 OpenAI가 개발한 GPT-6 계열의 고성능 범용 AI 모델로, GPT-6 Sol의 가격대를 유지하면서 Astra에 가까운 업무 성능을 제공하는 데 초점을 맞춘 후속 모델입니다.

성능은 더 높게, 속도는 더 빠르게, 가격은 더 낫게

105만 토큰의 컨텍스트와 최대 12만 8천 토큰 출력을 지원하며, 코딩과 컴퓨터 사용, 전문 문서 분석, 여러 단계가 연결된 AI 에이전트 업무를 처리하도록 설계됐습니다. 추론 수준은 Low부터 Medium, High, Xhigh, Max까지 조절할 수 있습니다. 

즉, 가장 어려운 문제를 처리하는 Astra와 저비용 모델 사이에서 실제 업무에 자주 사용하기 좋은 높은 성능과 비용 효율을 함께 가져가는 모델이라고 볼 수 있습니다.

 

벤치마크로 보는 

GPT-6.1 Sol의 변화

평가 항목

GPT-6.1 Sol

GPT-6 Sol

GPT-6 Astra

Claude Sonnet 5.5

Claude Opus 5.5

Intelligence Index 종합 지능

52

48

53

56

58

Terminal-Bench 4.0 에이전틱 코딩

56.1%

43.9%

59.1%

64%

60%

AutomationBench-AA 업무 자동화

64.9%

62%

68.5%

71%

70%

GDPval-AA v2.1 전문 업무

1,575

1,487

1,542

1,844

1,846

AA-Briefcase v1.1 장기 지식 업무

1,564

1,483

1,569

1,811

1,822

SciCode 과학 코딩

54.2%

58%

56.5%

61%

67%

Humanity’s Last Exam 고난도 추론

52.9%

48%

54.7%

55%

61%

GDP.pdf 복잡한 PDF 분석

31%

25%

31%

26%

26%

AA-Omniscience 지식·환각 신뢰도

41.5

27

43.4

  

 

1. ‘성능 대비 비용’이 돋보입니다.

종합 Intelligence Index는 GPT-6.1 Sol이 52점으로 기존 모델보다 4점 높아졌습니다. Sonnet 5.5의 56점, Opus 5.5의 58점보다 낮지만 GPT-6.1 Sol Max의 작업당 비용이 $0.72로, 같은 수준의 고성능 모델보다 훨씬 낮게 기록되었습니다.

기존 모델보다 더 높은 성능을 더 낮은 실제 작업 비용으로 활용할 수 있어, 반복적으로 사용하는 AI 에이전트 업무에서 비용 효율이 크게 좋아졌습니다. 

 

2. AI 에이전트 업무 성능이 더 좋아졌습니다

여러 명령을 실행하면서 코딩 작업을 완료하는 Terminal-Bench 4.0에서 이전의 44%보다 12%p 높아진 56%를 기록했습니다.

업무 자동화를 평가하는 AutomationBench-AA도 62%에서 약 65%로 상승하며, 코드 수정이나 여러 도구를 연결하는 업무처럼 여러 단계를 이어서 처리해야 하는 AI 에이전트 작업에서 이전 모델보다 안정적인 성능을 보여줍니다.

 

3. 복잡한 PDF 분석에 탁월합니다.

전문 문서 안의 표·차트·본문을 함께 읽고 답하는 GDP.pdf에서 31%로 기록하며, Sonnet 5.5와 Opus 5.5 등 비교 모델 대비 가장 높은 수치를 기록했습니다.

길고 복잡한 PDF에서 필요한 정보를 찾아 판단하는 작업에서 보다 효율적으로 활용할 수 있습니다.

 

4. 순수 성능에서는 Sonnet 5.5·Opus 5.5가 여전히 앞섭니다

에이전틱 코딩, 업무 자동화, 전문 지식 업무 처리 능력에서는 Sonnet 5.5나 Opus 5.5보다 약간 낮은 수치를 기록했습니다.

GDPval-AA v2.1은 GPT-6.1 Sol이 1,575점인 반면 Sonnet 5.5는 1,844점, Opus 5.5는 1,846점으로 복잡한 자료를 분석하고 높은 수준의 결과물을 만드는 업무에서는 Claude 상위 모델이 더 나은 모습을 보이고 있습니다.

 

Artificial Analysis에서는 

어떻게 평가했을까?

GPT 6.1 Sol의 Artificial Analysis 벤치마크 성능

* 이미지 출처: Antificial Analysis 홈페이지 

AI 에이전트 성능을 평가하는 독립 기관 Artificial Analysis에서도 OpenAI의 자체 테스트와 비슷한 결과가 확인됐습니다. 

GPT-6.1 Sol은 Intelligence Index 상위권에 위치하면서도, 성능은 더 높게, 속도는 더 빠르게, 가격은 더 낫게 제공되는 모습을 보이고 있습니다. 

 

GPT-6.1 Sol 실제 성능 비교

GPT 6.1 SOL 테스트 이미지

GPT 6.1 Sol의 실제 성능을 검증하기 위해 GPT 6 Astra, Claude Sonnet 5.5, Opus 5.5에 동일한 프롬프트를 입력하여 애니메이션 SVG 이미지를 제작했습니다. 

각 모델의 추론 능력, 구현 디테일, 사물 인식력을 정확하게 비교하고자 여러 단계의 정보 처리가 요구되는 '건물 건축 과정을 움직이는 이미지’로 각각 High 추론 능력으로 설정해 생성했습니다. 

테스트 결과 GPT 6.1 Sol의 이미지 완성 속도는 GPT 6 Astra에 이어 두 번째로 빠른 반면, 토큰 비용은 네 모델 중 가장 저렴했습니다. 

시간의 흐름을 표현하는 디테일은 Sonnet 5.5나 Opus 5.5에 비해 약간 아쉬웠으나, 건축 과정을 묘사하는 전체적인 퀄리티는 전혀 문제가 없을 만큼 높은 완성도를 보여주었습니다. 

 

GPT-6.1 Sol의 가격은?

항목

GPT-6.1 Sol

GPT-6 Sol

GPT-6 Astra

Claude Fable 5.1

Claude Opus 5.5

Claude Sonnet 5.5

입력 100만 토큰

$2.00

$2.00

$10.00

$10.00

$4.00

$2.00

캐시 읽기/입력

$0.10 

$0.20

$1.00

$0.25

$0.20

$0.20

캐시 쓰기

$2.50

$2.50

$12.50

$12.50(5분) / $20(1시간)

$5(5분) / $8(1시간)

$2.50(5분) / $4(1시간)

출력 100만 토큰

$10.00

$10.00

$50.00

$50.00

$20.00

$10.00

GPT-6.1 Sol은 기본 입력·출력 가격은 GPT-6 Sol과 동일하지만, 캐시 입력 비용 $0.10으로 50% 낮아져, 같은 코드베이스나 시스템 지침을 반복해서 불러오는 AI 에이전트 작업에서는 실제 비용 부담을 더 줄일 수 있습니다. 

다른 고성능 모델과 비교했을 때도 GPT-6 Astra와 Claude Fable 5.1보다 5배, Claude Opus 5.5보다 2배 낮은 비용을 보입니다.

최근 출시한 Sonnet 5.5과 비교했을 때도 기본 입·출력 가격은 같지만 캐시 읽기/입력 비용은 절반 수준으로 제공되어, 최상위 프론티어 모델 중 가장 가성비 높은 모델이라고 볼 수 있습니다.

 

GPT-6.1 Sol, 이렇게 활용하세요

1. 일상적인 AI 코딩 에이전트는 GPT-6.1 Sol부터

기존 코드 수정, 기능 추가, 버그 수정, 테스트처럼 여러 단계를 거치지만 작업 목표가 명확한 개발 업무에서는 GPT-6.1 Sol의 가격 대비 성능이 특히 좋습니다.

GitHub의 초기 테스트에서도 이전 GPT-6·GPT-5.6 계열보다 더 적은 토큰과 작업 단계로 코딩 업무를 완료하는 경향을 보였습니다. 

따라서 Sol로 먼저 처리하고 정말 어려운 작업만 Astra로 넘기는 방식을 활용한다면 생산 비용을 효율적으로 활용할 수 있을 것입니다.

2. 복잡한 문서를 해석하거나 전문 지식이 필요할 때

GPT-6.1 Sol은 단순한 코드 생성뿐 아니라 복잡한 PDF 분석, 전문 문서 이해, 사실 확인 능력도 좋아졌습니다. 

특히 GDP.pdf와 AA-Omniscience 같은 평가에서 이전 모델보다 높은 결과를 보여, 긴 문서에서 필요한 정보를 찾고 판단하는 업무에 강점을 보였습니다.

계약서·보고서·기술 문서처럼 자료가 길고 조건이 많은 문서를 분석해야 할 때 활용하면, 일반적인 요약보다 더 정확한 정보 추출과 비교가 가능합니다.

3. 여러 도구를 연결하는 AI 에이전트 업무에

GPT-6.1 Sol은 브라우저, 코드 실행, 문서 도구처럼 여러 도구를 오가며 작업하는 AI 에이전트 환경에서 높은 성능을 발휘합니다.

예를 들어 자료 검색 → 코드 수정 → 실행 결과 확인 → 문서 정리처럼 서로 다른 작업이 이어지는 업무에서, 각 단계를 별도로 지시하기보다 하나의 목표를 주고 여러 도구를 연결해 처리하는 방식으로 활용한다면, GPT-6.1 Sol의 성능을 십분 활용할 수 있습니다. 

 

AI 프로젝트, 전문가가 없어 멈춰 있나요?

AI를 도입했지만 실무에 맞지 않아 활용하지 못하고 있거나, 프롬프트 설계와 시스템 연동을 맡을 전문가가 없어 프로젝트가 지연되고 있다면, 지금 필요한 것은 새로운 모델이 아니라 실무를 이해하는 전문가입니다.

프로젝트 단계에 맞는 전문가를 연결합니다

  • PoC 단계: 바이브 코딩으로 빠르게 프로토타입을 검증할 전문가
  • 개발 단계: 반복 업무 자동화, 사내 데이터를 AI에 연동해 AX 시스템을 구축하는 전문가
  • 운영 단계: 클라우드, 보안, 코드 검수까지 고려해 안정적인 운영 기반을 마련할 전문가

단순히 이력만 보고 소개하지 않습니다

프로젝트 목표, 기술 스택, 기존 시스템 연동 요건, 협업 방식까지 검토해 24시간 이내 가장 적합한 AI 전문 프리랜서를 추천합니다.프로젝트 시작부터 전담 매니저가 함께하며, 필요한 경우 보안 검증 완료된 전문가만 매칭합니다. 

3분 등록으로, 24시간 내 필요한 AI 전문가를 추천받으세요 

  1. 기업 고객 회원가입
  2. 기업 고객 상담 문의에 프로젝트 내역 입력(약 3분)
  3. 프로젝트에 적합한 AI 전문 프리랜서 확인(24시간 이내)
AI 전문가 매칭

FAQ

freelancerBanner
projectBanner
댓글0
이랜서에 로그인하고 댓글을 남겨보세요!
0자
/200자
이랜서에 로그인하고 댓글을 남겨보세요!
0자
/200자
실시간 인기 게시물
이랜서 PICK 추천 게시물