GPT-Live란? 듣기와 말하기를 동시에 하는 AI 음성의 등장

밸런스 UP
9일 전
조회수
963
AI와 실시간 음성으로 대화하고 있는 화면입니다.

GPT-Live는 사람과 대화하듯 자연스럽게 말을 주고받을 수 있도록 설계된 AI 음성 모델입니다. 듣기와 말하기를 동시에 처리하는 풀 듀플렉스(full-duplex) 구조가 핵심입니다.

기존 음성 AI가 '말하고 → 멈추고 → 기다리는' 순서로 한 번에 한 사람만 말하는 방식에 집중했다면, GPT-Live는 말하는 도중에도 상대의 말을 듣고 반응하는 데 초점을 둡니다. 실제 전화 통화처럼 끼어들거나 잠시 멈추는 대화가 가능해집니다.

이 글에서는 GPT-Live가 어떤 방식으로 동작하는지, 기존 음성 기능과 무엇이 다른지, 그리고 실제 업무에서 어떻게 활용할 수 있는지를 중심으로 정리해보았습니다.

 

GPT-Live 핵심 요약

  • 2026년 7월 8일 공개된 OpenAI의 차세대 음성 모델입니다. ChatGPT의 음성 기능을 구동하며, 기존 Advanced Voice Mode를 대체합니다.
  • 풀 듀플렉스 구조로 듣기와 말하기를 동시에 처리합니다. 사용자가 말하는 중에 "음", "네" 같은 맞장구를 치거나, 생각할 시간이 필요할 때 조용히 기다립니다.
  • 어려운 질문은 백그라운드 모델에 위임합니다. 검색이나 깊은 추론이 필요하면 GPT-5.5에 작업을 넘기고, 답을 기다리는 동안에도 대화를 이어갑니다.
  • 유료·무료 사용자에게 버전을 나눠 제공합니다. 유료는 GPT-Live-1, 무료는 GPT-Live-1 mini가 기본이며, iOS·안드로이드·웹에서 사용할 수 있습니다.
  • 출시 시점에 영상·화면 공유와 API는 제공되지 않습니다. 두 기능 모두 추후 추가될 예정이며, 개발자는 알림 신청으로 API 공개를 기다릴 수 있습니다.

 

GPT-Live란 무엇인가요?

GPT-Live의 홈페이지 메인 화면입니다.

* 이미지 출처: OpenAI GPT-Live 블로그 페이지

GPT-Live는 OpenAI가 2026년 7월 8일 공개한 차세대 실시간 음성 모델입니다. 유료 사용자를 위한 GPT-Live-1과 무료 사용자를 위한 GPT-Live-1 mini로 구성되며, ChatGPT Voice의 새로운 Live 기능을 구동합니다. 

가장 큰 변화는 사용자가 말하고 모델이 답하는 순서를 엄격하게 나누지 않는다는 점입니다. 

풀 듀플렉스 구조를 적용해 사용자의 음성을 들으면서 동시에 말할 수 있고, 초당 여러 차례 말할지, 계속 들을지, 잠시 멈출지, 도구를 호출할지를 판단합니다. 

웹 검색이나 깊은 추론이 필요한 요청은 GPT-5.5가 백그라운드에서 처리합니다. GPT-5.5가 작업하는 동안에도 GPT-Live는 사용자와 대화를 이어가며, 결과가 준비되면 이를 자연스럽게 전달합니다. 

현재는 ChatGPT의 웹과 모바일에서 제공되며, 언어 학습과 실시간 통역, 일상적인 핸즈프리 이용처럼 대화의 흐름이 중요한 상황에서 활용할 수 있습니다. 개발자용 API는 추후 제공될 예정입니다.

 

GPT-Live가 주목받는 이유

말할 차례를 기다리지 않아도 됩니다

기존 음성 AI는 사용자가 말을 마쳐야 답변을 시작하는, 이른바 무전기식 대화에 가까웠습니다. GPT-Live는 듣기와 말하기를 동시에 처리해 대화 도중에도 자연스럽게 끼어들 수 있습니다. 잠시 말을 멈추고 생각을 정리하거나 "천천히 말해줘"라고 요청하는 것도 가능합니다.

복잡한 작업을 처리하는 동안에도 대화가 이어집니다

검색이나 추론이 필요한 질문을 받으면 GPT-5.5가 해당 작업을 맡습니다. 그동안 GPT-Live는 침묵하지 않고 사용자와 대화를 이어가며, 답변이 준비되면 그 결과를 자연스럽게 전달합니다.

질문에 따라 추론 수준을 조절합니다

GPT-Live-1은 상황에 맞춰 추론 수준을 선택할 수 있습니다. 빠른 답변이 필요할 때는 Instant를, 충분한 검토가 필요한 질문에는 Medium 또는 High를 사용합니다. 경량 모델인 GPT-Live-1 mini는 Instant 방식으로 작동합니다.

음성과 화면을 함께 활용합니다

날씨나 주식, 스포츠처럼 정보를 물으면 음성 답변과 함께 화면에 시각 카드를 표시합니다ChatGPT의 메모리와 웹 검색 기능도 음성 대화에 연동돼, 이전 대화의 맥락을 반영하거나 최신 정보를 찾아 답할 수 있습니다.

 

GPT-Live 사용법

GPT-Live는 별도 설치 없이 ChatGPT 앱에서 바로 사용할 수 있습니다. 공식 안내를 기준으로 기본 사용 흐름을 살펴보겠습니다.

 

1단계. ChatGPT 앱 열기. 

iOS, 안드로이드, 웹 중 사용하는 환경에서 ChatGPT를 실행합니다.

2단계. 음성 버튼 누르기. 

대화창의 음성(Voice) 버튼을 누르면 GPT-Live로 대화가 시작됩니다.

3단계. 자연스럽게 대화하기. 

말하는 도중 끼어들거나, 잠시 멈추거나, 속도 조절을 요청할 수 있습니다. 아홉 가지 목소리 중에서 선택할 수 있습니다.

4단계. 추론 수준 선택하기. 

유료 사용자는 Instant, Medium, High 중에서 상황에 맞는 응답 방식을 고릅니다.

5단계. 시각 카드 확인하기. 

날씨나 주식 같은 질문에는 음성 답변과 함께 화면에 시각 카드가 표시됩니다.

버전별 기본 적용은 아래와 같습니다.

버전

기본 제공 대상

배경 모델

GPT-Live-1

유료 사용자 (Go, Plus, Pro)

GPT-5.5 (Instant/Medium/High)

GPT-Live-1 mini

무료 사용자

GPT-5.5 Instant

 

GPT-Live, 이렇게 활용할 수 있습니다

언어 학습

기존 음성 AI는 대화가 자주 끊겨 실제 회화를 연습하기에는 아쉬움이 있었습니다. GPT-Live는 대화 중 자연스럽게 끼어들거나 다시 물을 수 있어, 사람과 직접 이야기하듯 연습할 수 있습니다. 

다만 언어에 따라 발음이 다소 어색할 수 있으므로 학습을 시작하기 전에 해당 언어의 음성 품질을 확인하는 것이 좋습니다.

실시간 번역

실시간 번역 모드를 이용하면 대화하는 동안 내용을 원하는 언어로 옮길 수 있습니다. 여행지에서 길을 묻거나 간단한 의사소통이 필요할 때 유용합니다. 

아직 공식 지원 언어가 모두 공개된 것은 아니므로, 사용하려는 언어가 포함돼 있는지 먼저 확인해야 합니다.

핸즈프리 정보 확인

운전하거나 이동하는 중처럼 화면을 바로 확인하기 어려울 때 음성으로 필요한 정보를 물어볼 수 있습니다. 

답변과 함께 시각 카드도 제공되기 때문에, 이동을 마친 뒤 화면을 보며 내용을 다시 확인하기에도 편리합니다.

 

GPT-Live 사용 시 주의사항 3가지

영상과 화면 공유를 지원하지 않습니다. 

GPT-Live는 구조화된 데이터를 시각 카드로 보여주지만, 사용자의 화면을 직접 인식하지는 못합니다. 화면 공유나 영상 통화가 필요한 작업에는 아직 적합하지 않습니다. OpenAI는 이 기능을 추후 추가할 계획이라고 밝혔습니다.

언어별 품질이 고르지 않습니다. 

OpenAI는 ‘많이 사용하는 언어’에 최적화했다고 밝혔지만, 일부 언어는 발음이 원어민처럼 자연스럽지 않을 수 있습니다. 

실제로 출시 시연에서 힌디어는 억양이 어색하다는 지적이 있었습니다. 사용하려는 언어의 품질을 미리 확인하는 것이 좋습니다.

API가 아직 공개되지 않았습니다. 

출시 시점인 현재 GPT-Live는 ChatGPT 앱에서만 쓸 수 있고, 개발자가 자체 서비스에 붙일 수 있는 API는 제공되지 않았습니다. 

OpenAI는 곧 제공할 예정이라며 알림 신청을 받고 있으나, 정확한 공개일은 발표하지 않았습니다. 프로덕션 음성 제품을 계획한다면 요금과 사용 한도가 공식 문서에 공개된 뒤 검토하는 것이 안전합니다. 

FAQ

freelancerBanner
projectBanner
댓글0
이랜서에 로그인하고 댓글을 남겨보세요!
0
/200
이랜서에 로그인하고 댓글을 남겨보세요!
0
/200
실시간 인기 게시물
이랜서 PICK 추천 게시물