GPT-Live는 무엇이 달라졌을까요? 핵심은 사용자의 말을 듣는 동안에도 응답할 수 있는 풀듀플렉스(Full-Duplex, 전이중) 구조입니다. 기존 음성 AI처럼 사용자의 발화가 완전히 끝날 때까지 기다리지 않고, 맞장구를 치거나 잠시 기다리거나 자연스럽게 끼어드는 판단을 실시간으로 수행합니다. 이 글에서는 OpenAI가 공개한 공식 자료를 기준으로 GPT-Live의 작동 방식, 요금제별 모델, 실제 활용법과 현재 제한 사항을 정리합니다. 과장된 전망보다 지금 확인할 수 있는 기능과 주의점을 중심으로 살펴보겠습니다. 핵심 요약 GPT-Live는 입력 음성을 처리하면서 동시에 음성을 생성하는 풀듀플렉스 모델입니다. 대화 흐름은 GPT-Live가 맡고, 검색이나 깊은 추론은 백그라운드 모델에 위임할 수 있습니다. Go·Plus·Pro에는 GPT-Live-1, Free에는 GPT-Live-1 mini가 기본 적용됩니다. ChatGPT에서는 시각적 카드와 실시간 번역을 지원하지만, 언어별 자연스러움에는 차이가 있을 수 있습니다. 2026년 9월에는 GPT-Live-1 API도 출시됐으며 음성 계층 가격은 분당 0.05달러입니다. 1. GPT-Live의 풀듀플렉스는 무엇인가? 초기의 음성 AI는 대체로 음성 인식(STT) → 언어 모델(LLM) → 음성 합성(TTS) 단계를 차례로 연결했습니다. 구조가 단순하고 각 부품을 교체하기 쉽지만, 단계가 바뀔 때마다 지연이 생기고 억양이나 감정 같은 정보가 일부 손실될 수 있습니다. 이후 Advanced Voice Mode 같은 음성 모델은 하나의 모델 안에서 오디오를 처리해 지연을 줄였지만, 여전히 사용자의 차례가 끝났다고 판단한 뒤 답하는 턴 기반 방식 이었습니다. 짧은 침묵을 발화 종료로 오해하거나, 사용자가 말을 덧붙이는 순간 AI가 끼어드는 문제가 생길 수 있었습니다. GPT-Live는 별도의 턴이 끝나기를 기다리는 대신, 오디오 입력과 출력을 연속적으로 처리합니다. O...