A OpenAI lançou em 10 de setembro de 2026 o GPT-Live-1 na API, tornando disponível para desenvolvedores o modelo de voz que já roda dentro do ChatGPT desde julho. A diferença em relação a um assistente de voz comum: o GPT-Live-1 ouve e fala ao mesmo tempo. Um único modelo processa a fala que chega e a fala que sai em paralelo, em vez de esperar o usuário terminar de falar para só então responder. A OpenAI chama essa arquitetura de full-duplex, e ela é o que permite ao modelo reagir a uma interrupção, uma pausa ou uma mudança de assunto no meio da própria fala, sem travar a conversa.

Principais pontos

  • O GPT-Live-1 está disponível na API da OpenAI desde 10 de setembro de 2026, custando US$ 0,05 por minuto pela camada de voz. O modelo de raciocínio de backend e as ferramentas usadas são cobrados à parte.
  • É full-duplex: um único modelo processa entrada e saída de áudio ao mesmo tempo, em vez do pipeline tradicional de reconhecimento de fala, modelo de linguagem e conversão de texto em voz.
  • A OpenAI reporta latência de resposta de 0,798 segundo, contra 1,41 segundo do GPT-Realtime-2.1, e ganho de cerca de 30 pontos no Full Duplex Bench.
  • Em Tau3 (Voice) Intelligence, que mede tarefas de atendimento por voz nos setores aéreo, varejo e telecom, o GPT-Live-1 (pareado com o GPT-6 Astra) chegou a 86,2% de sucesso em tarefas, contra 45,7% do GPT-Realtime-2.1 e 42,4% do GPT-Realtime-2.
  • Em teste da Speak, plataforma de aprendizado de idiomas, o modelo reduziu em quase 80% as interrupções falsas durante pausas de pensamento dos alunos, na comparação com sistemas tradicionais por turnos.

O que muda em relação a um assistente de voz comum

Os assistentes de voz mais comuns hoje seguem um pipeline em três etapas: um modelo transcreve o áudio recebido, um modelo de linguagem gera a resposta em texto, e um terceiro modelo converte esse texto em fala. Cada etapa espera a anterior terminar, e o sistema como um todo só reage depois que o usuário para de falar.

O GPT-Live-1 substitui esse pipeline por um único modelo que processa entrada e saída de áudio ao mesmo tempo, segundo o anúncio da OpenAI. Na prática, isso significa que o modelo consegue perceber, em tempo real, se o usuário está apenas hesitando, se mudou de ideia no meio da frase ou se quer interromper de fato, sem precisar esperar um silêncio para decidir o que fazer.

O ganho é mensurável: a OpenAI reporta uma latência de resposta de 0,798 segundo, quase a metade dos 1,41 segundo do modelo anterior, o GPT-Realtime-2.1. Segundo a Unite.AI, isso corresponde a um ganho de cerca de 30 pontos no Full Duplex Bench, benchmark que avalia especificamente esse tipo de interação simultânea.

Como o preço funciona na prática

O GPT-Live-1 custa US$ 0,05 por minuto na API, cobrado por segundo de uso, mas esse valor cobre só a camada de voz. Segundo a Unite.AI, o desenvolvedor paga separadamente pelo modelo de raciocínio de backend e pelas ferramentas que esse modelo aciona durante a conversa.

Essa separação é proposital: o GPT-Live-1 pode delegar tarefas mais complexas, como consultar um sistema externo ou fazer um cálculo, para um modelo de texto rodando por trás da voz, como o GPT-6 Astra, que a própria OpenAI já teve que limitar em outro produto por excesso de demanda. Segundo o anúncio da OpenAI, em Tau3 (Voice) Intelligence, benchmark que simula tarefas de atendimento por voz em companhias aéreas, varejo e telecom, essa combinação (GPT-Live-1 na camada de voz, GPT-6 Astra no raciocínio) chegou ao topo da tabela, com 86,2% de sucesso em tarefas. O GPT-Realtime-2.1, modelo anterior, ficou em 45,7%, e o GPT-Realtime-2, em 42,4%.

O modelo também oferece 12 vozes e permite que o desenvolvedor configure tom, velocidade e estilo de conversa por meio de instruções de sistema, em vez de depender de uma voz e um estilo fixos.

O teste que a OpenAI está usando para vender o modelo a quem constrói atendimento por voz

Entre os números que a OpenAI divulgou para o lançamento, um caso de uso chama atenção por ser bem concreto: o teste feito pela Speak, plataforma de aprendizado de idiomas. Segundo a reportagem, o GPT-Live-1 reduziu em quase 80% as interrupções falsas durante pausas de pensamento dos alunos, comparado a sistemas tradicionais por turnos.

O problema que esse dado resolve é conhecido por qualquer pessoa que já usou um assistente de voz para praticar outro idioma: o sistema corta a fala do usuário no meio de uma pausa natural, achando que ele terminou de falar. Isso atrapalha justamente quem está tentando formular uma frase em um idioma que ainda não domina.

Um modelo que consegue distinguir uma pausa de pensamento de uma frase encerrada tem valor direto para esse tipo de produto, e também para call centers, assistentes de atendimento e qualquer aplicação em que interromper a pessoa errada custa caro.

Por que isso importa

O lançamento do GPT-Live-1 na API é a segunda etapa de um rollout que começou em julho, quando a OpenAI substituiu o Advanced Voice Mode do ChatGPT pelo GPT-Live, com o GPT-Live-1 como modelo padrão para assinantes pagos e o GPT-Live-1 mini para o plano gratuito. Agora, o mesmo modelo que já atende usuários do ChatGPT fica disponível para quem constrói produtos próprios sobre a API da OpenAI, o que amplia diretamente a concorrência com fornecedores de voz para atendimento automatizado e assistentes de idioma.

Para quem acompanha o setor de IA no Brasil, o lançamento reforça uma tendência que já aparecia em outros lançamentos recentes da OpenAI: a empresa está expondo, peça por peça, a infraestrutura que já usa internamente no ChatGPT para quem quer construir produtos próprios em cima dela, seja para agentes de código, seja agora para atendimento por voz.

Perguntas frequentes

O que é o GPT-Live-1?

É um modelo de voz full-duplex da OpenAI, lançado na API em 10 de setembro de 2026. Ao contrário de um assistente de voz tradicional, que transcreve, processa e depois fala em etapas separadas, o GPT-Live-1 usa um único modelo para ouvir e falar ao mesmo tempo.

Quanto custa usar o GPT-Live-1 na API?

US$ 0,05 por minuto pela camada de voz, cobrado por segundo de uso. O modelo de raciocínio de backend (como o GPT-6 Astra) e as ferramentas usadas durante a conversa são cobrados separadamente.

O GPT-Live-1 já estava disponível em algum lugar antes da API?

Sim. Desde julho de 2026, o GPT-Live-1 é o modelo padrão de voz do ChatGPT para assinantes dos planos Go, Plus e Pro, substituindo o Advanced Voice Mode. O lançamento de 10 de setembro disponibiliza o mesmo modelo para desenvolvedores construírem seus próprios produtos.

Que resultados a OpenAI divulgou para o GPT-Live-1?

A empresa reporta latência de resposta de 0,798 segundo (contra 1,41 segundo do modelo anterior), ganho de cerca de 30 pontos no Full Duplex Bench, e 86,2% de sucesso em tarefas no benchmark Tau3 (Voice) Intelligence, quando pareado com o GPT-6 Astra, contra 45,7% do GPT-Realtime-2.1.

Referências