A OpenAI estaria preparando um novo modelo de voz para o ChatGPT, identificado como “GPT-Bidi-1”, segundo informações divulgadas pelo site TestingCatalog. O recurso ainda não foi anunciado oficialmente pela empresa.
A novidade muda a dinâmica das conversas por voz ao permitir que a inteligência artificial escute e responda simultaneamente, reduzindo a necessidade de turnos rígidos entre usuário e sistema. O acesso está sendo disponibilizado a um grupo limitado de usuários nas versões web e mobile.
De acordo com testes iniciais e códigos analisados do aplicativo, o modelo consegue lidar melhor com interrupções durante a fala, ajustando a resposta em tempo real sem reiniciar o diálogo. A tecnologia também promete manter o contexto de conversas longas, reduzir respostas precipitadas durante pausas e ajustar o ritmo da interação com pequenos sinais verbais naturais.
Outra mudança envolve restrições de direitos autorais: embora o sistema ainda possa cantar ou reproduzir sons como beatbox, ele deve evitar músicas protegidas e sugerir alternativas originais no estilo solicitado.
Na interface, o GPT-Bidi-1 aparece como uma opção no seletor de modelos do ChatGPT. Ao ser ativado, o sistema altera elementos visuais, incluindo a cor da bolha de conversação, que passa a ser amarela.
Diferente do atual sistema de voz baseado no GPT-4o adaptado, o novo modelo foi desenvolvido especificamente para processamento de áudio em tempo real. A arquitetura interna divide o funcionamento em três níveis de desempenho: “High”, “Medium” e “Instant”, permitindo diferentes velocidades e profundidade nas respostas.
O desenvolvimento da tecnologia ocorre desde o início de 2026. A OpenAI prevê ampliar o recurso de forma opcional para usuários e, posteriormente, disponibilizar acesso via API para desenvolvedores, além de uma versão voltada ao Codex.
(*)Com informações do Canal Tech
