OpenAI ha introducido GPT-Live, una nueva generación del modo de voz de ChatGPT que promete una interacción conversacional más fluida y natural. Este avance permite que la IA escuche mientras responde, ajustándose a interrupciones y pausas, y delegando tareas complejas a modelos más potentes. La compañía busca superar la rigidez de los turnos tradicionales, ofreciendo una experiencia de usuario significativamente mejorada.
Greg Brockman inició la presentación de OpenAI demostrando una interacción sencilla: hablar con ChatGPT y cortarlo mientras respondía. Lo relevante no eran las preguntas, sino la reacción del sistema. En lugar de detenerse abruptamente, como sucedía en versiones anteriores, en la demostración la voz pareció adaptarse a la interrupción de manera más natural. Fue una breve muestra que ilustró la promesa de GPT-Live: que el modo de voz de ChatGPT no solo mejore su habla, sino que también aprenda cuándo responder, cuándo esperar y cuándo guardar silencio.
GPT-Live es el nombre elegido por OpenAI para esta nueva fase del modo de voz de ChatGPT. No se trata únicamente de una capa de sonido más refinada, sino de una serie de modelos diseñados para procesar la conversación de una forma distinta. Una arquitectura denominada full-duplex posibilita que la IA escuche mientras formula una respuesta, lo que, según la empresa, disminuye la rigidez de los turnos de conversación tradicionales.
Desde 2022, OpenAI ha evolucionado la relación con sus modelos, pasando de la interacción por teclado a formas cada vez más cercanas. ChatGPT marcó un antes y un después en la interacción masiva con modelos de texto; las primeras funciones de voz añadieron una capa más natural; y GPT-4o llevó esa aspiración a una experiencia mucho más expresiva, inevitablemente asociada a 'Her'. El anuncio de GPT-Live llega tras este recorrido. Su promesa no es solo sonar más humano, sino resolver una fricción menos espectacular pero más crucial: cómo mantener una conversación sin que parezca una sucesión de comandos.
Para comprender el cambio, es necesario analizar cómo operaban las generaciones previas. OpenAI explica que el primer modo de voz de ChatGPT funcionaba como un sistema en cascada: un modelo transcribía la voz, otro generaba la respuesta y un tercero la convertía nuevamente en audio. El modo avanzado de voz redujo esa fricción al procesar y generar audio dentro de un único modelo, pero seguía funcionando por turnos. GPT-Live modifica esta lógica: ya no trabaja solo con mensajes individuales, sino con una interacción continua que le permite decidir varias veces por segundo si debe hablar, escuchar, pausar o utilizar una herramienta.
Entonces, ¿qué podremos hacer en la práctica? La compañía liderada por Sam Altman ofrece varios ejemplos. Podremos interrumpir con una pregunta, hacer una pausa para reflexionar o solicitar al sistema que hable más despacio. La voz también puede responder con señales breves como “mmm” o “sí” para indicar que sigue escuchando, y la compañía asegura haber mejorado su capacidad para concentrarse en la voz del usuario incluso con ruido de fondo. A esto se suman las nueve voces de ChatGPT remasterizadas para GPT-Live, respuestas visuales en forma de tarjetas para consultas como el clima, deportes, bolsa y otros datos rápidos, además del soporte para búsqueda, memoria, imágenes y carga de archivos.
Otro componente crucial reside en lo que sucede cuando la conversación demanda más que una respuesta rápida. OpenAI explica que GPT-Live puede delegar búsquedas web, razonamiento o tareas más complejas a sus modelos frontera, mientras mantiene activa la conversación con el usuario. En el lanzamiento, esta capa de apoyo será GPT-5.5, aunque la compañía afirma que irá actualizando el modelo utilizado en segundo plano a medida que publique nuevas generaciones. El modo de voz de ChatGPT también permitirá seleccionar entre niveles de razonamiento: Instant para respuestas rápidas, y Medium o High cuando sea necesario dedicar más tiempo a la reflexión.
La compañía sostiene que el avance no se limita a una mera percepción de uso. En sus evaluaciones internas, GPT-Live-1 y GPT-Live-1 mini (la versión más pequeña del modelo disponible para cuentas gratuitas) superan al modo de voz avanzado en conversaciones comparadas de cinco a diez minutos, tanto en preferencia general como en fluidez, interrupciones, turnos y sensación de naturalidad. OpenAI también menciona mejoras en razonamiento científico, búsqueda agente y tareas de soporte telefónico simuladas. No obstante, estos resultados sirven como referencia inicial, pero provienen de la propia OpenAI y será necesario observar su impacto en la vida real.
GPT-Live comienza a implementarse desde hoy para usuarios de ChatGPT en iOS, Android y ChatGPT.com. OpenAI habla de un despliegue global y no menciona una exclusión específica para la Unión Europea, aunque es importante considerar que en otras implementaciones de funciones de IA ha habido incertidumbres o retrasos en la región. GPT-Live-1 será el modelo predeterminado para los usuarios de Go, Plus y Pro, mientras que las cuentas gratuitas, como se ha mencionado, utilizarán GPT-Live-1 mini. La API estará disponible más adelante, sin fecha concreta por ahora. Sin embargo, también existe una limitación importante en el lanzamiento: GPT-Live no soporta por el momento voz con vídeo ni pantalla compartida en ChatGPT, aunque OpenAI indica que trabaja para integrar esas capacidades en el futuro.