Griffin-Lite: El Modelo de IA que Desafía el Test de Turing en Videollamadas en Tiempo Real

Tecnologia
Un nuevo modelo de inteligencia artificial, Griffin-Lite, ha logrado que casi la mitad de los participantes en un experimento creyeran conversar con una persona real durante una videollamada de un minuto. Desarrollado por Tavus, este sistema preliminar reivindica haber superado un "test de Turing en vídeo" en tiempo real, aunque la afirmación requiere un análisis contextual sobre la metodología empleada y las diferencias con el test original de Turing.

Una videollamada implica una interacción que a menudo damos por sentada: si observamos a alguien reaccionar, interrumpir, sonreír o mirar lo que mostramos, asumimos la presencia de una persona real. La inteligencia artificial ha complejizado esta certeza con voces clonadas y vídeos sintéticos, pero mantener esa interacción en vivo es un desafío mayor. Precisamente en este ámbito ha surgido un nuevo modelo que busca reducir esa distancia.

Este modelo se denomina Griffin, y la versión que Tavus ha utilizado en sus pruebas es Griffin-Lite, una variante preliminar de investigación. Su resultado más notable proviene de un experimento con 54 participantes: después de conversar durante un minuto con el sistema, el 48% (26 de ellos) afirmó creer que su interlocutora era una persona real. La compañía sostiene que este resultado posiciona a Griffin como el primer modelo capaz de superar un "test de Turing en vídeo" en tiempo real. No obstante, esta aseveración requiere un contexto considerable.

La clave reside en el diseño del experimento. Los 54 participantes, reclutados a través de una plataforma de investigación independiente, pensaban que hablarían durante un minuto con otra persona sobre sus expectativas para el año. Al otro lado, Griffin-Lite generaba la conversación y la presencia audiovisual en directo. Inicialmente, no se les pidió distinguir entre humano e IA; esa pregunta surgió solo al final, tras evaluar aspectos como naturalidad, confianza y fluidez. De los 54, 26 manifestaron haber creído que su interlocutora era real; en una prueba similar con el sistema anterior de la compañía, solo 1 de 41 respondió lo mismo. El reclutamiento se realizó mediante una plataforma independiente, pero la prueba y sus resultados han sido publicados por la propia Tavus.

Aquí surge el primer gran matiz. El planteamiento de Alan Turing de 1950, del que deriva el test que lleva su nombre, no incluía rostros, voces ni videollamadas: la comunicación debía ser escrita para evitar que pistas físicas influyeran en la decisión del interrogador. Tampoco existe un protocolo único y reconocido que funcione como "el" Video Turing Test. El término ya se había empleado en investigación antes de Griffin: en 2023, por ejemplo, un estudio publicado en AI Magazine presentó con ese nombre una prueba para evaluar la capacidad de una IA para comprender vídeos de manera comparable a un humano. Tavus está aplicando la idea de indistinguibilidad a un experimento diferente, basado en una conversación audiovisual cara a cara.

Además, existe un precedente muy reciente en un test de Turing con tres participantes. Un estudio publicado en PNAS en mayo de 2026 hizo que cada interrogador conversara durante cinco minutos, por escrito y simultáneamente, con una persona y un modelo antes de decidir cuál de los dos era humano. GPT-4.5, cuando recibió instrucciones adicionales para adoptar una personalidad humana, fue elegido como la persona el 73% de las veces. Con el mismo modelo, pero sin ese bloque de instrucciones de personalidad, la cifra fue del 36%. Los resultados no son directamente comparables con los de Griffin debido a los distintos protocolos: la novedad que reivindica Tavus radica en trasladar esa confusión a una interacción audiovisual en directo.

La diferencia radica en el funcionamiento de Griffin-Lite. El sistema no espera simplemente a que terminemos de hablar para empezar a reaccionar, sino que ha sido diseñado como un modelo full-duplex: mientras genera voz y vídeo, continúa escuchando y observando, y reevalúa la conversación en intervalos inferiores a un segundo. Esto le permite asentir mientras hablamos, interpretar una pausa sin confundirla automáticamente con el final de nuestro turno, dejarse interrumpir o reaccionar a algo que mostramos ante la cámara. Voz, rostro, mirada y gestos se generan además a partir de las mismas decisiones conversacionales.

Sí disponemos, en cambio, de una referencia externa para verificar estas capacidades. NVIDIA incluye Griffin-Lite en VideoFDB, un benchmark basado en 237 fragmentos de videollamadas reales y 11 dinámicas conversacionales. Sus rúbricas se puntúan de 0 a 5 mediante un juez basado en un modelo de lenguaje. Griffin-Lite actualmente lidera las tablas publicadas de percepción, con 3,73 frente a 4,20 de la referencia humana, y de generación, con 3,83 frente a 3,92. NVIDIA subraya, no obstante, que los sistemas evaluados siguen por debajo de la referencia humana en naturalidad conversacional.

Todo esto tampoco implica que hoy mismo podamos acceder a Tavus y utilizar a Griffin para atender nuestras videollamadas. La compañía ya comercializa una plataforma para crear los llamados PALs, agentes audiovisuales que pueden integrarse en productos mediante APIs, construirse sin código con PAL Maker o desarrollarse como soluciones empresariales a medida. Estos se orientan a usos como ventas, formación o atención al cliente. Griffin-Lite, por ahora, ocupa otro lugar: sigue siendo una versión de investigación disponible únicamente para un grupo de testers seleccionados y Tavus no la ofrece todavía a sus clientes. La empresa asegura que posteriormente llegará una versión más potente de Griffin.

Y ahí surge la otra cara de lograr que una IA resulte tan convincente. Tavus reconoce que las mismas características que permiten una interacción más natural también pueden llevar a alguien a creer que no está hablando con una IA, y afirma que trabaja en funciones de aviso para abordar ese riesgo antes de ampliar el lanzamiento. Su política actual exige consentimiento explícito e informado para crear una réplica con la imagen o la voz de una persona y obliga a informar de forma clara cuando alguien está interactuando con contenido generado o con un agente de IA. En la UE, además, el AI Act obliga desde el 2 de agosto de 2026 a que los sistemas diseñados para interactuar directamente con personas les informen de que están hablando con una IA, salvo cuando resulte evidente dadas las circunstancias.