Un estudio de Epoch AI revela una mejora notable en la capacidad de los modelos de inteligencia artificial para identificar errores en el montaje de muebles, pasando de un 28% a un 80% de aciertos en diez meses. Este avance, medido a través del Furniture Assembly Benchmark (FAB), busca evaluar el razonamiento abstracto de la IA, una habilidad crucial para futuras aplicaciones en el mundo real, como la asistencia en reparaciones técnicas.
A Epoch AI se la conoce por su riguroso referente matemático para la IA, pero sus creadores tuvieron una idea muy original. Compraron tres muebles de IKEA, comenzaron a ensamblarlos y, de vez en cuando, cometieron errores intencionadamente. Luego tomaron fotografías y las mostraron a diferentes modelos de IA junto con el manual de instrucciones. La tarea de la IA era determinar si el mueble estaba correctamente montado y, en caso contrario, localizar dónde se había producido el fallo. Hay buenas noticias: han mejorado significativamente en esta tarea, pasando de un 28% a un 80% en tan solo diez meses. El dato es sorprendente, ya que la mejora de los modelos en el llamado Furniture Assembly Benchmark (FAB) es notable.
En noviembre de 2025, el mejor modelo de IA en esta prueba era Claude 4.5, logrando un 28% de aciertos. En septiembre de 2026, GPT-6 Astra alcanzó el 80%, y no solo acertó mucho más, sino que necesitó una media de tres minutos por foto, entre dos y diez veces menos tiempo que los modelos que anteriormente estaban entre los mejores.
No basta con "mirar" una foto. Los modelos reciben una fotografía del mueble a medio montar, el manual oficial de IKEA, una herramienta para ampliar zonas de la imagen y un intérprete de Python. A partir de ahí, deben relacionar los diagramas del manual con piezas reales fotografiadas desde ángulos específicos. El objetivo es reconstruir los pasos que ha seguido la persona que montó el mueble y detectar aspectos como una pieza colocada al revés. Epoch incluso continuaba los montajes después de introducir el fallo para que ese error no fuera necesariamente el último paso visible y así dificultar la tarea a la IA.
IKEA es solo una excusa. Lo que Epoch AI quiere medir es la capacidad de razonamiento abstracto de los modelos de IA. Es decir, si son capaces de conectar instrucciones abstractas (de los manuales de IKEA, en este caso) con objetos del mundo real. Es una habilidad crítica para que algún día un modelo de IA pueda ayudarnos a reparar un electrodoméstico o un coche siguiendo documentación técnica. Es fácil evaluar modelos en matemáticas o en programación, pero no lo es en absoluto cuando se trata de evaluar la visión o el razonamiento espacial y su aplicación a nuestro mundo.
Pero estamos lejos de robots que nos monten los muebles. Este FAB analiza si una IA puede observar el trabajo realizado por una persona y verificarlo, pero no si puede planificar y ejecutar todo el proceso físicamente desde cero. Así, puede reconocer que una pieza está invertida cuando tenemos delante el manual y tiene una foto para estudiar la situación. Sin embargo, eso es muy distinto a que una máquina pueda manipular las piezas, resolver imprevistos y lograr montar correctamente un mueble.
Además, Epoch AI encontró distintos sesgos según la familia de modelos utilizada. Gemini y Qwen tendían a asumir que siempre había fallos y encontraban errores que no existían. Modelos anteriores de OpenAI y Anthropic sufrían el problema contrario: daban por buenos montajes que contenían errores. El proceso demostró que era tan importante buscar errores en el montaje como saber cuándo dejar de buscarlos.
El experimento deja una curiosidad ya observada: estamos aprendiendo a medir cada vez mejor cómo los modelos de IA resuelven problemas con una solución que luego podemos verificar. El problema es medirlas cuando el proceso es más ambiguo. Volvemos a la vieja paradoja de Moravec: la inteligencia artificial hace fácil lo difícil y viceversa.