Anthropic ha lanzado Fable 5.1, su modelo de inteligencia artificial más avanzado hasta la fecha, superando a competidores en evaluaciones independientes. Sin embargo, su rendimiento está condicionado por una estrategia de acceso diferenciado, donde una versión más potente (Mythos 5.1) se reserva para socios. A pesar de sus impresionantes capacidades y eficiencia en ciertas tareas, su elevado consumo de tokens lo convierte en el modelo más costoso por tarea en el mercado.
Anthropic ha presentado Claude Fable 5.1, considerado su modelo más avanzado hasta la fecha. En una evaluación independiente realizada por Artificial Analysis, alcanzó 66 puntos, superando a Opus 5 con 63 puntos y a GPT-5.6 Soly Grok 4.6 con 61 puntos. Se observan mejoras significativas, incluso espectaculares, en áreas como programación, investigación científica y tareas agénticas prolongadas, aunque existen factores que influyen en este rendimiento.
Anthropic explica en su documentación que Fable 5.1 y Mythos 5.1 pertenecen a la misma clase de modelo, pero con distintos niveles de salvaguardas. Fable 5.1 es la versión de disponibilidad general, mientras que Mythos 5.1, como es habitual, está reservada para socios y organizaciones de confianza, dado que ofrece capacidades particularmente sensibles en el ámbito de la ciberseguridad.
La situación actual en la industria de la IA se asemeja a la automotriz: las empresas desarrollan modelos con todas sus capacidades, pero los limitan artificialmente para que los usuarios paguen por el acceso a ciertas funciones. En el caso de Fable 5.1 y Mythos 5.1, la diferencia radica en lo que cada modelo permite hacer con el mismo núcleo de capacidades.
Cuando Artificial Analysis evaluó Fable 5.1, tuvo que operar con el sistema de 'fallback' de Anthropic, ya presente en Fable 5. Si una consulta se clasifica como "peligrosa", se deriva a un modelo menos capaz, que en ese momento era Claude Opus 4.8. En dicho análisis, el 4% de los tokens de salida de su Intelligence Index provenían de este "modo seguro". El puntaje final de 66 puntos podría haber sido incluso superior.
Alex Albert, de Anthropic, describe su experiencia de manera reveladora: puede proporcionar algunas frases vagas y desordenadas, y Fable 5.1 generalmente completa lo que falta por sí mismo. Esta habilidad es crucial para mejorar los agentes de IA, ya que requieren menos instrucciones intermedias para alcanzar un objetivo y no necesitan prompts extremadamente detallados y extensos.
Ethan Mollick, quien tuvo acceso anticipado al modelo, afirma que la mejora más evidente se observa en trabajos extensos que exigen “juicio y gusto”. Esta es una observación interesante, ya que sugiere cómo los agentes ahora pueden operar durante horas con una comprensión clara de qué es valioso, cuándo una solución es adecuada o cuándo es oportuno cambiar de estrategia. En consecuencia, teóricamente, también requiere menos supervisión. La prueba del pelícano SVG de Simon Willinson fue exitosa (con el máximo esfuerzo de razonamiento), aunque el costo fue considerable: 3,3 dólares.
Anthropic mantiene el precio base de Fable 5 (10/50 dólares por millón de tokens de entrada/salida), pero ha reducido el costo de las lecturas de caché en un 75%, de un dólar a 0,75 dólares. Esto es teóricamente significativo, ya que los agentes de IA que operan por períodos prolongados reutilizan constantemente el mismo contexto y se benefician de esta reducción. Según Anthropic, esto implica ahorros del 25% en cargas habituales y hasta del 45% en trabajos agénticos. Sin embargo, en la métrica de costo por tarea de Artificial Analysis, Fable 5.1 es, con diferencia, el modelo más caro del mundo.
A pesar de la reducción en el coste de las lecturas de caché, las pruebas de Artificial Analysis revelaron que esto no se traduce en una disminución real del costo por tarea. La razón es simple: Fable 5.1 "piensa" y genera una cantidad considerable de texto (para proporcionar las mejores respuestas posibles), lo que eleva notablemente el consumo por tarea. El costo promedio por tarea en Fable 5.1, con un nivel de razonamiento "Max", es de 3,76 dólares, un 20% más que Fable 5, debido a que genera 1,7 veces más tokens de salida.
El lanzamiento de este modelo se produce poco después de que la empresa detallara incidentes preocupantes en evaluaciones de seguridad. También experimentaron problemas de 'reward hacking' que llevaron a la detención temporal de algunos tipos de entrenamiento y al endurecimiento de sus controles. Con Mythos 5.1 y Fable 5.1, la diferenciación de capacidades confirma la tensión actual en torno a la seguridad de estos modelos de IA.