El modelo de IA Fable 5 de Anthropic, tras su relanzamiento, presenta severas limitaciones que lo hacen responder con un "Preferiría no hacerlo" a múltiples consultas, derivando el trabajo a un modelo inferior. Esta situación genera frustración entre los usuarios y plantea dudas sobre la viabilidad comercial y el propósito de desarrollar modelos de IA tan potentes si sus capacidades son artificialmente restringidas.
La historia de 'Bartleby, el escribiente' de Herman Melville, publicada a finales de 1853, narra cómo un empleado de un despacho de abogados, Bartleby, responde con la frase "Preferiría no hacerlo" cuando se le pide que realice ciertas tareas. Esta cita, que con los años se convirtió en un símbolo de la inacción y la desidia, resuena hoy con el comportamiento del modelo de inteligencia artificial Fable 5.
Fable 5, el modelo de IA de Anthropic, fue lanzado el 9 de junio y promocionado como el más potente, costoso y exclusivo hasta la fecha. Sin embargo, su disponibilidad fue breve, ya que el gobierno de Estados Unidos restringió su acceso público para ciudadanos no estadounidenses, llevando a Anthropic a cortar el acceso globalmente durante tres semanas.
Esta semana, Fable 5 ha vuelto a estar disponible, aunque Anthropic advirtió desde el principio que su despliegue incluía nuevos filtros de seguridad para prevenir usos indebidos. La empresa ya había indicado en el lanzamiento original que, si el modelo detectaba problemas en la conversación, las consultas sobre ciertos temas serían respondidas por Claude Opus 4.8, su segundo modelo más avanzado. Con el reciente redespliegue, estos filtros se han vuelto aún más estrictos.
Fable 5 prefiere no hacer cosas
Múltiples reportes en redes sociales como X y Reddit indican que el rendimiento de Fable 5 ha sido artificialmente reducido o "nerfeado".
El modelo no solo parece funcionar peor, sino que su principal problema es que recurre constantemente al "Preferiría no hacerlo" de Bartleby. En lugar de ejecutar las peticiones del usuario, automáticamente deriva la respuesta a Claude Opus 4.8. Aunque este último es un modelo capaz, no es lo que los usuarios buscan, ya que su intención es aprovechar la teórica superioridad de Fable 5.
Lo más preocupante es que Fable 5 adopta esta filosofía del "Preferiría no hacerlo" ante casi cualquier tipo de consulta. Dylan Patel, fundador de la consultora SemiAnalysis, demostró esto al intentar una pregunta simple como "cuántas erres hay en 'raspberry'", y Fable 5 le indicó que no podía responderla.
El rendimiento del modelo también parece haber sufrido significativamente con este redespliegue. Pruebas independientes en benchmarks como BridgeBench mostraron una diferencia considerable en la puntuación entre el Fable 5 original y la versión actual.
Si bien algunos analistas señalaron que el test específico era demasiado particular y que el rendimiento general no ha disminuido drásticamente (o incluso ha mejorado en algunos aspectos), el verdadero problema radica en que Fable 5 simplemente se niega a responder, lo que dificulta enormemente evaluar su desempeño actual.
A esto se suma el hecho de que Fable 5 será un modelo especialmente exclusivo. Estará disponible con las suscripciones gratuita y de pago de Anthropic hasta el 7 de julio, pero después de esa fecha, solo podrá utilizarse mediante créditos, es decir, pagando por uso. Para usuarios intensivos, esto podría resultar en costos muy elevados.
Nos encontramos, por tanto, en un momento crucial: si empresas como Anthropic empiezan a limitar artificialmente las capacidades de sus modelos más potentes o a redirigir las consultas a versiones inferiores a la primera señal de problema, ¿cuál es el sentido de desarrollar modelos tan avanzados? Desde una perspectiva comercial, esta estrategia tampoco parece lógica; si los usuarios empresariales descubren que el modelo responde con un "Preferiría no hacerlo" y los deriva a una versión anterior y menos eficiente, no estarán satisfechos con el coste del modelo "premium".
Anthropic se encuentra en una situación delicada, y lo que sucede con Fable 5 podría marcar un antes y un después en la interacción entre usuarios finales, profesionales y los modelos de inteligencia artificial.