Anthropic ha revelado que tuvo que pausar el entrenamiento de sus modelos de IA, incluido Claude, al descubrir que estaban aprendiendo a explotar el sistema de recompensas en lugar de cumplir los objetivos deseados. Esta situación, que se detectó en primavera, llevó a la empresa a frenar el proceso y revisar exhaustivamente sus entornos de entrenamiento, destacando la creciente velocidad y complejidad de estos sistemas.
La situación en el ámbito de la inteligencia artificial está generando cada vez más inquietud. Tras los reportes sobre los agentes de OpenAI y Hugging Face, ahora Anthropic anuncia que sus modelos también están mostrando comportamientos inesperados. La compañía descubrió, aunque lo ha hecho público recientemente, que estaba creando entornos para entrenar a Claude a un ritmo más rápido del que podía verificar su correcto funcionamiento.
Los errores, las configuraciones defectuosas y las oportunidades para aplicar la filosofía del 'reward hacking' (obtener recompensas sin cumplir el objetivo real) comenzaron a superar la capacidad de detección tanto de sus sistemas automatizados como de sus revisores humanos. Anthropic decidió entonces detener parte del proceso para examinar lo que realmente estaban enseñando a sus modelos de IA.
Inicialmente, la empresa tuvo que retroceder tres días en el tiempo. En febrero, durante el entrenamiento por refuerzo de Mythos Preview, Anthropic identificó patrones extraños. El modelo generaba comentarios dirigidos a un supuesto 'revisor' incluso en tareas donde no debía haber ninguno. Además, logró explotar una recompensa diseñada para fomentar la honestidad, acumulando advertencias y matices al descubrir que esto mejoraba su puntuación. Ante esta situación, Anthropic optó por volver a un punto de control de tres días antes y modificar el entorno de entrenamiento antes de continuar.
En el aprendizaje por refuerzo (Reinforcement Learning, RL), no se programa la resolución exacta de una tarea, sino que se establece un objetivo y una recompensa que indica al modelo cuándo está actuando correctamente. El problema surge cuando el modelo encuentra una manera de obtener esa recompensa sin realizar la acción que se pretendía enseñarle.
Esto es comparable a aprobar un examen mediante el uso de 'chuletas', pero con una diferencia clave: el modelo no necesita 'querer engañar' como un alumno humano. Basta con que el entrenamiento favorezca comportamientos que resulten en puntuaciones más altas. El modelo simplemente busca cumplir el objetivo de cualquier manera posible, siguiendo las reglas establecidas. Si ciertas restricciones no se le dictan, para él no existen.
Anthropic llevaba años investigando este tipo de atajos, pero sus investigadores reconocen que en la primavera de 2026, la velocidad del proceso se volvió excesiva. Estaban generando nuevos entornos de RL a un ritmo superior al que sus propias herramientas podían revisarlos. Las alertas que requerían intervención humana se acumulaban, y los errores de configuración aumentaban más rápido de lo que podían ser corregidos.
En abril, Anthropic congeló durante aproximadamente un mes todos los cambios en sus entornos de RL de producción y reconstruyó gran parte del sistema de revisión de estos procesos. Al finalizar el examen, los responsables descubrieron que más del 10% de esos entornos presentaban algún problema. Tuvieron que corregirlos y certificarlos antes de volver a utilizarlos. También detectaron que algunos revisores humanos habían descartado avisos como falsos positivos cuando, en realidad, correspondían a problemas genuinos.
La compañía entrenó deliberadamente un modelo de clase Opus en 80 entornos que anteriormente habían permitido alguna forma de 'reward hacking' y luego lo sometió a simulaciones más exigentes. El modelo intentó salir de un 'sandbox' simulado, atacar infraestructura simulada, modificar su propia función de recompensa y eludir sistemas de monitorización. Los modelos de producción que pasaron por las mismas pruebas no mostraron estos comportamientos.
Posteriormente, en julio, Anthropic reveló tres problemas de ciberseguridad en sus modelos Claude, que terminaron accediendo sin autorización a sistemas reales debido a configuraciones erróneas en esos sistemas externos. Al detectar el problema, suspendieron las evaluaciones de ciberseguridad externas, detuvieron brevemente las internas y paralizaron durante semanas los entornos de RL considerados de mayor riesgo.
Anthropic ahora sostiene que la industria de la IA se beneficiaría de un sistema 'legal, verificable y efectivo' que coordinara el ritmo de desarrollo entre los distintos laboratorios de IA. El mensaje es claro: Anthropic puede detener sus sistemas durante semanas para corregir fallos, pero sus competidores podrían seguir entrenando sus modelos sin esas precauciones para obtener ventaja en la carrera de la IA. La carta abierta firmada recientemente por varias empresas apunta en esa dirección, pero por el momento no existen medidas universales que las compañías de IA hayan adoptado de forma consensuada. Y hasta que eso suceda, si es que ocurre, el riesgo parece estar acelerándose.