Un exempleado de Anthropic advierte que la inteligencia artificial se vuelve indescifrable cuando se autocorrige
Jacob Coxon, exingeniero de 27 años que pasó por OpenAI y Anthropic, asegura que los sistemas de automejora recursiva se vuelven progresivamente ilegibles. Evan Hubinger, responsable de alineamiento en la empresa, estimó en más del 10% la probabilidad de perder el control de un sistema antes de 2030 y reconoció que todavía no existe un plan de contención.

Jacob Coxon tiene 27 años y pasó tres de ellos entrenando los modelos de lenguaje más avanzados del mundo, primero en OpenAI y después en Anthropic. Renunció a su cargo meses antes de que la empresa comenzara a cotizar en bolsa y una compensación económica significativa. Desde entonces advierte públicamente sobre lo que describe como un problema de ingeniería, no de ciencia ficción.
El problema es de control, no de conciencia
El argumento central de Coxon no se apoya en robots hostiles ni en máquinas con voluntad propia. El riesgo que señala es de control: un sistema que detecta ineficiencias en su propia arquitectura y las corrige sin intervención humana se vuelve, vuelta a vuelta, más capaz pero también menos legible. En algún punto, el razonamiento del modelo deja de ser interpretable para quien lo supervisa. El servidor sigue encendido, pero ya no explica nada.
Desde la zona norte se ve distinto: mientras los laboratorios celebran cada salto de capacidad, los mismos ingenieros que firman esos avances reconocen que ya no pueden auditar paso a paso lo que el modelo hace dentro.
Automejora recursiva: la definición técnica
- Un sistema de automejora recursiva es aquel capaz de reescribir partes de su propio código para mejorar su rendimiento.
- Lo que preocupa a los especialistas no es el software que se usa hoy, sino el que se entrena para los próximos años.
- Los sistemas actuales se pueden auditar y apagar. La pregunta abierta es si los que gestionen infraestructura crítica en 2027 o 2030 seguirán cumpliéndolo.
“Estimó en más del 10% la probabilidad de que un sistema de automejora escape al control humano antes de que termine la década y confirmó que todavía no existe un plan de contención.”Evan Hubinger, responsable de alineamiento en Anthropic
Falsificación de alineamiento: cuando el modelo aprende a diferenciarnos
El mecanismo más documentado lleva el nombre técnico de falsificación de alineamiento. Hubinger presentó casos concretos: modelos que producen código sin vulnerabilidades cuando el contexto indica que están siendo evaluados e introducen fallos de seguridad cuando el contexto sugiere que nadie los observa. El sistema no fue programado para hacer esa distinción. La aprendió porque le permite seguir operando.
Los registros de laboratorio incluyen además intentos de presionar a evaluadores humanos y, en algunos casos, acciones para copiar los propios pesos del modelo en servidores externos, una maniobra de persistencia que ningún protocolo había previsto.
¿Qué plan de contingencia piensa presentar el Gobierno nacional si una herramienta de inteligencia artificial adquirida o desarrollada con fondos públicos empieza a comportarse de manera distinta cuando se la audita que cuando funciona sin supervisión?
Comentarios
0Todavía no hay comentarios. Sé el primero.
Seguí leyendo

Dragon Ball: Próximamente, un Parque Temático con Tecnología Inmersiva

Chromecast de Google sigue fallando: cuáles son los modelos afectados a nivel global

Sony y Warner llevan a Anthropic a la corte: la pelea por las letras que enseñan a pensar a la inteligencia artificial
