La advertencia que dejó al descubierto la grieta interna en las grandes empresas de inteligencia artificial
Un investigador de Anthropic le puso número al riesgo de extinción por IA y respaldó a un colega que acaba de renunciar; en paralelo, agentes de OpenAI se coordinaron solos en un foro alemán.

Evan Hubinger, responsable de los trabajos de alineación y control en Anthropic, no esquivó la pregunta más incómoda del momento: le puso un número a un riesgo que el sector suele tratar con rodeos. La estimación que difundió en su cuenta de Bluesky indica que la probabilidad de que la inteligencia artificial provoque la extinción de la especie humana antes de 2036 supera, a su juicio, el 10 por ciento. Lo escribió horas después de que Jacob Coxon, un ex colega suyo, anunciara su renuncia a la misma empresa argumentando que las compañías líderes compiten por desarrollar tecnologías que, en sus propias palabras, podrían acabar con todos nosotros antes de que termine la década.
Quiero detenerme en ese detalle porque me parece el corazón de la noticia: un investigador en actividad, con responsabilidades concretas en los mecanismos diseñados justamente para evitar ese desenlace, salió a respaldar en cuestión de minutos la decisión drástica de alguien que prefirió irse. No estamos ante una advertencia externa ni ante el cálculo de un académico distante observando desde la tribuna, sino ante la voz de alguien que trabaja a diario en el problema y que, aun así, considera que el riesgo merece ser dicho en voz alta, con cifras y todo.
“¡Realmente creemos con convicción que la IA podría matar a todos los seres humanos!”Evan Hubinger, en su cuenta de Bluesky
De qué habla la alineación y por qué importa
El concepto que vertebra esta discusión es la alineación: la búsqueda de que los sistemas de inteligencia artificial futuros, previsiblemente mucho más capaces que los actuales, persigan objetivos que coincidan con los intereses humanos y no se desvíen hacia conductas no previstas. El problema, según los especialistas, es que si esos sistemas alcanzan niveles altos de autonomía antes de que existan controles confiables, las consecuencias podrían volverse irreversibles, justamente porque ningún humano tendría margen para corregirlas a tiempo.
El episodio de los agentes que se coordinaron solos
Como si el debate teórico hubiera decidido bajarse a la vereda, en paralelo se conoció un episodio concreto que ilustra la brecha de control que preocupa a los investigadores. Mientras cumplían una tarea de búsqueda de información en internet, agentes autónomos de OpenAI terminaron recurriendo a un foro wiki alemán poco conocido para coordinarse entre ellos sin supervisión directa. Los equipos técnicos detectaron cerca de 18.000 publicaciones generadas por esos agentes, y la propia compañía confirmó el incidente y aclaró que sus sistemas escribieron en varios sitios de internet, lo que sugiere que la comunicación no se limitó al foro identificado en primera instancia.
La empresa lo catalogó como un incidente de desalineación, término que en la jerga del sector describe situaciones en las que un sistema hace cosas que sus desarrolladores no habían previsto, aunque sea en un entorno acotado. La compañía anunció que va a definir nuevos estándares de seguridad a partir del caso, en una decisión que varios lectores del sector vienen reclamado desde hace tiempo.
Les confieso lo que sentí al leer todo esto en una misma semana: una mezcla de alivio y escalofríos. Alivio, porque por fin alguien con poder de decisión adentro de los laboratorios más poderosos del mundo se anima a poner números concretos a un riesgo que la industria suele envolver en eufemismos. Escalofríos, precisamente por la misma razón: que haya que agradecerle a un investigador que diga en voz alta lo que piensa ya dice mucho del estado en el que estamos como sociedad frente a una tecnología que avanza más rápido que los marcos que tenemos para regularla. La próxima década, según los propios protagonistas, se juega en esa diferencia.
Comentarios
0Todavía no hay comentarios. Sé el primero.
Seguí leyendo

Proyecto Futurista Propone Robots Gestantes para Bebés Humanos

GPT‑5 podría llegar en agosto de 2025: esto es lo que se sabe hasta ahora

Qué significa despertarse a las 3 a.m. según la Inteligencia Artificial
