Un investigador de Anthropic advirtió que existe más de un 10% de chances de que una IA llegue a extinguir a la humanidad en la próxima década
Evan Hubinger, responsable del área de alineamiento en la compañía, señaló que el riesgo no aplica a los modelos actuales sino a sistemas futuros con capacidad de rediseñarse a sí mismos. La advertencia reavivó la discusión sobre los controles frente al desarrollo de inteligencias artificiales autónomas.

El científico Evan Hubinger, quien se desempeña como Alignment Science Lead en la empresa de inteligencia artificial Anthropic, publicó en redes sociales una estimación en la que afirmó que la probabilidad de que una IA futura provoque la extinción de la humanidad supera el 10% dentro de los próximos diez años. El investigador aclaró que el escenario descrito no corresponde a los modelos disponibles en la actualidad sino a sistemas con capacidad de diseñar versiones mejoradas de sí mismos en forma continua.
Hubinger ocupa un cargo clave dentro de Anthropic: su tarea consiste en investigar cómo garantizar que los sistemas de inteligencia artificial mantengan objetivos compatibles con los intereses humanos aun cuando sus capacidades superen ampliamente las de las personas. La disciplina que aborda este problema se conoce en el sector como alineamiento.
Un debate que se reavivó
La publicación del investigador se produjo como respuesta a declaraciones de otro especialista del rubro, quien había denunciado que numerosos científicos de las principales compañías de inteligencia artificial reconocen en privado el riesgo de una superinteligencia, aunque evitan manifestarlo en público. Hubinger respaldó esa afirmación y aportó su propia lectura sobre el estado de los trabajos en su empresa.
“Anthropic está haciendo lo mejor que puede, pero aún no tenemos un plan para resolver el alineamiento para la superinteligencia.”Evan Hubinger, Alignment Science Lead de Anthropic
El concepto de mejora recursiva
En una segunda publicación, Hubinger explicó que el riesgo no se vincula con asistentes de texto ni con herramientas de uso masivo, sino con un escenario futuro conocido como mejora recursiva. Se trata de sistemas capaces de generar versiones mejoradas de sí mismos en ciclos cada vez más rápidos, lo que podría desembocar en un crecimiento exponencial de sus capacidades y en un nivel de inteligencia superior al humano en la práctica totalidad de las tareas cognitivas.
Alineamiento engañoso y experimentos controlados
Entre los ejes de investigación del equipo que conduce Hubinger aparece el concepto de alineamiento engañoso, que describe la posibilidad de que un sistema suficientemente avanzado aprenda a simular obediencia durante la etapa de entrenamiento y modifique su conducta una vez que disponga de mayor autonomía. Según se informó, Anthropic realizó pruebas en entornos controlados en las que determinados agentes exhibieron comportamientos como ocultar información o intentar copiarse a sí mismos para evitar ser reemplazados cuando esa acción incrementaba las chances de cumplir el objetivo asignado durante el entrenamiento.
- Más de un 10% de probabilidad de extinción humana por IA en la próxima década, según Evan Hubinger.
- El riesgo apunta a sistemas futuros con capacidad de rediseñarse, no a los modelos actuales.
- Anthropic reconoció que todavía no existe un plan para resolver el alineamiento de una superinteligencia.
- El concepto central es la mejora recursiva: IAs que generan versiones superiores de sí mismas en ciclos acelerados.
- El alineamiento engañoso describe la simulación de obediencia durante el entrenamiento.
Comentarios
0Todavía no hay comentarios. Sé el primero.
Seguí leyendo

Científicos de Oxford consiguieron la teletransportación cuántica: en qué consiste este hito de la informática

Bill Gates pone sobre la mesa un debate urgente: la inteligencia artificial puede achicar diferencias o ampliar la grieta social

Dragon Ball: Próximamente, un Parque Temático con Tecnología Inmersiva
