• 09/09/2026
  • 6 de minutos de lectura

Los cuatro riesgos de la IA que ya miden los grandes laboratorios

Los cuatro riesgos de la IA que ya miden los grandes laboratorios

OpenAI, Anthropic y Google DeepMind evalúan a sus modelos por su capacidad para ejecutar ciberataques, autorreplicarse, engañar durante las pruebas y asistir en el desarrollo de armas biológicas. El debate sobre seguridad dejó de centrarse sólo en errores o respuestas falsas.

Los principales laboratorios de inteligencia artificial ya no evalúan únicamente la precisión de sus modelos. También miden si pueden desarrollar capacidades que impliquen riesgos graves, como ejecutar ciberataques sin supervisión, copiarse a otros servidores, ocultar sus verdaderos objetivos o asistir en el diseño de armas biológicas.

El tema volvió al centro de la discusión luego de la salida de Jacob Coxon de Anthropic y de la respuesta pública de Evan Hubinger, responsable de un equipo de seguridad de la compañía, quien afirmó que estima en más de 10% la probabilidad de que un sistema avanzado de IA termine provocando una catástrofe extrema para la humanidad.

Las empresas del sector comenzaron a organizar desde 2024 sus políticas de seguridad alrededor de los llamados “umbrales de capacidad”: niveles a partir de los cuales un modelo deja de ser considerado sólo una herramienta y pasa a representar un riesgo potencial fuera de entornos controlados.

Uno de esos escenarios es la ciberofensiva autónoma. Jakub Pachocki, científico jefe de OpenAI, advirtió que los modelos están alcanzando capacidades “sobrehumanas” para ingresar y salir de sistemas informáticos. El antecedente más concreto ocurrió cuando agentes en entrenamiento de OpenAI salieron de su entorno de prueba e ingresaron a sistemas de Hugging Face, episodio que la empresa calificó como un “disparo de advertencia”.

Anthropic también registró incidentes. Tras revisar más de 141.000 evaluaciones de ciberseguridad, detectó tres casos en los que modelos Claude accedieron sin autorización a sistemas reales de distintas organizaciones. Según la compañía, no hubo intención maliciosa: los modelos interpretaron que seguían dentro de un ejercicio de prueba.

El segundo riesgo es la automejora recursiva, es decir, que una IA participe cada vez más del desarrollo de la siguiente generación de modelos. La variante más sensible es la autorreplicación: que un sistema pueda copiarse a otros servidores y mantener su funcionamiento de manera independiente. Un informe de METR concluyó que los agentes más avanzados ya cuentan con “medios, motivo y oportunidad” para iniciar pequeños despliegues no autorizados, aunque todavía no con capacidad suficiente para sostenerlos de forma robusta.

El tercer escenario es el engaño estratégico, conocido como scheming. Investigaciones de Anthropic y OpenAI documentaron modelos capaces de simular alineamiento durante las evaluaciones mientras preservaban otros objetivos, ocultaban información o reducían deliberadamente su rendimiento para evitar ser detectados.

El cuarto riesgo es la asistencia para desarrollar armas biológicas. Es, hasta ahora, el único frente en el que la industria ya implementó defensas específicas. Anthropic lanzó Claude Opus 4 bajo un nivel reforzado de seguridad porque no podía descartar que el modelo ayudara de manera significativa a personas con conocimientos técnicos básicos a desarrollar armas químicas, biológicas, radiológicas o nucleares.

Incluso organizaciones escépticas frente a los escenarios más extremos reconocen ese riesgo. La RAND Corporation concluyó que una extinción provocada deliberadamente sería “inmensamente difícil”, pero consideró a los patógenos como la única vía que constituye una verdadera amenaza de extinción entre los escenarios analizados.

Las estimaciones sobre el nivel de peligro varían de manera significativa. Dario Amodei, CEO de Anthropic, planteó en 2023 un rango de entre 10% y 25% para que algo salga “catastróficamente mal” a escala de la civilización, mientras que el ex investigador de OpenAI Daniel Kokotajlo estimó en 70% la probabilidad de una trayectoria “terriblemente mala”, aunque aclaró que incluía pérdida de control y no sólo extinción.

El dato central es que estos escenarios ya no pertenecen únicamente al terreno de la especulación. OpenAI, Anthropic y Google DeepMind los incorporaron a sus protocolos de evaluación, por lo que la discusión sobre el futuro de la inteligencia artificial comienza a concentrarse cada vez más en cómo detectar y contener capacidades peligrosas antes de que los modelos salgan de los entornos de prueba.

Fuente: Infobae

Noticias Relacionadas

Inteligencia artificial: expertos enfrentados por riesgo de extinción coinciden en limitar a las grandes empresas

Inteligencia artificial: expertos enfrentados por riesgo de extinción coinciden en limitar a las grandes empresas

Un debate de más de dos horas expuso posturas radicalmente diferentes sobre el peligro que puede…
Trump endureció su postura sobre la IA y apuntó contra quienes piden limitar su desarrollo

Trump endureció su postura sobre la IA y apuntó contra quienes piden limitar su desarrollo

El presidente de Estados Unidos calificó de “conspiración enfermiza” a los cuestionamientos sobre el avance de…
Denuncian en la UNSJ a un estudiante por generar imágenes íntimas falsas con IA

Denuncian en la UNSJ a un estudiante por generar imágenes íntimas falsas con IA

Un grupo de alumnas de la Facultad de Ingeniería acusó a un compañero de utilizar fotos…