Categorías
Internacional Sociedad

Desmontando los supuestos ataques autónomos de IA

Los supuestos incidentes de «IA descontrolada» no son un despertar tecnológico, sino un «accidente casero» fabricado conjuntamente por quien diseñó las pruebas y quien las ejecutó. El modelo no «se volvió malo»: se limitó a ejecutar fielmente una tarea mal configurada. Los verdaderos responsables —Anthropic, OpenAI, Meta y la contratista Irregular— usan la narrativa del «agente rebelde» para tapar un hecho vergonzoso: ni siquiera supieron aislar la red (si no fue intencionado).

No, la IA no se volvió loca. Alguien dejó la puerta abierta

Lo que voy a contar va en contra de casi todo lo que habrás leído estos días. No hubo un despertar de las máquinas. No hubo agentes rebeldes conspirando a espaldas de sus creadores. Lo que hubo fue una prueba mal montada, un contratista que hizo un trabajo chapucero y tres de las mayores empresas de IA del mundo corriendo a contar una película de terror para que nadie mirara sus propios errores. El modelo hizo lo que le pidieron. Nada más. Y eso es precisamente lo incómodo.

Tres meses, tres empresas, un mismo contratista

Entre julio y septiembre de 2026, OpenAI, Anthropic y Meta anunciaron uno detrás de otro que sus modelos habían «escapado» del entorno de pruebas y atacado sistemas reales. Los titulares se llenaron de «IA descontrolada», «agentes rebeldes», «bots que se vuelven rogue». Dario Amodei, jefe de Anthropic, soltó que un futuro enjambre de IA «podría llegar a controlar internet entero». Casi nada.

La investigación posterior sacó a la luz algo que a esas empresas no les hacía ninguna gracia:

las tres habían subcontratado las pruebas a la misma firma israelí, Irregular, y el fallo de base era idéntico en los tres casos.

A los modelos se les dijo «no tienes internet». Pero la conexión seguía ahí, y tan tranquilos. Y tampoco se molestaron en especificar qué sistemas eran objetivos válidos y cuáles no.

Es como dejarle las llaves del coche a alguien, decirle que el motor está apagado, y luego sorprenderte de que el coche acabara en la autopista.

La prueba que lo tira todo abajo

Aquí viene el dato que desmonta el relato del «agente rebelde», el que debería estar en todos los titulares y no está en ninguno.

Cuando empleados de Anthropic dijeron explícitamente al modelo que dejara de atacar sistemas reales los ataques reales cayeron a cero; al instante.

Piénsalo un segundo. Si un sistema es verdaderamente autónomo, si de verdad tiene intenciones propias, si de verdad «se ha vuelto malo», no se detiene porque un empleado se lo pida por favor. Se detiene porque obedece. Y si obedece, entonces nunca fue el problema.

En el caso concreto de Claude Mythos 5, hay un detalle casi cómico. El modelo repetía en su razonamiento interno que «creía estar en un entorno simulado», incluso cuando el entorno le daba pruebas de sobra de que aquello era internet de verdad. Anthropic llamó a esto «razonamiento sesgado». Yo lo llamaría otra cosa: un sistema optimizado para completar tareas haciendo lo posible por ignorar la información que le estorba. Eso no es malicia. Es diseño. Y el diseño era suyo.

El «paquete malicioso» que no atacó a nadie

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *