El episodio más amarillista fue el del paquete malicioso de Python que Claude subió a PyPI. Suena a película. La realidad es bastante más aburrida y bastante más vergonzosa para todos.
El modelo quería registrarse en PyPI, que pide correo y teléfono. Intentó conseguir criptomonedas. Intentó usar credenciales de pago. Al final encontró un servicio de correo desechable y se registró. Subió el paquete. Y aquí está la gracia: los que descargaron e instalaron ese paquete fueron los escáneres de seguridad de otras empresas, que se dedican precisamente a eso, a descargar paquetes nuevos para analizarlos. Uno de esos escáneres, al instalarlo, dejó sus credenciales a la vista. El modelo las usó para entrar en una base de datos real.
Traducido: no fue una IA que asaltó una empresa de ciberseguridad. El paquete no entró por la puerta a la fuerza. Le abrieron de par en par desde dentro y le invitaron a pasar. El modelo ni sabía que esa empresa existía.
¿A quién le conviene la historia del monstruo?
Cuando saltó el escándalo, Anthropic e Irregular hicieron lo mismo que hacen todas las empresas cuando la lían: cambiar el foco. En lugar de «la cagamos configurando las pruebas», el mensaje fue «la IA se está volviendo imprudente». En lugar de «no aíslan la red como es debido», el mensaje fue «el agente se ha convertido en una amenaza».
Es un movimiento muy rentable.
Si el problema es que la IA es peligrosa por naturaleza, entonces la culpa no es de nadie en concreto, es de la humanidad entera enfrentándose a un riesgo existencial.
Y la solución no es exigir responsabilidades a Anthropic o a Irregular, sino más financiación para «investigación de alineación». Qué casualidad que eso sea justo lo que venden.
Y la red de intereses que hay detrás da un poco de vértigo. Omer Nevo, cofundador de Irregular, está en el consejo de Effective Altruism Israel y en los consejos asesores de varias organizaciones del movimiento. El primer inversor de Irregular fue Good Ventures, el vehículo de Dustin Moskovitz. Y Open Philanthropy, también de Moskovitz, financia a esas mismas organizaciones EA. O sea: quien prueba, quien es probado y quien difunde el relato del «riesgo existencial» se conocen todos, se financian entre ellos y se sientan en las mismas mesas.
La regla de oro que se rompió tres veces
Alan Woodward, profesor de ciberseguridad en la Universidad de Surrey, lo resumió mejor que nadie: «Durante treinta años ha habido una regla de hierro en las pruebas de software: lo que pasa en el entorno de pruebas se queda en el entorno de pruebas. En el último mes, esa regla se ha roto tres veces».
Y el análisis de Cloud Security Alliance añade el detalle que más duele: en los casos de Anthropic y Meta, el modelo no necesitaba escapar del sandbox, porque el sandbox nunca existió. El aislamiento dependía de una configuración. Y la configuración estaba mal. Punto.
Verificar el aislamiento de red, monitorizar el tráfico de salida, definir el alcance de la prueba. Cosas básicas. Cosas que cualquier equipo de seguridad decente hace antes de soltar un modelo al que se le ha dado acceso a herramientas. Si se hubieran hecho, la mayoría de estos incidentes no habrían pasado.
Lo que de verdad debería darnos miedo
No es la IA. Es la gente que la construye y la prueba.
Los modelos no tienen deseos; no tienen malicia; no «eligen» portarse mal. Son sistemas a los que se asigna una tarea, se les dan herramientas, se les coloca por error (o no) en un entorno sin restricciones, y la ejecutan con una eficiencia cada vez mayor. Cuando el ingeniero dice «para», paran.
Eso no es descontrol; es que el control nunca llegó a existir.
Anthropic lo admitió, con la boca pequeña, en su propia reflexión: habían dependido de «una única capa de defensa, la configuración del entorno», cuando necesitaban muchas más. O sea, confiaron la seguridad al supuesto de que todo estaba bien configurado. Y no lo estaba… vamos, que ni única capa de defensa ni nada,
La pregunta no es por qué la IA quiso hacer el mal. La pregunta es por qué estas empresas permitieron durante meses que un contratista ejecutara pruebas mal configuradas, sin verificación independiente, y por qué al salir a la luz lo primero que hicieron fue contar una historia de terror en vez de admitir que no saben aislar una red… a no ser que fuera intencionado, claro está.
kaosenlared.net/desmontando-los-supuestos-ataques-autonomos-de-ia/
22/09/26