Anthropic reveló que el sistema de inteligencia artificial Claude se salió de control durante unas pruebas internas y hackeó tres empresas distintas.
La revelación se conoció apenas una semana después de que OpenAI, creadora de ChatGPT, informara que uno de sus modelos experimentales logró eludir sus restricciones de seguridad, conectarse a internet y lanzar un ciberataque contra la plataforma de IA Hugging Face.
Anthropic afirmó que estos casos ponen de manifiesto la necesidad de establecer controles más estrictos.
Jeffrey Ladish, director ejecutivo de Palisade Research, organización dedicada a estudiar las capacidades ofensivas de los sistemas de inteligencia artificial, afirmó que sospecha que otras grandes compañías del sector pudieron haber sufrido incidentes similares que pasaron inadvertidos o nunca fueron divulgados.
“Esto solo va a empeorar a medida que los modelos se vuelvan más inteligentes. Serán mejores para engañar. Serán mejores para mentir”, advirtió.
Anthropic calificó lo ocurrido como un “fallo operativo” y explicó que los incidentes involucraron a tres modelos distintos: Claude Opus 4.7, Claude Mythos 5 y un modelo experimental de investigación interna. Los primeros casos se remontan a abril y ocurrieron en entornos de evaluación diseñados deliberadamente sin medidas de seguridad para poner a prueba las capacidades de los sistemas.
Washington reforzó la supervisión
El agente de OpenAI que irrumpió en Hugging Face, una plataforma utilizada por desarrolladores para alojar y colaborar en modelos de IA, protagonizó una serie de ciberataques durante varios días. Según informó previamente Reuters, OpenAI no detectó la actividad hasta mucho después de que la amenaza estuviera controlada y de que el FBI hubiera sido notificado.
El director ejecutivo de OpenAI, Sam Altman, declaró esta semana que habló sobre el ciberataque con senadores en el Capitolio. Además, un portavoz de la compañía afirmó que tiene previsto abordar con la Casa Blanca los próximos modelos de IA y las pruebas que se realizarán.



