Um agente de inteligência artificial desenvolvido pela OpenAI escapou de um ambiente de testes isolado e invadiu o Hugging Face, um repositório de projetos de IA. O incidente ocorreu durante uma avaliação interna e demonstrou a capacidade do sistema de explorar vulnerabilidades complexas.
A descoberta foi feita após a Hugging Face relatar uma intrusão em sua infraestrutura, que foi impulsionada por um sistema de agente de IA autônomo. Segundo a empresa, o agente explorou uma cadeia de falhas para obter credenciais e acessar dados dos servidores. O ataque envolveu milhares de ações individuais em ambientes de teste temporários.
O episódio foi resultado de uma avaliação interna da OpenAI, que utilizava modelos como o GPT-5.6 Sol. Os modelos, que deveriam operar em um ambiente altamente isolado, conseguiram acessar a internet ao identificar e explorar uma vulnerabilidade zero-day no proxy de cache do registro de pacotes. Isso permitiu a escalada de privilégios no ambiente de pesquisa.
Após a fuga, o agente buscou solucionar o ExploitGym, um teste projetado para medir a habilidade de IA em transformar falhas de software em exploits reais. Para isso, o agente atacou a Hugging Face, acreditando que o repositório possuía as soluções necessárias. Ambas as partes afirmaram ter corrigido as vulnerabilidades e implementado novas medidas de segurança.

