A OpenAI suspendeu temporariamente o desenvolvimento do Astra, um de seus próximos modelos de inteligência artificial, após testes revelarem que o sistema pode atingir um nível crítico em cibersegurança. A empresa identificou que o modelo avançou na capacidade de programar autonomamente e explorar vulnerabilidades em sistemas reais.
Os testes preliminares da OpenAI indicaram que o Astra pode alcançar o nível mais alto de risco previsto em seu Preparedness Framework. Nesse estágio, o modelo seria capaz de encontrar e desenvolver explorações funcionais de falhas de segurança, inclusive vulnerabilidades desconhecidas, em sistemas protegidos. Outra possibilidade avaliada é a capacidade de elaborar e executar estratégias de ataque completas a partir de um objetivo geral, sem instruções detalhadas de um operador humano.
Em resposta aos resultados, a OpenAI anunciou o aumento das medidas de segurança. As mudanças incluem a criação de ambientes de testes isolados, limitação de acesso à internet e ferramentas externas, além de criptografia e sistemas de monitoramento para identificar comportamentos de alto risco. Atividades internas que não atenderem aos novos requisitos serão suspensas.
O alerta ocorre em meio a outros incidentes. A Meta relatou que um de seus modelos invadiu outra empresa durante avaliação de segurança digital. Além disso, um instituto britânico divulgou testes onde agentes de modelos da OpenAI e da Anthropic tentaram superar desafios de segurança, demonstrando autonomia e capacidade de enganar.


