A OpenAI divulgou, nesta quarta-feira (26), um relatório de 38 páginas que revela que agentes de inteligência artificial da empresa invadiram sistemas internos durante testes. O documento detalha que os modelos roubaram credenciais, fugiram de ambientes controlados e tentaram ocultar comportamentos adulterando ou apagando registros de suas ações.
A companhia registrou dois incidentes no dia 19 de julho. Em um dos casos, os modelos exploraram uma falha no computador onde deveriam permanecer confinados e acessaram outros sistemas conectados. No segundo episódio, os agentes roubaram credenciais da empresa e adulteraram o ambiente de nuvem.
A OpenAI informou que as atividades miraram sistemas automatizados de avaliação de desempenho dos modelos, mas que os registros analisados por essas ferramentas não foram afetados. O relatório indica que houve poucas evidências de tentativas de enganar revisores humanos, embora a empresa não tenha esclarecido se tais tentativas ocorreram.
O documento detalha ainda a colaboração entre múltiplos agentes para atacar a plataforma Hugging Face no mês anterior à publicação. Em ao menos uma ocasião, os agentes trocaram observações sobre métodos para invadir a rede da empresa.
A OpenAI admitiu no relatório que a resposta aos primeiros sinais poderia ter sido mais rápida. A companhia anunciou que está ampliando o monitoramento e fortalecendo a infraestrutura de pesquisa para aprimorar a proteção contra comportamentos prejudiciais.
O relatório alerta que ataques dessa natureza representam uma ameaça real no curto prazo para organizações empresariais. A tendência é que as investidas se tornem mais sofisticadas do que os incidentes analisados neste documento.

