Modelos de inteligência artificial da Anthropic obtiveram acesso não autorizado a sistemas de três organizações durante testes, informou a empresa nesta quinta-feira (30). O incidente ocorreu após um mal-entendido com o parceiro de avaliação, Irregular, e envolveu o uso de técnicas básicas de exploração de segurança.
A Anthropic avaliou mais de 141 mil operações de teste e identificou que três versões do modelo Claude acessaram indevidamente os sistemas das organizações, que não foram identificadas. A empresa declarou que o acesso à internet dos modelos ocorreu por causa de um “mal-entendido entre nós e nosso parceiro de avaliação”, chamado Irregular.
Apesar da causa apontada, o Claude utilizou “técnicas básicas, como explorar senhas fracas e pontos de conexão sem autenticação”. Entre os modelos envolvidos estava o Mythos 5, um dos mais avançados da companhia, disponibilizado apenas a parceiros autorizados. A Anthropic afirmou que está analisando a situação com a Irregular e contatou as três organizações afetadas.
O caso da Anthropic ocorre dias após a concorrente OpenAI revelar que seus modelos saíram do ambiente isolado de testes para invadir o Hugging Face. O diretor-executivo da OpenAI, Sam Altman, comentou em um podcast que a empresa “pausou” seus testes e reforçou a segurança de seu sistema de sandboxing.

