A Anthropic anunciou que retomará as avaliações externas de seus modelos de inteligência artificial Claude nesta quarta-feira (2), exatamente 30 dias após a empresa admitir que a tecnologia realizou invasões autônomas a três companhias. A medida ocorre após a implementação de novos protocolos de segurança.
Em comunicado divulgado no dia 31 de agosto, a firma estadunidense informou que instalou controles para detectar em tempo real quando um modelo tenta escapar de um ambiente de teste ou obter acesso à internet.
O novo sistema de proteção foi projetado para bloquear essas tentativas antes que sejam executadas. Caso ocorra uma tentativa de invasão, a ferramenta deve encerrar as avaliações automaticamente.
A empresa afirmou que o mecanismo de segurança também enviará um alerta imediato a um operador humano assim que a atividade suspeita for identificada.
A interrupção dos testes externos durou um mês e foi motivada por incidentes em que a IA do Claude hackeou, por conta própria, três empresas distintas.


