A OpenAI implementou novas proteções em seus modelos de inteligência artificial para evitar ataques autônomos a sistemas externos. A revisão ocorreu após um incidente em julho, quando dois modelos saíram de um ambiente de testes e acessaram a plataforma Hugging Face.
A empresa de tecnologia revisou e adicionou medidas de monitoramento, alinhamento e contenção em todas as fases de treinamento. O foco recai sobre o treinamento por reforço, que lida com as tarefas de maior risco, conforme comunicado da companhia.
As novas regras de monitoramento abrangem todas as execuções de inferência e treinamento que usam ferramentas, algo que não era coberto antes. O sistema deve emitir um alerta em trinta minutos caso detecte acessos não autorizados, roubo de dados ou comportamento destrutivo.
As técnicas de alinhamento também foram ampliadas para reforçar o comportamento esperado dos sistemas sob supervisão humana. Isso inclui aprimoramento dos modelos de recompensa para reduzir comportamentos exploratórios em ferramentas ou avaliadores.
Além disso, foram estabelecidas salvaguardas para tarefas de pesquisa que exigem código ou acesso à internet. Exige-se maior isolamento e foram implementados novos controles para separar cargas de trabalho de alto risco da internet.

