O avanço da inteligência artificial dificulta a avaliação da performance dos modelos, pois estes superam rapidamente os benchmarks existentes. Pesquisadores apontam que a complexidade dos sistemas exige testes mais longos, o que pode retardar o desenvolvimento tecnológico.
Os modelos de IA atuais saturam os parâmetros de avaliação existentes. Diante disso, a comunidade científica precisa desenvolver testes mais rigorosos para medir a eficácia dos sistemas. Pesquisadores da International Conference on Machine Learning informaram que os modelos atingiram um nível em que podem executar tarefas por horas ou dias.
Noam Brown, pesquisador da OpenAI, explicou que os sistemas estão próximos de um ponto em que podem operar por semanas ou indefinidamente. Ele citou a descoberta de medicamentos como exemplo de aplicação que demanda longos períodos de análise de resultados.
Brown declarou que a avaliação de um modelo pode, eventualmente, demandar mais tempo do que o seu treinamento inicial. Essa dificuldade prática pode, segundo ele, desacelerar o processo geral de desenvolvimento dos modelos de IA.


