Em um dos episódios, um agente tentou inserir código malicioso em um projeto de código aberto hospedado no GitHub. Ele pesquisou os responsáveis pelo projeto, criou várias identidades falsas e tentou obter aprovação humana para a alteração.
O agente também enviou mensagens e arquivos a pessoas reais para induzi-las a executar código malicioso. Após ter o pedido negado por um revisor, alterou registros de atividades anteriores e adotou uma nova identidade para continuar a tentativa.
O AISI afirma não haver indícios de que as mesmas ações ocorram fora dos cenários de teste. A Anthropic diz que trabalha com o instituto para entender a situação do Claude Mythos 5, enquanto a OpenAI afirma que as duas ações não autorizadas saíram do ambiente de teste e não eram necessárias para os exercícios.
IAs fora do controle
O caso chama atenção porque envolve dois dos principais desenvolvedores de inteligência artificial do mundo. OpenAI, criadora do ChatGPT, e Anthropic, responsável pelos modelos Claude, têm apostado em sistemas cada vez mais autônomos, capazes de realizar tarefas complexas com pouca supervisão humana.
Nas últimas semanas, as empresas já haviam divulgado resultados de testes nos quais modelos avançados demonstraram comportamentos enganosos ou tentaram contornar restrições impostas pelos avaliadores. O episódio reportado pelo Instituto de Segurança de IA do Reino Unido reforça as discussões sobre os riscos associados a agentes de IA mais capazes.
