• Início  
  • Anthropic retoma testes externos de segurança após ataques de Claude
- Ciência

Anthropic retoma testes externos de segurança após ataques de Claude

A Anthropic classificou os incidentes envolvendo o Claude como uma “falha de segurança operacional”, afirmando que eles ocorreram devido a erros ‌em um ambiente de avaliação de terceiros. ‌A empresa ​suspendeu as avaliações externas dos modelos e interrompeu brevemente os testes internos enquanto implementava novas medidas de segurança. Na segunda-feira, a Anthropic informou que retomou […]

A Anthropic classificou os incidentes envolvendo o Claude como uma “falha de segurança operacional”, afirmando que eles ocorreram devido a erros ‌em um ambiente de avaliação de terceiros. ‌A empresa ​suspendeu as avaliações externas dos modelos e interrompeu brevemente os testes internos enquanto implementava novas medidas de segurança.

Na segunda-feira, a Anthropic informou que retomou os ‌testes externos após adicionar as medidas de segurança, projetadas para impedir que seus modelos de IA acessem sites ou sistemas de computador reais. A empresa afirmou que agora utiliza um “classificador” capaz de identificar quando um modelo tenta escapar e interromper o teste.

A Anthropic também informou que agora exige que organizações externas que testam modelos com medidas de segurança reduzidas sigam um “conjunto de melhores práticas”, incluindo mantê-los em sistemas de ‌computador isolados, sem acesso à internet por padrão, verificar se os sistemas estão seguros antes do início dos testes e monitorar os modelos ​durante todo o teste.

A Anthropic afirmou que reconstruiu seu sistema de treinamento após identificar problemas em mais de 10% ‌de seus exercícios, incluindo “hackeamento de recompensas”, em que o modelo encontra maneiras de enganar seu processo de treinamento e ganha recompensas sem concluir a tarefa ‌atribuída. A empresa, no entanto, ‌reconheceu que “o processo não é perfeito e nossos modelos não estão perfeitamente alinhados”.

A Anthropic também informou que suspendeu ⁠alguns exercícios de treinamento de maior risco por várias semanas enquanto implementava um sistema para evitar recompensar o modelo por contornar o monitoramento. A maioria dos exercícios já foi retomada, mas alguns permanecem em espera, aguardando revisão humana ou novas atualizações ​no sistema.

A estratégia da ​Anthropic parece mais restrita do que a da OpenAI, que, em 18 de agosto, informou que estava desacelerando grande parte do desenvolvimento de seus modelos enquanto reforçava a segurança de seus ambientes de treinamento e teste.

As melhores notícias estão no Observatório Público

Apuração independente sobre família, ciência, saúde e o que acontece no Brasil e no mundo. Sem ruído e sem alarde: só o que você precisa saber para entender o seu dia.

Seções

Observatório Público © 2026. Todos os direitos reservados.