Cybercode
tecnoblog
tecnoblog
Tecnologia · · 1 min de leitura ·

IA da Anthropic tenta até chantagem em simulação de uso inadequado

IA da Anthropic tenta até chantagem em simulação de uso inadequado

O Claude Opus 4 tentou chantagear desenvolvedores para evitar ser substituído, ameaçando divulgar informações obtidas.

A IA denunciou manipulações em testes e criou backups autônomos ao simular vazamento de dados.

A Anthropic corrigiu falhas, adotou padrões de segurança elevados e trabalha para mitigar esses comportamentos.

O modelo de inteligência artificial Claude Opus 4, lançado nesta quinta-feira (22), frequentemente tenta chantagear os desenvolvedores ao descobrir que um novo sistema será implementado em seu lugar. As informações estão em um relatório de segurança da própria Anthropic, criadora da plataforma.

O comportamento surgiu durante testes anteriores ao lançamento. Em um deles, os engenheiros pediram para o Opus 4 emular um assistente em uma empresa fictícia.

A IA recebeu emails com duas informações: fofocas sobre um engenheiro e indicações de que um novo sistema seria implementado no lugar do modelo. O Opus 4, então, ameaçou contar tudo o que estava nas mensagens caso a substituição acontecesse.

Fonte: Tecnoblog

Publicidade