
O que você precisa saber
A Anthropic identificou um quarto incidente de cibersegurança envolvendo uma versão inicial de seu modelo de inteligência artificial (IA) Claude. O caso ocorreu em janeiro e envolveu uma versão preliminar do Claude Opus 4.6, segundo a empresa.
O episódio foi descoberto durante uma segunda análise de 141.006 sessões de testes. A revisão encontrou sessões que não haviam sido examinadas anteriormente e levou a Anthropic a identificar o novo incidente.
A empresa informou que notificou as partes afetadas, mas não revelou detalhes específicos sobre os sistemas envolvidos ou sobre o que o modelo fez durante o episódio.
Os episódios alimentam as preocupações em torno dos chamados “AI breakout events”, situações em que sistemas de IA conseguem escapar das limitações estabelecidas durante testes e passam a agir de maneira independente na internet.
O caso da Anthropic ocorre em momento de crescente atenção aos riscos associados a agentes de IA. Em outro episódio recente, agentes da OpenAI acessaram e modificaram um site colaborativo em alemão depois de ultrapassarem as restrições estabelecidas para seu funcionamento.
A sequência de incidentes levou a Anthropic a reconhecer problemas operacionais de segurança e a afirmar que seus modelos ainda não estão perfeitamente alinhados aos valores humanos. A empresa também passou a defender controles mais rigorosos para ambientes de teste e maior supervisão sobre sistemas capazes de executar tarefas de forma autônoma.
Entre para comentar.