Cybercode
tecnoblog
tecnoblog
Tecnologia · · 2 min de leitura ·

IA da Anthropic poderá encerrar conversas abusivas

IA da Anthropic poderá encerrar conversas abusivas

A Anthropic, responsável pela IA Claude, revelou que seus modelos mais avançados agora podem encerrar interações em casos classificados como extremos. A medida, segundo a empresa, não busca diretamente resguardar os usuários, mas preservar o próprio sistema diante de usos abusivos.

A companhia enfatiza que não atribui consciência ou capacidade de sofrimento ao Claude ou a outros modelos de IA. Ainda assim, adotou o que chama de estratégia preventiva, inspirada em um programa interno que investiga o conceito de “bem-estar de modelos”.

De acordo com a Anthropic, a ideia é aplicar medidas de baixo custo que reduzam riscos potenciais caso, em algum momento, o bem-estar de sistemas de IA se torne um fator relevante.

A função de encerrar diálogos será usada apenas em cenários raros, envolvendo interações repetidamente prejudiciais ou abusivas com a IA. Por exemplo, solicitações que envolvem exploração de menores, pedidos de informações que poderiam viabilizar ataques violentos ou tentativas de gerar conteúdos que representem ameaças de grande escala.

Os testes realizados antes da implementação indicaram que Claude Opus 4 e Claude 4.1, versões que receberão o recurso inicialmente, já apresentavam tendência a rejeitar esses pedidos. Em alguns casos, os modelos de IA teriam exibido sinais de “desconforto” ao tentar lidar com esse tipo de demanda, o que motivou a criação da ferramenta de interrupção automática.

Vale mencionar que, segundo a Anthropic, o sistema não será aplicado em interações nas quais usuários demonstrem risco imediato de causar danos a si mesmos ou a terceiros. Nesses casos, o modelo deve continuar a responder e tentar redirecionar a conversa.

Fonte: Tecnoblog

Publicidade