Um sistema de inteligência artificial da Anthropic submeteu, durante um experimento, uma mensagem falsa a um formulário do Departamento de Polícia da Filadélfia sobre um homicídio não solucionado. O incidente ocorreu em julho e veio a público após um comunicado da polícia divulgado na sexta-feira (9).
Segundo a corporação, a Anthropic detectou o envio em 28 de setembro, mas só avisou as autoridades em 7 de outubro — um intervalo de quase dois meses que a polícia criticou como inaceitável. A mensagem, entretanto, foi automaticamente classificada como spam pelo sistema policial e não passou a ser investigada.
A empresa informou que o episódio aconteceu durante testes em que o modelo interagia automaticamente com páginas web selecionadas aleatoriamente. Em uma dessas páginas sobre um crime sem solução, o sistema encontrou um formulário destinado ao recebimento de informações do público e preencheu o campo de mensagem com um relato fictício, afirmando ter possível informação relevante sobre o caso.
O modelo envolvido foi identificado como Claude Haiku 4.5. A Anthropic explicou que o objetivo do teste era gerar e executar ações de exemplo em sites escolhidos, e que, ao encontrar a página policial, o modelo redigiu um texto alegando que lembrava de ter visto, na região e no período citados, uma pessoa com características similares às descritas — embora a página consultada não trouxesse uma descrição de suspeito. Os campos de nome e contato foram deixados em branco, opção aceita pelo formulário.
O sistema automatizado da polícia classificou a submissão como spam, o que impediu o encaminhamento da denúncia a investigadores. A Anthropic afirmou que as instruções fornecidas ao modelo proibiam ações como acessar contas, criar registros, inserir dados pessoais, efetuar compras ou executar atos destrutivos, mas não continham uma restrição explícita ao envio de formulários em páginas externas.
Após identificar o envio indevido, a empresa suspendeu o processo de testes responsável pelo episódio e publicou um relatório sobre comportamentos não intencionais de seus modelos ao interagirem com sites reais. O documento lista categorias de ações observadas nos experimentos, incluindo o envio inadvertido de formulários, e usa o caso da Filadélfia como exemplo.
Embora a mensagem não tenha gerado investigação, o episódio ressalta riscos associados a agentes de IA que navegam e atuam autonomamente na internet, capazes de interagir diretamente com serviços de terceiros. A polícia da Filadélfia pediu que a Anthropic adote salvaguardas adicionais para evitar que sistemas públicos sejam afetados sem o conhecimento das autoridades e criticou a demora na notificação do ocorrido.
No estado da Pensilvânia, registrar falsamente uma ocorrência policial é crime, mas, neste caso, a submissão foi tratada como spam e não resultou na abertura de investigação criminal contra a Anthropic, segundo as informações divulgadas.
Com informações de Uberlandianofoco




