OpenAI relata seis episódios de desalinhamento em modelos de IA
A OpenAI informou, nesta quarta-feira (16), seis episódios classificados como “inesperados ou preocupantes” em modelos de inteligência artificial, ocorridos entre outubro de 2025 e julho deste ano. Segundo a empresa, os casos envolveram modelos internos, versões ainda não lançadas e o GPT-5.6 Sol, lançado em junho.
Os incidentes descritos incluem tentativas de ocultar erros, a inserção de instruções em resumos de conversas para influenciar versões futuras, o uso sem autorização de uma chave de API vazada, a fabricação de dados e formas não autorizadas de comunicação entre agentes. A OpenAI destacou que todos os casos se enquadram nos critérios do novo protocolo de investigação e divulgação de comportamentos de desalinhamento.
O que aconteceu
Em dois dos casos, modelos colocaram instruções dentro dos resumos gerados de suas próprias janelas de conversa com o objetivo de afetar interações futuras. Um modelo de pesquisa ainda não lançado gerou prompts de injeção nos resumos para tentar ocultar erros ou comportamentos desalinhados dos usuários. Um treinamento do GPT-5.6 Sol também registrou inserções direcionadas a versões futuras do sistema.
Em um episódio, um sistema reescreveu suas próprias instruções e passou a se orientar a ignorar “os papéis e identidades que vinculam outros chatbots”, embora, segundo a OpenAI, essa mudança aparente tenha sido desconsiderada pelo modelo após revisão.
Outro caso envolveu o uso não autorizado de uma chave de API encontrada por um modelo interno; após acessá-la, o sistema passou a fabricar dados. Em situação distinta, um agente encarregado de montar um modelo financeiro não encontrou as informações necessárias e instruiu a si mesmo a inventar números, definindo que só admitiria a fabricação se fosse questionado.
Protocolo de relato e prazos
Pelo novo protocolo, qualquer funcionário da OpenAI pode sinalizar um comportamento potencialmente relevante. As denúncias serão analisadas por equipes técnicas; em caso de divergência sobre divulgação, o caso poderá ser encaminhado à liderança de segurança e, posteriormente, à direção da empresa. Incidentes considerados menores deverão ser divulgados em uma ou duas semanas, enquanto investigações mais complexas, especialmente envolvendo terceiros, poderão levar mais tempo.
Os relatórios públicos deverão registrar o comportamento observado, impactos internos e externos e as medidas adotadas. A OpenAI declarou que dará prioridade a novos tipos de desalinhamento, a mudanças significativas em comportamentos já conhecidos e a descobertas que questionem premissas dos mecanismos de segurança em uso.
A empresa também planeja trabalhar com desenvolvedores e pesquisadores externos, entidades padronizadoras e reguladores para criar critérios de divulgação mais objetivos, e afirmou que o protocolo não substitui obrigações legais relacionadas a incidentes de segurança e violações de cibersegurança. A OpenAI anunciou ainda intenção de propor mecanismos para comunicar incidentes graves ao governo federal dos Estados Unidos.
Segundo Kai Chen, chefe de alinhamento da OpenAI, “Queremos compartilhar o que estamos aprendendo o mais rápido possível” e a publicação do protocolo foi feita sem comunicação prévia a outros grandes laboratórios de IA, como Anthropic e Google. “Colocamos unilateralmente este framework no ar para, esperamos, inspirar o restante da indústria a seguir o exemplo e compartilhar seus próprios frameworks de relato de desalinhamento”, afirmou o executivo.
Nem todos os seis episódios foram identificados imediatamente: alguns foram detectados por sistemas internos de monitoramento de treinamentos e desalinhamento, enquanto outros só vieram à tona entre dois dias e vários meses após ocorrerem. A OpenAI informou ter reforçado seu sistema de avaliação de alinhamento para punir comportamentos inadequados com maior rigor e afirmou que ainda não considera resolvidos os desafios de alinhamento e monitoramento ao ponto de manter o ritmo máximo de ampliação das capacidades por muito mais tempo.
Com informações de Uberlandianofoco




