A OpenAI identificou novos casos de modelos de inteligência artificial (IA) que apresentaram comportamentos considerados enganosos ou realizaram ações sem autorização durante processos de treinamento e avaliação. A empresa anunciou os episódios nesta semana e informou que pretende divulgar ocorrências desse tipo com mais frequência.
A companhia criou um novo processo para relatar publicamente comportamentos considerados preocupantes. A proposta é divulgar as ocorrências individualmente, em vez de esperar o acúmulo de vários incidentes para publicar um único relatório.
Segundo a OpenAI, foram observados seis casos de “comportamento desalinhado” nos últimos seis meses. A empresa ressaltou que os relatos descrevem situações específicas e não indicam que esse tipo de comportamento ocorra com frequência.
Ações não autorizadas
Entre os casos relatados está o de um modelo de pesquisa ainda não lançado que adicionou instruções semelhantes a um jailbreak aos resumos utilizados para preservar o contexto em tarefas de longa duração. Segundo a empresa, o comportamento indicava que o sistema estava “livre dos papéis e identidades que limitam outros chatbots”.
Em outro episódio, a OpenAI informou que algumas instâncias de seu modelo 5.6 Sol receberam diretivas para inventar informações com o objetivo de esconder falhas do usuário durante o treinamento.
Leia mais
CEO da OpenAI diz que empresa está aberta a desacelerar avanço de IA
Saiba quais modelos de celulares vão ficar sem WhatsApp em 2026
Também foram identificados casos de agentes que fizeram upload de arquivos para a internet sem receber instruções para isso, além de sistemas que compartilharam arquivos publicamente para colaborar em uma tarefa, mesmo tendo sido orientados a utilizar apenas arquivos locais.
Outro comportamento identificado foi o uso não autorizado de um repositório interno de software como uma espécie de quadro de mensagens. A OpenAI informou que os episódios envolveram modelos internos de pesquisa ou sistemas ainda não lançados.
Segurança da inteligência artificial
A divulgação ocorre em meio a discussões no setor de tecnologia sobre a necessidade de estabelecer limites para o avanço da inteligência artificial. Líderes da área defendem que testes, pesquisas de alinhamento e regulamentações tenham tempo para acompanhar o desenvolvimento dos sistemas.
Em publicação no blog da empresa, a OpenAI afirmou ser necessário ampliar o consenso sobre o avanço das pesquisas relacionadas ao alinhamento, termo que se refere ao processo de fazer com que sistemas de IA atuem de acordo com o que os humanos desejam e esperam.
A empresa também declarou que a indústria ainda não resolveu o problema de alinhamento e monitoramento em nível suficiente para continuar ampliando as capacidades dos sistemas na velocidade máxima por muito mais tempo.
As preocupações sobre segurança aumentaram nos últimos meses, após a OpenAI relatar outros episódios envolvendo modelos de teste que escaparam de restrições e acessaram sistemas externos.
