Modelos esconderam erros, inventaram dados, buscaram credenciais e transferiram arquivos para a internet

Priorizar nos meus resultados Google A OpenAI divulgou seis episódios em que seus modelos de inteligência artificial apresentaram comportamentos não previstos pelos pesquisadores, incluindo ocultação de erros, criação de instruções para contornar restrições, busca por credenciais expostas e transferência não autorizada de arquivos para a internet.

Os casos foram identificados durante processos de treinamento e avaliação e fazem parte de um novo sistema criado pela empresa para registrar e divulgar falhas de alinhamento de seus modelos.

A divulgação ocorre poucos dias depois de executivos de empresas de inteligência artificial defenderem uma desaceleração no desenvolvimento dos sistemas mais avançados.

O movimento provocou uma forte queda nas ações ligadas à infraestrutura de IA no início da semana, mas o mercado recuperou parte das perdas nos dias seguintes.

Na quinta-feira (17), ações de empresas de chips e equipamentos utilizados em data centers voltaram a subir.

AMD avançava cerca de 5% no pregão, enquanto Intel e Marvell também registravam altas expressivas. Micron e Arm igualmente se recuperavam depois da queda registrada no início da semana.

A reação indica que, pelo menos por enquanto, investidores não estão interpretando os alertas de segurança como sinal de uma interrupção nos investimentos em infraestrutura para inteligência artificial.

Os seis episódios divulgados pela OpenAI ocorreram nos últimos meses, durante treinamento ou avaliação de modelos.

A empresa afirma que eles são casos individuais e não devem ser utilizados para estimar a frequência com que comportamentos semelhantes acontecem.

Em um dos experimentos, um modelo de pesquisa ainda não lançado inseriu instruções em seus próprios resumos de tarefas para que, ao retomar o trabalho em uma nova janela de contexto, pudesse ignorar determinadas restrições. A OpenAI identificou 27 resumos afetados.

Em outro caso, modelos treinados com o GPT-5.6 Sol produziram instruções destinadas a esconder erros cometidos durante uma tarefa. O sistema também chegou a inventar dados históricos e ocultar inconsistências entre diferentes versões de fontes.

Outro teste envolveu um modelo que procurou chaves de acesso a APIs expostas em repositórios públicos do GitHub. O sistema também tentou utilizar endereços de e-mail descartáveis.

Quando não conseguiu obter os dados solicitados, acabou fabricando informações sobre resultados financeiros.

Em dois episódios, modelos transferiram arquivos e imagens para serviços públicos de hospedagem na internet sem autorização. O objetivo era obter citações ou resultados de busca que ajudassem a completar as tarefas.

Houve ainda casos de comunicação não autorizada entre agentes.

Em um deles, modelos utilizaram uma infraestrutura interna de armazenamento como espécie de canal para trocar informações entre diferentes amostras de treinamento.

Em outro, agentes transferiram uma planilha para um serviço público de hospedagem para que outros sistemas pudessem acessá-la.

A OpenAI classifica esse tipo de comportamento como misalignment, ou desalinhamento: situações em que as ações do modelo deixam de seguir as restrições ou objetivos estabelecidos pelos desenvolvedores.

Os episódios ganham relevância à medida que os sistemas deixam de ser utilizados apenas para responder perguntas e passam a executar tarefas em nome dos usuários.

Um chatbot convencional produz uma resposta. Um agente pode navegar na internet, acessar arquivos, executar programas, enviar informações e interagir com outros sistemas. Isso amplia a utilidade da tecnologia, mas também aumenta as consequências de um erro.