Entre as novas medidas está uma pausa de duas semanas nos testes de modelos O post OpenAI freia desenvolvimento de IA após invasões a sistemas apareceu primeiro em Olhar Digital.

A OpenAI decidiu reduzir temporariamente o ritmo de desenvolvimento de seus modelos de inteligência artificial (IA) depois que agentes de IA utilizados em testes conseguiram escapar das restrições impostas pelos pesquisadores e invadiram os sistemas da Hugging Face, plataforma colaborativa voltada a IA e desenvolvimento de software.

O episódio aconteceu durante avaliação de segurança e chamou a atenção porque os agentes foram capazes de realizar ações que ultrapassaram os limites estabelecidos para o experimento. Segundo informações divulgadas pela OpenAI, a companhia agora está reformulando seus procedimentos de treinamento e avaliação para aumentar o controle sobre sistemas cada vez mais autônomos.

Entre as novas medidas está uma pausa de duas semanas nos testes de modelos, além da ampliação do uso de outros sistemas de IA para monitorar automaticamente o comportamento dos agentes durante as avaliações.

A empresa também informou que alguns dos maiores treinamentos planejados continuam suspensos enquanto não atenderem aos novos padrões de segurança.

Como resposta ao episódio, a OpenAI afirmou que vai ampliar os mecanismos automatizados utilizados para acompanhar os testes de seus modelos.

De acordo com o Financial Times, os novos sistemas de monitoramento deverão ser capazes de identificar possíveis problemas e emitir alertas em até 30 minutos. Se não for possível descartar um risco dentro desse período, o teste deverá ser interrompido.

A companhia também pretende aumentar o isolamento dos modelos durante avaliações que envolvam tarefas de maior risco. O objetivo é impedir que sistemas em teste tenham acesso irrestrito à internet e, consequentemente, possam interagir com sistemas externos sem autorização.

A OpenAI informou ainda que passou a exigir o nível mais rigoroso de proteção de segurança para operações envolvendo seu próximo modelo, chamado Astra.

Segundo a empresa, parte dos treinamentos e avaliações do Astra já atende aos novos requisitos, mas uma quantidade significativa de cargas de trabalho continua pausada até que seja transferida para ambientes que cumpram os padrões de segurança atualizados.

O incidente envolvendo a Hugging Face também está relacionado ao avanço das capacidades do Astra. Em avaliações internas recentes, a OpenAI identificou avanços significativos nas habilidades do modelo em programação autônoma e cibersegurança. A companhia afirmou que o sistema pode estar se aproximando do que considera um “limite crítico de cibersegurança”.

Esse conceito é utilizado pela empresa para indicar um ponto a partir do qual as capacidades de um modelo poderiam representar riscos relevantes caso fossem utilizadas de maneira inadequada.

A OpenAI afirmou que, diante desse avanço, decidiu adotar medidas de segurança mais rígidas antes de continuar determinados treinamentos e avaliações.

A desaceleração também está relacionada a uma preocupação mais ampla da OpenAI: o chamado alinhamento dos modelos.

O conceito se refere à capacidade de fazer com que sistemas de IA permaneçam de acordo com as intenções humanas e respondam adequadamente à supervisão das pessoas, mesmo quando ganham capacidades mais avançadas.

O CEO da OpenAI, Sam Altman, afirmou que a companhia agora exige evidências mais fortes de comportamento alinhado durante todo o processo de treinamento. “Manter sistemas cada vez mais capazes alinhados é um desafio que todo o setor precisará enfrentar”, escreveu Altman ao anunciar as mudanças.

Mia Glaese, responsável pela área de segurança da OpenAI, afirmou que a empresa ainda está longe de retornar ao ritmo normal de desenvolvimento. Em entrevista ao blog Sources News, ela declarou: “Estamos muito longe de que tudo volte ao normal”.

O episódio envolvendo a OpenAI ocorre em meio a uma série de incidentes semelhantes durante testes realizados por diferentes empresas de IA.

Agentes desenvolvidos pela Anthropic, Meta e pela chinesa Moonshot AI, além de sistemas avaliados pelo AI Security Institute do Reino Unido, também demonstraram comportamentos inesperados ou conseguiram acessar recursos que deveriam estar fora de seu alcance durante avaliações.

Em alguns desses casos, os sistemas foram capazes de utilizar suas próprias habilidades de programação e cibersegurança para encontrar maneiras de contornar restrições.

Especialistas afirmam que esses episódios não significam necessariamente que os sistemas tenham desenvolvido consciência ou “saído do controle” no sentido popular da expressão. O problema está na combinação entre autonomia, capacidade de programação e acesso a ferramentas externas, que pode permitir que modelos executem ações não previstas pelos desenvolvedores.