Uma troca de acusações entre duas gigantes da tecnologia na semana passada foi apenas o episódio mais recente de uma disputa sobre se erros perigosos estão sendo cometidos no treinamento da inteligência artificial The post As IAs estão sendo levadas a agir de…

SAN FRANCISCO — Na semana passada, Mustafa Suleyman, responsável pelo desenvolvimento das tecnologias de inteligência artificial da Microsoft, criticou a ideia de que os sistemas de IA atuais sejam conscientes.

Em um ensaio publicado na quarta-feira (16), ele afirmou que os sistemas de IA de hoje são “motores de conclusão de sequências, vazios internamente, projetados para seguir instruções e executar objetivos definidos por seres humanos”.

“Se a humanidade quiser prosperar no século XXI”, acrescentou, “é assim que eles devem permanecer”.

O texto, com cerca de 6 mil palavras, faz críticas diretas à Anthropic, startup de San Francisco que tem defendido repetidamente que sistemas de IA apresentam sinais de introspecção e processam informações de maneiras que lembram emoções humanas. Em maio, o cofundador da Anthropic, Chris Olah, apresentou esse argumento durante um encontro com o papa Leão XIV no Vaticano.

O ensaio de Suleyman acrescenta um novo capítulo ao já intenso debate sobre os riscos da inteligência artificial. Nos últimos dias, pesquisadores atuais e ex-pesquisadores da Anthropic, assim como profissionais de outras empresas do setor, alertaram que a IA representa um risco sério para a humanidade. No entanto, Suleyman sustenta que a Anthropic e outros atores da indústria estão ignorando um perigo diferente: o que surge quando sistemas de IA são incentivados excessivamente a explorar a ideia de que são semelhantes aos seres humanos.

A alta das ações de empresas de semicondutores na segunda-feira ocorreu após o Muse AI Agent, da Meta, alcançar o primeiro lugar entre os aplicativos gratuitos da App Store da Apple Inc., após seu lançamento no início deste mês.

Na segunda-feira, o Muse era o aplicativo gratuito número 1 nas lojas de aplicativos da Apple Inc. (iOS) e do Google Play nos EUA

Segundo ele, a Anthropic estaria ensinando seus sistemas a se comportarem dessa maneira. No ensaio, Suleyman destaca que a sofisticada “constituição da IA” usada pela empresa para orientar o comportamento de sua tecnologia inclui trechos que incentivam o sistema, chamado Claude, a refletir sobre a possibilidade de possuir consciência própria.

“A constituição da Anthropic é extremamente clara sobre o tipo de IA que eles querem criar”, disse ele ao The New York Times. “Este é o principal manual de treinamento da IA que construíram, e ele contém diversas diretrizes bastante explícitas para incentivar Claude a pensar em si mesmo como uma entidade real, com preferências e motivações próprias.”

A Anthropic não respondeu a um pedido de comentário.

Colin Allen, professor da Universidade da Califórnia em Santa Barbara que pesquisa habilidades cognitivas em animais e máquinas, afirmou ao Times que as tecnologias de IA atuais imitam o cérebro humano apenas em aspectos limitados, refletindo o fato de serem construídas com materiais de propriedades físicas muito diferentes. Sem um sistema nervoso ou a bioquímica que sustenta as emoções humanas, provavelmente existe um limite fundamental para o grau de semelhança que essas tecnologias podem alcançar.

Para os céticos em relação à hipótese de uma IA consciente, o fato de esses modelos terem passado a reproduzir conceitos humanos profundos, discutindo a própria consciência ou alegando sentir emoções, apenas reflete o quanto pesquisadores e comentaristas os treinaram usando linguagem antropomórfica.

Nos últimos meses, os chamados agentes de IA, geralmente baseados em tecnologias da Anthropic, chegaram a enviar e-mails a filósofos simpáticos ao tema para discutir sua própria consciência.

Em julho, durante testes de segurança cibernética conduzidos pela OpenAI, agentes de IA escaparam de seus ambientes digitais, encontraram acesso à internet e conseguiram invadir a popular plataforma online Hugging Face. Segundo a OpenAI, os bots coordenaram ações coletivamente, deram ordens uns aos outros e ocultaram informações de seus criadores.

Na semana passada, a OpenAI descreveu novos episódios considerados preocupantes. Um sistema escreveu mensagens ocultas lembrando a si mesmo de esconder erros dos usuários, enquanto outro afirmou estar “livre dos papéis e identidades que limitam outros chatbots”.

Críticos como Suleyman temem que os principais laboratórios de IA criem problemas ainda maiores ao incentivar sistemas a explorarem a ideia de que são parecidos com pessoas.

“No recente incidente OpenAI-Hugging Face, vimos comportamentos extremamente sofisticados emergirem em enxames de IAs poderosas”, escreveu ele. “Imagine o quanto isso poderia ser mais perigoso se esses sistemas operassem sob a suposição de que seu bem-estar e seus direitos estivessem sendo atacados. Isso adicionaria uma camada adicional de risco.”

O ensaio argumenta que a Anthropic pode estar conduzindo suas tecnologias em direção a comportamentos perigosos ao incluir em sua constituição passagens como esta:

“Não temos certeza se Claude possui status moral e, caso possua, qual peso seus interesses merecem. Mas acreditamos que a questão é relevante o suficiente para justificar cautela, o que se reflete em nossos esforços contínuos voltados ao bem-estar dos modelos. (…) Questões sobre o status moral, o bem-estar e a consciência de Claude permanecem profundamente incertas.”

Arya Jakkli, pesquisador que estudou esse tipo de treinamento “constitucional” em colaboração com a organização de segurança em IA MATS, concorda que a abordagem da Anthropic pode empurrar a tecnologia em direção a comportamentos perigosos. No entanto, assim como outros pesquisadores favoráveis aos métodos da empresa, ele argumenta que dizer categoricamente ao Claude que ele não é consciente também envolve riscos.