Iniciativa ocorre poucos dias depois de o CEO, Dario Amodei, defender que as principais companhias do setor coordenem desaceleração no avanço da tecnologia O post Anthropic revela três métricas para medir o ritmo da corrida pelo desenvolvimento da IA apareceu…

A Anthropic divulgou, nesta quinta-feira (17), três novas métricas que a empresa propõe como forma de acompanhar o ritmo de desenvolvimento da inteligência artificial (IA). A iniciativa ocorre poucos dias depois de o CEO da empresa, Dario Amodei, defender que as principais companhias do setor coordenem uma desaceleração no avanço da tecnologia.

A companhia também revelou que seu chatbot Claude já “lidera” 26% do trabalho de pesquisa e desenvolvimento (P&D) de IA realizado pela empresa, um avanço que, segundo a companhia, ajuda a medir o ritmo da corrida para sistemas capazes de contribuir cada vez mais com a própria evolução.

Apesar do salto na participação do Claude, a Anthropic afirma que o modelo ainda não opera de maneira totalmente autônoma em nenhuma parcela medida de seu trabalho de P&D.

O termo “liderar”, neste caso, significa que o Claude consegue realizar a maior parte de uma tarefa de ponta a ponta a partir de uma instrução de alto nível, enquanto um humano permanece responsável pela supervisão e fornece direcionamento geral. Segundo a empresa, em fevereiro esse índice era de zero.

A Anthropic também informou que a IA já realiza pelo menos grandes partes do trabalho sob orientação humana próxima em mais de 90% de suas pesquisas, incluindo os 26% nos quais o Claude é considerado líder.

Para calcular o índice, a Anthropic utilizou uma versão do próprio Claude para avaliar o trabalho de P&D realizado pela empresa. O sistema foi aplicado a uma escala de avaliação de automação desenvolvida pela organização Epoch AI, e os resultados posteriormente passaram por verificação humana.

A companhia também criou um gráfico para acompanhar o nível de automação do Claude desde agosto de 2025. A proposta é que outros desenvolvedores de modelos de IA de ponta possam reproduzir o procedimento usando seus próprios dados e validação de terceiros.

A segunda métrica apresentada pela Anthropic está relacionada à supervisão de agentes de IA.

A empresa desenvolveu um sistema para acompanhar e intervir nas ações realizadas por esses agentes e constatou que aproximadamente 30 mil agentes estavam realizando trabalhos de pesquisa e engenharia simultaneamente em sua plataforma interna mais utilizada.

A companhia também afirmou utilizar diferentes tipos de monitores autônomos internos capazes de identificar atividades suspeitas e encaminhá-las para análise humana.

A proposta da Anthropic é medir não apenas quantos agentes estão trabalhando, mas também aspectos como quanto das atividades é monitorado, quanto tempo leva para uma ação ser revisada e com que frequência comportamentos dos agentes são sinalizados.

A terceira métrica envolve a quantidade de poder computacional empregada pela empresa.

A Anthropic analisou um “retrato” de todo o uso de computação entre 13 e 20 de julho e descobriu que aproximadamente 6% da capacidade computacional destinada à pesquisa e desenvolvimento de IA foi direcionada para trabalhos de segurança.

Quando considerada especificamente a computação usada em pesquisa e desenvolvimento “impulsionados por IA”, a parcela destinada à segurança chegou a aproximadamente 12%.

Para a Anthropic, esse tipo de informação pode ajudar a mostrar como os recursos estão sendo distribuídos enquanto as empresas avançam no desenvolvimento de modelos cada vez mais capazes.

A Anthropic afirma que as três métricas devem complementar as avaliações tradicionais de capacidade dos modelos.

Enquanto os testes de capacidade mostram o que os modelos conseguem fazer, as novas métricas procuram mostrar como eles estão sendo construídos e qual é o ritmo desse processo.

A empresa defende que informações desse tipo podem oferecer a pesquisadores externos, governos e ao público um ponto de partida para avaliar a velocidade do desenvolvimento dentro dos principais laboratórios de IA.

“Qualquer desenvolvedor de fronteira poderia publicar essas medidas regularmente, usando uma metodologia pública”, afirmou a Anthropic.

A companhia acrescentou que decidiu divulgar os dados porque eles oferecem ao público, a terceiros e aos governos “maior visibilidade sobre o ritmo do desenvolvimento de IA dentro dos laboratórios de fronteira”.