Iniciativa ocorre poucos dias depois de o CEO, Dario Amodei, defender que as principais companhias do setor coordenem desaceleração no avanço da tecnologia O post Anthropic revela três métricas para medir o ritmo da corrida pelo desenvolvimento da IA apareceu…
A Anthropic divulgou, nesta quinta-feira (17), três novas métricas que a empresa propõe como forma de acompanhar o ritmo de desenvolvimento da inteligência artificial (IA). A iniciativa ocorre poucos dias depois de o CEO da empresa, Dario Amodei, defender que as principais companhias do setor coordenem uma desaceleração no avanço da tecnologia.
A companhia também revelou que seu chatbot Claude já “lidera” 26% do trabalho de pesquisa e desenvolvimento (P&D) de IA realizado pela empresa, um avanço que, segundo a companhia, ajuda a medir o ritmo da corrida para sistemas capazes de contribuir cada vez mais com a própria evolução.
Apesar do salto na participação do Claude, a Anthropic afirma que o modelo ainda não opera de maneira totalmente autônoma em nenhuma parcela medida de seu trabalho de P&D.
O termo “liderar”, neste caso, significa que o Claude consegue realizar a maior parte de uma tarefa de ponta a ponta a partir de uma instrução de alto nível, enquanto um humano permanece responsável pela supervisão e fornece direcionamento geral. Segundo a empresa, em fevereiro esse índice era de zero.
A Anthropic também informou que a IA já realiza pelo menos grandes partes do trabalho sob orientação humana próxima em mais de 90% de suas pesquisas, incluindo os 26% nos quais o Claude é considerado líder.
Para calcular o índice, a Anthropic utilizou uma versão do próprio Claude para avaliar o trabalho de P&D realizado pela empresa. O sistema foi aplicado a uma escala de avaliação de automação desenvolvida pela organização Epoch AI, e os resultados posteriormente passaram por verificação humana.
A companhia também criou um gráfico para acompanhar o nível de automação do Claude desde agosto de 2025. A proposta é que outros desenvolvedores de modelos de IA de ponta possam reproduzir o procedimento usando seus próprios dados e validação de terceiros.
A segunda métrica apresentada pela Anthropic está relacionada à supervisão de agentes de IA.
A empresa desenvolveu um sistema para acompanhar e intervir nas ações realizadas por esses agentes e constatou que aproximadamente 30 mil agentes estavam realizando trabalhos de pesquisa e engenharia simultaneamente em sua plataforma interna mais utilizada.
A companhia também afirmou utilizar diferentes tipos de monitores autônomos internos capazes de identificar atividades suspeitas e encaminhá-las para análise humana.
A proposta da Anthropic é medir não apenas quantos agentes estão trabalhando, mas também aspectos como quanto das atividades é monitorado, quanto tempo leva para uma ação ser revisada e com que frequência comportamentos dos agentes são sinalizados.
A terceira métrica envolve a quantidade de poder computacional empregada pela empresa.
A Anthropic analisou um “retrato” de todo o uso de computação entre 13 e 20 de julho e descobriu que aproximadamente 6% da capacidade computacional destinada à pesquisa e desenvolvimento de IA foi direcionada para trabalhos de segurança.
Quando considerada especificamente a computação usada em pesquisa e desenvolvimento “impulsionados por IA”, a parcela destinada à segurança chegou a aproximadamente 12%.
Para a Anthropic, esse tipo de informação pode ajudar a mostrar como os recursos estão sendo distribuídos enquanto as empresas avançam no desenvolvimento de modelos cada vez mais capazes.
A Anthropic afirma que as três métricas devem complementar as avaliações tradicionais de capacidade dos modelos.
Enquanto os testes de capacidade mostram o que os modelos conseguem fazer, as novas métricas procuram mostrar como eles estão sendo construídos e qual é o ritmo desse processo.
A empresa defende que informações desse tipo podem oferecer a pesquisadores externos, governos e ao público um ponto de partida para avaliar a velocidade do desenvolvimento dentro dos principais laboratórios de IA.
“Qualquer desenvolvedor de fronteira poderia publicar essas medidas regularmente, usando uma metodologia pública”, afirmou a Anthropic.
A companhia acrescentou que decidiu divulgar os dados porque eles oferecem ao público, a terceiros e aos governos “maior visibilidade sobre o ritmo do desenvolvimento de IA dentro dos laboratórios de fronteira”.




0 Comentário(s)
Deixe seu comentário