A General Compute, empresa especializada em infraestrutura para inteligência artificial, anunciou uma linha de crédito comprometida de até US$ 400 milhões para expandir sua nuvem de inferência, tecnologia desenvolvida para executar modelos de IA com alta velo…
A General Compute, empresa especializada em infraestrutura para inteligência artificial, anunciou uma linha de crédito comprometida de até US$ 400 milhões para expandir sua nuvem de inferência, tecnologia desenvolvida para executar modelos de IA com alta velocidade e eficiência.
O investimento, concedido pela Upper90 Capital Management, será destinado à ampliação da infraestrutura baseada em chips especializados da SambaNova, permitindo que a companhia fortaleça o que define como a nuvem de inferência mais rápida do mundo.
"A Upper90 chegou cedo à oportunidade de infraestrutura de IA, permanecendo seletiva sobre onde alocamos capital. Focamos em abordagens diferenciadas que tornam a computação mais barata, mais rápida e mais acessível para os clientes. A parceria da General Compute com a SambaNova lhe dá acesso a um silício de inferência até seis vezes mais eficiente em energia do que GPUs tradicionais. Nosso papel é garantir que a empresa tenha o capital de que precisa para escalar junto com uma demanda em rápido crescimento." — Billy Libby, cofundador e CEO da Upper90
O anúncio acontece em um momento em que a inteligência artificial atravessa uma transformação significativa. Se, nos últimos anos, o foco da indústria esteve concentrado no treinamento de grandes modelos de linguagem (LLMs), agora a prioridade do mercado passou a ser outra: executar esses modelos de forma rápida, eficiente e com custos cada vez menores.
Segundo a General Compute, sua plataforma é capaz de executar inferência de inteligência artificial até 16 vezes mais rápido do que as nuvens convencionais baseadas em GPUs. Além do ganho de desempenho, a empresa afirma que sua arquitetura reduz o consumo de energia, acelera a implantação de novos data centers e oferece uma infraestrutura preparada para atender à crescente demanda por aplicações de IA generativa em escala.
O que é uma nuvem de inferência?
Por isso, a estratégia da General Compute demonstra uma mudança importante no mercado: mais do que treinar modelos gigantes, o próximo grande desafio será executá-los com velocidade, eficiência energética e capacidade para atender bilhões de consultas diariamente.
Embora grande parte da atenção do mercado esteja voltada ao treinamento dos modelos de IA, é a inferência que realmente coloca a inteligência artificial para funcionar no dia a dia.
A inferência acontece sempre que um usuário faz uma pergunta ao ChatGPT, solicita uma imagem, utiliza um assistente virtual, executa um agente de IA ou pede que um modelo analise um documento. Nesse momento, o modelo já treinado precisa processar aquela solicitação e gerar uma resposta em poucos segundos.
É justamente essa etapa que demanda uma infraestrutura extremamente robusta.
Uma nuvem de inferência reúne servidores, chips especializados, armazenamento e redes capazes de processar milhões de solicitações simultaneamente, oferecendo baixa latência, alta disponibilidade e escalabilidade para aplicações corporativas.
Com o crescimento explosivo do uso da inteligência artificial, especialistas apontam que a inferência passará a consumir muito mais capacidade computacional do que o próprio treinamento dos modelos.
O mercado está migrando do treinamento para a inferência
Durante a primeira onda da inteligência artificial generativa, empresas investiram bilhões de dólares na construção de supercomputadores equipados com GPUs para treinar modelos cada vez maiores. Agora, esse contexto mudou por completo.
Modelos como GPT, Claude, DeepSeek, Gemini, Llama e outros já estão treinados. O grande desafio passou a ser atender milhões de usuários realizando consultas ao mesmo tempo.
Segundo projeções citadas pela própria General Compute, o Goldman Sachs estima que o consumo global de tokens crescerá 24 vezes nos próximos três anos e meio.
Deste modo, significa que empresas precisarão de uma infraestrutura muito maior para responder às solicitações dos usuários em tempo real.
É justamente nesse contexto que a nuvem de inferência se torna uma das áreas mais importantes da computação em IA.
Por que as GPUs começam a enfrentar limitações?
As GPUs revolucionaram o treinamento dos modelos de inteligência artificial, mas nem sempre representam a solução mais eficiente para inferência em larga escala.


0 Comentário(s)
Deixe seu comentário