EM ALTA · Como Escalar Campanhas Facebook Ads — guia completo
17.05.26 · 150 ARTIGOS
Assinar

Pare de escalar agentes sem medir tokens por segundo: é aí que o custo explode

O desempenho de inferência virou a métrica que decide seu custo: mais tokens gerados por segundo = mais receita por GPU. Escalar agentes sem olhar isso é pagar caro por infraestrutura parada.

CB
Celso Bufano
21 de setembro de 2026, 08:04 · 3 MIN DE LEITURA
Mulher de blazer escuro em pé no corredor de um data center, entre racks de servidores com luzes azuis, segurando prancheta e olhando para cima.

Pare de escalar agentes sem medir tokens por segundo: é aí que o custo explode

A NVIDIA apresentou no MLPerf Inference v6.1 os primeiros resultados do sistema Vera Rubin NVL72 — e o número que importa para o seu negócio não é o benchmark em si, mas o que ele significa em termos de economia de inferência. O sistema entrega até 3,7x mais throughput que o GB300 NVL72 em cargas como Qwen3-VL. Traduzindo: cada rack físico gera significativamente mais tokens por segundo — e tokens gerados são a matéria-prima de receita de qualquer operação que usa IA para atender, vender ou produzir conteúdo em escala.

Para quem roda agentes, chatbots ou pipelines de geração em produção, a métrica que separa infraestrutura que lucra de infraestrutura que só custa não é a qualidade do modelo — é a quantidade de tokens que o hardware consegue processar por segundo, e o quanto esse número cresce conforme você adiciona servidores. Se você não está medindo isso, está gerenciando custo no escuro.

Economia de inferência: o custo por token decide quem escala

A NVIDIA define no post de resultado do MLPerf três vetores que determinam a economia de inferência: performance do sistema, escalabilidade eficiente e otimização contínua de software. Para o empreendedor que opera IA, cada um desses vetores se traduz numa decisão financeira direta.

Performance do sistema é a mais óbvia: mais tokens por segundo significa que o mesmo investimento em hardware atende mais usuários, gera mais conteúdo ou processa mais requisições no mesmo intervalo de tempo. No teste Qwen3-VL, o Vera Rubin NVL72 entregou 3,7x mais throughput que o GB300 NVL72; no DeepSeek-R1, usando TensorRT-LLM, o ganho foi de até 2,5x. Isso muda a matemática do custo por token de forma decisiva. No mundo real, uma operação de atendimento que processa milhões de interações por mês não paga pelo modelo — paga pelo tempo de GPU que cada resposta consome. Um sistema que entrega 3,7x mais dados processados reduz o custo fixo por interação na mesma proporção, sem alteração no modelo ou na qualidade do serviço.

Escalabilidade eficiente é o vetor que a maioria das empresas ignora até doer no bolso. Adicionar mais GPUs não significa automaticamente mais throughput — se a arquitetura de rede e o software não acompanham, o investimento extra produz retorno marginal minguante. O teste da NVIDIA com o GB300 NVL72 mostra o contrário: escalar de um rack (72 GPUs) para quatro racks (288 GPUs) manteve 99% de eficiência de escalabilidade no cenário offline. Ou seja, o throughput cresceu quase linearmente com o hardware adicionado. Para quem está decidindo se aprova ou não um aumento de infraestrutura, essa é a diferença entre dimensionar para crescer e dimensionar para desperdiçar.

A infraestrutura média de uma empresa que roda agentes de IA em produção tende a sofrer de um problema específico: subutilização. É para isso que existe a “fungibilidade” de plataforma — a capacidade de usar a mesma infraestrutura para qualquer carga, seja treinamento, inferência, recomendação ou raciocínio. Quanto mais versátil o hardware, maior a utilização média, menor o custo unitário por operação.

Teletransporte que não escala é luxo; rack que escala é ativo

O ponto que o resultado do MLPerf escancara é que interconnect é a nova fronteira de custo. O Vera Rubin NVL72 usa NVLink de sexta geração e NVLink Switch para entregar 10x mais taxas de pacote e 3x menor latência que Ethernet padrão. Isso não é detalhe técnico — é a base que permite técnicas como disaggregated serving (separar as fases de prefill e decode do processamento) e expert parallelism em modelos de mistura de especialistas, que são exatamente o que modelos como DeepSeek-R1 e Qwen3-VL usam para entregar qualidade com eficiência.

Para o negócio, o que importa é: a arquitetura de hardware define quais otimizações de software são possíveis. Sem o cluster de interconexão adequado, a empresa fica presa a eficiência de um único nó e paga caro por isso. O teste de texto-para-vídeo com o GB300 NVL72 ilustra o abismo: em uma configuração de rack, o sistema produziu 0,65 vídeos em 720p por segundo, a 5,7 segundos por vídeo — 9x mais throughput e 7,5x menos latência que um nó único. Numa agência que automatiza produção de vídeo para campanhas, isso é a diferença entre atender dez clientes ou um.

O artigo da NVIDIA introduz ainda uma medida que deve virar padrão para quem trabalha com agentes: o benchmark SemiAnalysis AgentX, que avalia performance de IA em tarefas que envolvem raciocínio, planejamento e execução multi-etapas. Em testes preliminares, o Vera Rubin NVL72 entregou 30x mais performance que o GB300 NVL72 nesse cenário. Agentes pensam e agem de forma diferente de um chat simples — e a infraestrutura precisa ser medida por esse novo critério. O próximo benchmark MLPerf Endpoints promete padronizar essa medição, o que é ótima notícia: o que não é medido não é gerenciado, e agentes em produção ainda são um território onde muita empresa gasta por achismo.

Software é o pacote de otimização contínua que reduz custo sem trocar de hardware

O terceiro vetor é o que mais se aproxima de “dinheiro grátis” em infraestrutura de IA — desde que a empresa seja capaz de capturá-lo. As otimizações de software que a NVIDIA implementou entre as versões v6.0 e v6.1 do MLPerf entregaram até 1,6x mais performance no GB300 NVL72 rodando Qwen3-VL. Os ganhos vieram de técnicas como menor precisão de KV cache, fusão de kernels e o uso do framework de inferência NVIDIA Dynamo. É um salto equivalente ao de uma geração de hardware — sem trocar um único componente físico.

E o ciclo não parou após o fechamento da submissão. Resultados pós-v6.1, ainda não verificados pelo MLCommons, mostram ganhos adicionais em modelos como GPT-OSS-120B e DLRMv3. A NVIDIA adota cadência anual de novas arquiteturas, mas o software entre as arquiteturas é onde a maior parte dos ganhos de custo-benefício se materializa no dia a dia.

A consequência prática é direta: quando você avalia um fornecedor de infraestrutura de IA, está comprando também a velocidade da otimização de software que ele entrega ao longo do tempo. O mesmo rack físico que hoje roda um volume X de tokens pode rodar 1,6x mais após uma atualização de software. Para quem opera IA como linha de produção, isso vira uma questão de contrato: qual é o roadmap de otimização do seu provedor de infraestrutura? Aqui, a rede de parceiros da NVIDIA importa: 19 parceiros submeteram resultados no MLPerf v6.1, incluindo Azure, Oracle Cloud Infrastructure, CoreWeave, Crusoe, Dell Technologies, HPE, Supermicro e Lambda. A diferença entre eles está em como cada um aplica essas otimizações e repassa o ganho de custo ao cliente final.

A recomendação operacional para quem já roda ou pretende rodar agentes em escala é: padronize a medição de tokens por segundo como KPI de infraestrutura, calcule o custo por token mensal e cobre do seu provedor os ganhos contínuos de software. O Vera Rubin NVL72 existe como antecipação — os resultados do MLPerf são prévias de preview, não medidas finais de produção (e os ganhos anunciados tendem a aumentar conforme o software amadurece). Mas a direção é clara: performance, escalabilidade e software determinam a economia de inferência. Quem ignora isso não fica para trás em tecnologia — fica para trás na margem.

Fontes

NEWSLETTER · TODO DIA ÀS 9H

IA, Dev e tráfego pago na sua caixa.

Curadoria do Celso Bufano sobre IA aplicada, Python, WordPress e estratégias de afiliado. Nada de spam — só o que vale a pena ler.

Um e-mail por dia · cancele a hora que quiser

Comentários


💬 Comentários via Giscus (GitHub) serão integrados aqui.
Configure em src/components/Comments.astro após criar o repo público no GitHub.
CONTINUE LENDO

Relacionados a este assunto

VER EDITORIA →
Agentes ficaram baratos; a infraestrura para rodá-los, não
ERA DOS AGENTES

Agentes ficaram baratos; a infraestrura para rodá-los, não

O custo por token despenca, mas escalar agentes exige fábricas de IA que poucos negócios conseguem operar. A b…

Celso Bufano · 3 min · 19 DE SET DE 26 · 06:43
Agentes exigem outra infraestrutura: o custo por token vira decisão de ROI
IA NO TRABALHO

Agentes exigem outra infraestrutura: o custo por token vira decisão de ROI

Agentes demandam outra infraestrutura: custo por token e eficiência energética agora definem quanto você paga …

Celso Bufano · 3 min · 05 DE SET DE 26 · 06:17
Agentes custam caro? Derrube o custo por token antes de escalar sua automação
ERA DOS AGENTES

Agentes custam caro? Derrube o custo por token antes de escalar sua automação

Os agentes de IA custam caro hoje, mas a NVIDIA promete derrubar esse custo com eficiência de inferência. Veja…

Celso Bufano · 3 min · 12 DE SET DE 26 · 06:35