EM ALTA · Como Escalar Campanhas Facebook Ads — guia completo
17.05.26 · 150 ARTIGOS
Assinar

NVIDIA Nemotron 3.5 Lightning: modelos abertos para agentes que todo negócio pode rodar

NVIDIA lança Nemotron 3.5 Lightning, modelo aberto de alta eficiência para workloads agenticos de longa duração. O que isso significa para custo de inferência e controle de quem roda IA localmente em pequenos negócios.

CB
Celso Bufano
29 de agosto de 2026, 16:47 · 3 MIN DE LEITURA
Empresário confiante aponta para uma estação de trabalho compacta própria numa sala de servidores local, com racks iluminados ao fundo.

O modelo que a NVIDIA quer que você rode na sua máquina, não na nuvem

A NVIDIA anunciou o Nemotron 3.5 Lightning, um modelo aberto de 30 bilhões de parâmetros com arquitetura mixture-of-experts, apontado como o mais eficiente da sua classe para cargas de trabalho agenticas de longa duração. A novidade veio acompanhada do NeMo Switchyard, uma biblioteca open source de roteamento inteligente de modelos. Antes de qualquer empolgação, o que importa para um negócio que depende de IA para operar é traduzir isso em algo que os fornecedores de API não querem que você saiba: a conta de tokens pode cair para um terço do que você paga hoje, e você pode fazer isso rodando o modelo no seu próprio hardware.

O problema que a NVIDIA resolveu: o agente “pensa” caro

O mercado de IA saiu da fase chatbot e entrou na fase dos agentes autônomos — sistemas que executam fluxos de trabalho com múltiplas etapas, chamam ferramentas, revisam código, monitoram alertas e respondem a clientes. Mas esses agentes “sempre ligados” consomem tokens numa escala que assusta qualquer diretor financeiro. Um agente que em vez de responder uma pergunta precisa: entender o pedido → buscar dados → estruturar a resposta → executar uma ação → validar o resultado. Cada passo é uma chamada de API. Isso queima orçamento.

A NVIDIA responde a isso com uma arquitetura de “sistema de modelos”. A ideia: um modelo grande e raciocinador (tipo Nemotron 3 Ultra ou GPT-5.6) planeja e orquestra o fluxo, mas modelos menores e especializados executam as tarefas de alto volume. O Nemotron 3.5 Lightning entra exatamente nesse papel — o trabalhador operacional do sistema. Segundo o anúncio da NVIDIA, o modelo entrega até 4x a velocidade de saída, o que se traduz em 30% de redução no tempo de conclusão de tarefas agenticas em relação a outros modelos da sua classe. Para marketing e vendas, isso significa: o agente que cruza dados de CRM com resposta de e-mail, o bot que atualiza planilhas e o assistente que organiza o funil — tudo isso pode rodar mais rápido e consumir menos.

O Lightning é aberto e customizável. Com o NeMo, a ferramenta de pós-treinamento da NVIDIA, uma organização pode ajustar o modelo com dados próprios de domínio. Empresas como CrowdStrike (cybersecurity), Harvey (serviços jurídicos) e CodeRabbit (revisão de código) já customizaram o modelo para suas cargas de trabalho.

O que muda para quem quer parar de pagar caro por API

O lance mais relevante do anúncio não está no modelo em si, mas no NeMo Switchyard, que a NVIDIA detalha no site oficial. A biblioteca faz o roteamento inteligente de cada prompt para o modelo mais adequado — o mais barato para tarefa simples, o mais poderoso para raciocínio complexo, o local para dados sensíveis. Em vez de um negócio usar um único modelo “tudo-em-um” (que cobra caro por qualquer chamada), o Switchyard pode direcionar 59% do tráfego para um modelo mais rápido e otimizado, como mostrou a Boomi nos testes da NVIDIA.

Para o empreendedor, isso significa repensar a economia da operação. Hoje, quem automatiza fluxos com agentes paga por milhares de tokens que são usados em tarefas triviais — classificar e-mail, extrair dados, formatar resposta. Com o roteamento inteligente, apenas uma fração das chamadas precisa ir para modelos “fronteira” (os mais caros). Os benchmarks da NVIDIA mostram que o Switchyard mantém a acurácia de nível fronteira reduzindo o custo de conclusão de tarefa para quase um terço do custo com Opus 4.8 sozinho. E os resultados de parceiros confirmam: a LangChain obteve 74% de redução de custo em tarefas de múltiplas etapas; a Ramp cortou 58% dos custos e 33% do tempo de execução; a Classmethod viu 27% de corte de custos mantendo qualidade.

O que isso significa para um negócio médio: se você hoje paga para um provedor de IA processar o seu volume de tarefas, o roteamento pode manter a mesma qualidade de saída com um custo operacional drasticamente menor. É a diferença entre pagar por todos os funcionários num salário de consultor sênior e pagar apenas pelas tarefas que realmente exigem esse nível de especialização.

Privacidade e autonomia: os dados ficam com você

Há um segundo benefício que o marketing de vendas nunca destaca: controle. O Nemotron 3.5 Lightning pode rodar em infraestrutura local — RTX PCs, DGX Spark, DGX Station e Jetson — ou on-premises. Isso resolve o problema de quem precisa de respostas rápidas e não pode enviar dados sensíveis para a nuvem. Para escritórios de advocacia, clínicas médicas e departamentos financeiros, a possibilidade de rodar um modelo de qualidade em infraestrutura própria não é questão de preferência — é compliance e segurança de dados.

A autonomia também importa. Quando um negócio depende de um modelo proprietário via API, ele fica refém da disponibilidade e da política de preços de um fornecedor. Com um modelo aberto customizável, a organização pode ajustar o sistema para seus próprios fluxos de trabalho, ferramentas e dados. E a NVIDIA publica a maior parte dos dados de treinamento e técnicas permitidas por licença, o que possibilita rastreabilidade, auditoria e até o treinamento de outros modelos. A transparência deixa de ser luxo — vira pré-requisito para quem precisa justificar decisões automatizadas.

O modelo está disponível no Hugging Face, ModelScope, OpenRouter e build.nvidia.com como microserviço NIM, além de uma rede de parceiros de nuvem. O NeMo Switchyard está no GitHub. A combinação dessas duas ferramentas reposiciona a disputa do mercado de IA — não se trata de mais um modelo de linguagem, mas de um sistema completo para orquestrar o melhor de cada modelo, de forma econômica e sob a governança de quem opera.

A era dos agentes de IA começa de fato quando as empresas controlam a infraestrutura que roda esses agentes. Com Nemotron 3.5 Lightning e Switchyard, a NVIDIA mostra que esse controle pode ser compatível com custo operacional que um negócio médio consegue sustentar.

Fontes

NEWSLETTER · TODO DIA ÀS 9H

IA, Dev e tráfego pago na sua caixa.

Curadoria do Celso Bufano sobre IA aplicada, Python, WordPress e estratégias de afiliado. Nada de spam — só o que vale a pena ler.

Um e-mail por dia · cancele a hora que quiser

Comentários


💬 Comentários via Giscus (GitHub) serão integrados aqui.
Configure em src/components/Comments.astro após criar o repo público no GitHub.
CONTINUE LENDO

Relacionados em Era dos Agentes

VER EDITORIA →
Podcasts ficam pesquisáveis e utilizáveis por agentes de IA: o novo caminho de conteúdo para afiliados
ERA DOS AGENTES

Podcasts ficam pesquisáveis e utilizáveis por agentes de IA: o novo caminho de conteúdo para afiliados

Radar torna podcasts pesquisáveis e legíveis por agentes de IA. Veja como transformar seu áudio em conteúdo qu…

Celso Bufano · 4 min · 26 DE AGO DE 26
OpenAI quer um agente para tudo: o que isso muda para quem vende
ERA DOS AGENTES

OpenAI quer um agente para tudo: o que isso muda para quem vende

A OpenAI quer que agentes de IA dominem cada tarefa do seu negócio. Saiba o que isso significa na prática para…

Celso Bufano · 3 min · 25 DE AGO DE 26
Skills e Computer Use oficiais: o que agentes Claude fazem agora por você
ERA DOS AGENTES

Skills e Computer Use oficiais: o que agentes Claude fazem agora por você

Files API, Skills API e Computer Use agora são recursos oficiais do Claude. Veja o que agentes autônomos podem…

Celso Bufano · 3 min · 24 DE AGO DE 26