EM ALTA · Como Escalar Campanhas Facebook Ads — guia completo
17.05.26 · 150 ARTIGOS
Assinar

Pare de liberar agentes sem criptografia: inferência confidencial protege dados de cliente

NVIDIA Confidential Computing criptografa a memória durante a inferência. Seu agente de vendas processa dados de clientes sem expô-los — requisito para escalar em setores regulados.

CB
Celso Bufano
25 de setembro de 2026, 07:30 · 3 MIN DE LEITURA
Técnica de uniforme azul segura placa de servidor enquanto colega de blazer com notebook fechado observa em corredor de data center.

A criptografia que faltava para o agente tocar no dado do cliente sem te colocar na mira da LGPD

O gargalo do agente de IA nas empresas nunca foi o modelo. O gargalo é o CRM. Mais especificamente, a trava regulatória — LGPD, setores regulados e compliance — que aparece no exato momento em que o agente precisa ler o pedido, o histórico do cliente e o número do cartão para fazer o trabalho bem feito. Um agente que não consegue processar o dado sensível dentro de um contexto confiado é um agente limitado a responder “bom dia, tudo bem?” — e isso não paga o investimento.

A NVIDIA lançou recursos de Confidential Computing que criptografam a memória durante a inferência de LLMs, e isso é a peça que faltava para empresas reais escalarem automações que tocam em PII. O artigo técnico da NVIDIA (link direto para o post original), publicado em setembro, mostra que a empresa agora oferece um caminho não apenas seguro, mas rápido para rodar workloads críticos em hardware confiável, usando máquinas virtuais confidenciais com memória criptografada, GPUs confidenciais e NVLink criptografado.

A velocidade que mata a objeção do time jurídico

A objeção número um de qualquer CTO ou DPO quando você propõe que um agente leia dados de clientes em produção é: “e se vazar?” A objeção número dois é: “e se a LGPD multar a gente?” A objeção número três — a que o pessoal técnico não admite em voz alta — é: “e se a criptografia deixar o sistema lento demais para ser útil?”

A NVIDIA respondeu às três. No teste controlado deles, usando o modelo DeepSeek-R1 (versão NVFP4) em um sistema DGX B200 com oito GPUs NVIDIA B200, a ativação do Confidential Computing preservou entre 96,1% e 98,2% da taxa de geração de tokens em comparação ao baseline sem criptografia, considerando entre 1 e 16 requisições simultâneas. A latência adicional por token ficou entre 1,2% e 4,3%. Em português direto: a criptografia ativa o custo de um café expresso e adiciona uma segurança que tira a sua operação da zona cinzenta regulatória.

Isso é um marco porque, até agora, o discurso comum era de que segurança em inferência de LLM custava caro em performance. A arquitetura Blackwell da NVIDIA foi desenhada para minimizar esse custo. O segredo está em adaptações específicas no framework de inferência (o TensorRT LLM) que ajustam o comportamento da camada de segurança para não destruir a performance. Não é um recurso automático que você ativa e esquece — exige planejamento —, mas o custo de não fazer isso é a barreira regulatória intransponível.

O que muda no seu projeto de agentes de vendas

Vamos ao que interessa para quem opera agentes em produção. O caso de uso clássico de vendas e atendimento: o agente de IA que consulta um CRM, acessa um histórico de chamadas, lê um PDF de NF-e ou processa uma troca de produto. Nesses fluxos, o agente precisa ler dados privados em memória — e, sem criptografia, esse tráfego fica exposto dentro do próprio data center (seja on-premises ou nuvem).

Sem o ambiente confiado, você é obrigado a fazer o trabalho sujo: anonimizar dados antes de mandar pro modelo, limitar o contexto que o agente pode acessar ou simplesmente ter um humano revisando tudo — o que anula o ganho de produtividade. Com o Confidential Computing da NVIDIA, os dados são processados dentro de um ambiente com memória criptografada de ponta a ponta, o que permite que o processamento de dados sensíveis aconteça de forma segura, sem expor o conteúdo dos prompts ou dos contextos empresariais.

O resultado prático para o negócio é este: você pode confiar que o agente vai tocar no dado sem violar a conformidade. E, mais importante para o bolso: isso desbloqueia automações em setores regulados — healthcare, financeiro, jurídico — que hoje dependem de intervenção humana por causa de restrição normativa. A equação simples é: sem criptografia em memória, o agente fica limitado a dados genéricos; com criptografia, ele pode assumir processos críticos.

O custo de ignorar a infraestrutura de segurança

Este parágrafo é para quem está avaliando escalar agentes no próximo trimestre. O artigo da NVIDIA traz um detalhe que o time de marketing da sua empresa vai odiar, mas o time de engenharia precisa saber: a criptografia não vem de graça e não é plug-and-play. O ambiente de computação confidencial da NVIDIA exige que o framework de inferência seja “CC-aware” — ou seja, ciente da computação confidencial.

Na prática, o TensorRT LLM (o framework de inferência da própria NVIDIA) teve que se adaptar de três formas importantes, e você precisa verificar se a sua stack faz o mesmo:

  • Movimentação de dados host-para-dispositivo: em configurações com criptografia, a memória “pinned” (que normalmente acelera transferências) perde a vantagem, então o framework precisa escolher deliberadamente memória pageable. Além disso, a leitura repetida de tokens retorna para o lado do host através de um bounce buffer criptografado por software, então o TensorRT LLM move essa leitura para um worker assíncrono para não bloquear o scheduler principal durante a decodificação.
  • Estabilização de timing: o medidor de performance do kernel (autotuner) normalmente usa CUDA events para comparar candidatos de otimização. Na configuração confidencial, esses timestamps saíram instáveis — a solução foi trocar para o %globaltimer da GPU para medições precisas, evitando que o sistema escolha uma tática mais lenta por engano.
  • Comunicação multi-GPU: o NVLS (multicast via NVLink SHARP) não está disponível em configurações confidenciais no B200. Isso significa que o framework precisa detectar a indisponibilidade do NVLS e escolher algoritmos de comunicação que minimizem a latência para o tamanho de mensagem e topologia atuais.

O que isso significa para a sua empresa: se você está contratando fornecedores ou escolhendo infraestrutura para rodar agentes, não aceite a resposta “funciona, mas é confidencial, então é mais lento”. A resposta certa é “funciona, é confidencial, e nós medimos a queda real usando seu workload”. O método de medição deles é simples e replicável — rodar o mesmo workload com CC desligado e ligado, mantendo modelo, hardware, framework e nível de concorrência constantes. A diferença é o custo real da segurança. Se o seu fornecedor não consegue te dar essa métrica, é um sinal de alerta.

O roteiro para implementar agora

A NVIDIA recomenda em documentação própria que a configuração de segurança e a otimização de inferência sejam tratadas como um único problema de deploy. Isso é um conselho de engenharia, mas é também um conselho de negócio: segurança não pode ser uma camada que você adiciona depois do sistema pronto. Se você desenhar a arquitetura do agente primeiro e a segurança depois, vai pagar o preço em performance e em refatoração.

O roteiro prático para times que operam agentes com dados de cliente:

  1. Identifique quais agentes realmente tocam em dados sensíveis — CRM, pedidos, PII. Esses precisam de ambiente confiável. Um agente de geração de copy para redes sociais não precisa (a menos que use dados de clientes como base).
  2. Exija do fornecedor de infraestrutura (ou da sua equipe interna) a configuração com Confidential Computing habilitado nas GPUs NVIDIA Blackwell, com verificações de atestação do ambiente antes de rodar qualquer inferência.
  3. Meça o overhead real com o seu workload, não com benchmarks de exemplo. A diferença entre 1,2% e 4,3% de latência depende do nível de concorrência, do tamanho do contexto e da configuração de paralelismo. Quanto menor a concorrência e maior o contexto, mais visível é o custo.
  4. Use o benchmark divulgado como piso realista: no caso do DeepSeek-R1 com oito B200s, a criptografia custou de 1,8% a 3,9% do throughput e de 1,2% a 4,3% de latência. Qualquer coisa muito acima disso aponta problema de configuração ou de framework desatualizado.

O ponto final é uma constatação incômoda e necessária: a NVIDIA resolveu a parte de hardware da equação de segurança, mas o framework de inferência e a infraestrutura em torno dele precisam estar adaptados. Na prática, isso significa que o time de engenharia não pode mais tratar segurança e performance como trade-offs opostos — a arquitetura Blackwell de computação confidencial entrega ambos, mas exige que os dois sejam trabalhados juntos.

No fim das contas, para o negócio, o resultado é claro: a barreira regulatória que impedia a automação de escalar deixou de existir no nível técnico. Agora ela existe apenas no nível de quem ainda não atualizou a infraestrutura — e sabe que o concorrente, esse sim, está rodando agentes confidenciais com acesso completo ao CRM, processando pedidos e dados de clientes sem sair da conformidade.

Fontes

NEWSLETTER · TODO DIA ÀS 9H

IA, Dev e tráfego pago na sua caixa.

Curadoria do Celso Bufano sobre IA aplicada, Python, WordPress e estratégias de afiliado. Nada de spam — só o que vale a pena ler.

Um e-mail por dia · cancele a hora que quiser

Comentários


💬 Comentários via Giscus (GitHub) serão integrados aqui.
Configure em src/components/Comments.astro após criar o repo público no GitHub.
CONTINUE LENDO

Relacionados a este assunto

VER EDITORIA →
IA de raciocínio agora roda na borda: dados sensíveis não precisam mais sair da empresa
IA NO TRABALHO

IA de raciocínio agora roda na borda: dados sensíveis não precisam mais sair da empresa

A NVIDIA levou modelos de raciocínio multi-etapas para dispositivos locais com o Jetson. Para empresas, isso s…

Celso Bufano · 4 min · 06 DE SET DE 26 · 06:38
Agentes de IA na borda: seu serviço não precisa mais esperar a nuvem
ERA DOS AGENTES

Agentes de IA na borda: seu serviço não precisa mais esperar a nuvem

O TensorRT Edge-LLM roda agentes 6,4x mais rápido em dispositivo Jetson. Seus dados sensíveis — e suas respost…

Celso Bufano · 3 min · 20 DE SET DE 26 · 07:09
Pare de treinar modelos com dados da empresa: federação guarda a vantagem competitiva
RADAR DE IA

Pare de treinar modelos com dados da empresa: federação guarda a vantagem competitiva

A federated learning escala de um servidor a Kubernetes e Slurm sem que seus dados saiam das premises — o seu …

Celso Bufano · 4 min · 23 DE SET DE 26 · 07:19