A criptografia que faltava para o agente tocar no dado do cliente sem te colocar na mira da LGPD
O gargalo do agente de IA nas empresas nunca foi o modelo. O gargalo é o CRM. Mais especificamente, a trava regulatória — LGPD, setores regulados e compliance — que aparece no exato momento em que o agente precisa ler o pedido, o histórico do cliente e o número do cartão para fazer o trabalho bem feito. Um agente que não consegue processar o dado sensível dentro de um contexto confiado é um agente limitado a responder “bom dia, tudo bem?” — e isso não paga o investimento.
A NVIDIA lançou recursos de Confidential Computing que criptografam a memória durante a inferência de LLMs, e isso é a peça que faltava para empresas reais escalarem automações que tocam em PII. O artigo técnico da NVIDIA (link direto para o post original), publicado em setembro, mostra que a empresa agora oferece um caminho não apenas seguro, mas rápido para rodar workloads críticos em hardware confiável, usando máquinas virtuais confidenciais com memória criptografada, GPUs confidenciais e NVLink criptografado.
A velocidade que mata a objeção do time jurídico
A objeção número um de qualquer CTO ou DPO quando você propõe que um agente leia dados de clientes em produção é: “e se vazar?” A objeção número dois é: “e se a LGPD multar a gente?” A objeção número três — a que o pessoal técnico não admite em voz alta — é: “e se a criptografia deixar o sistema lento demais para ser útil?”
A NVIDIA respondeu às três. No teste controlado deles, usando o modelo DeepSeek-R1 (versão NVFP4) em um sistema DGX B200 com oito GPUs NVIDIA B200, a ativação do Confidential Computing preservou entre 96,1% e 98,2% da taxa de geração de tokens em comparação ao baseline sem criptografia, considerando entre 1 e 16 requisições simultâneas. A latência adicional por token ficou entre 1,2% e 4,3%. Em português direto: a criptografia ativa o custo de um café expresso e adiciona uma segurança que tira a sua operação da zona cinzenta regulatória.
Isso é um marco porque, até agora, o discurso comum era de que segurança em inferência de LLM custava caro em performance. A arquitetura Blackwell da NVIDIA foi desenhada para minimizar esse custo. O segredo está em adaptações específicas no framework de inferência (o TensorRT LLM) que ajustam o comportamento da camada de segurança para não destruir a performance. Não é um recurso automático que você ativa e esquece — exige planejamento —, mas o custo de não fazer isso é a barreira regulatória intransponível.
O que muda no seu projeto de agentes de vendas
Vamos ao que interessa para quem opera agentes em produção. O caso de uso clássico de vendas e atendimento: o agente de IA que consulta um CRM, acessa um histórico de chamadas, lê um PDF de NF-e ou processa uma troca de produto. Nesses fluxos, o agente precisa ler dados privados em memória — e, sem criptografia, esse tráfego fica exposto dentro do próprio data center (seja on-premises ou nuvem).
Sem o ambiente confiado, você é obrigado a fazer o trabalho sujo: anonimizar dados antes de mandar pro modelo, limitar o contexto que o agente pode acessar ou simplesmente ter um humano revisando tudo — o que anula o ganho de produtividade. Com o Confidential Computing da NVIDIA, os dados são processados dentro de um ambiente com memória criptografada de ponta a ponta, o que permite que o processamento de dados sensíveis aconteça de forma segura, sem expor o conteúdo dos prompts ou dos contextos empresariais.
O resultado prático para o negócio é este: você pode confiar que o agente vai tocar no dado sem violar a conformidade. E, mais importante para o bolso: isso desbloqueia automações em setores regulados — healthcare, financeiro, jurídico — que hoje dependem de intervenção humana por causa de restrição normativa. A equação simples é: sem criptografia em memória, o agente fica limitado a dados genéricos; com criptografia, ele pode assumir processos críticos.
O custo de ignorar a infraestrutura de segurança
Este parágrafo é para quem está avaliando escalar agentes no próximo trimestre. O artigo da NVIDIA traz um detalhe que o time de marketing da sua empresa vai odiar, mas o time de engenharia precisa saber: a criptografia não vem de graça e não é plug-and-play. O ambiente de computação confidencial da NVIDIA exige que o framework de inferência seja “CC-aware” — ou seja, ciente da computação confidencial.
Na prática, o TensorRT LLM (o framework de inferência da própria NVIDIA) teve que se adaptar de três formas importantes, e você precisa verificar se a sua stack faz o mesmo:
- Movimentação de dados host-para-dispositivo: em configurações com criptografia, a memória “pinned” (que normalmente acelera transferências) perde a vantagem, então o framework precisa escolher deliberadamente memória pageable. Além disso, a leitura repetida de tokens retorna para o lado do host através de um bounce buffer criptografado por software, então o TensorRT LLM move essa leitura para um worker assíncrono para não bloquear o scheduler principal durante a decodificação.
- Estabilização de timing: o medidor de performance do kernel (autotuner) normalmente usa CUDA events para comparar candidatos de otimização. Na configuração confidencial, esses timestamps saíram instáveis — a solução foi trocar para o
%globaltimerda GPU para medições precisas, evitando que o sistema escolha uma tática mais lenta por engano. - Comunicação multi-GPU: o NVLS (multicast via NVLink SHARP) não está disponível em configurações confidenciais no B200. Isso significa que o framework precisa detectar a indisponibilidade do NVLS e escolher algoritmos de comunicação que minimizem a latência para o tamanho de mensagem e topologia atuais.
O que isso significa para a sua empresa: se você está contratando fornecedores ou escolhendo infraestrutura para rodar agentes, não aceite a resposta “funciona, mas é confidencial, então é mais lento”. A resposta certa é “funciona, é confidencial, e nós medimos a queda real usando seu workload”. O método de medição deles é simples e replicável — rodar o mesmo workload com CC desligado e ligado, mantendo modelo, hardware, framework e nível de concorrência constantes. A diferença é o custo real da segurança. Se o seu fornecedor não consegue te dar essa métrica, é um sinal de alerta.
O roteiro para implementar agora
A NVIDIA recomenda em documentação própria que a configuração de segurança e a otimização de inferência sejam tratadas como um único problema de deploy. Isso é um conselho de engenharia, mas é também um conselho de negócio: segurança não pode ser uma camada que você adiciona depois do sistema pronto. Se você desenhar a arquitetura do agente primeiro e a segurança depois, vai pagar o preço em performance e em refatoração.
O roteiro prático para times que operam agentes com dados de cliente:
- Identifique quais agentes realmente tocam em dados sensíveis — CRM, pedidos, PII. Esses precisam de ambiente confiável. Um agente de geração de copy para redes sociais não precisa (a menos que use dados de clientes como base).
- Exija do fornecedor de infraestrutura (ou da sua equipe interna) a configuração com Confidential Computing habilitado nas GPUs NVIDIA Blackwell, com verificações de atestação do ambiente antes de rodar qualquer inferência.
- Meça o overhead real com o seu workload, não com benchmarks de exemplo. A diferença entre 1,2% e 4,3% de latência depende do nível de concorrência, do tamanho do contexto e da configuração de paralelismo. Quanto menor a concorrência e maior o contexto, mais visível é o custo.
- Use o benchmark divulgado como piso realista: no caso do DeepSeek-R1 com oito B200s, a criptografia custou de 1,8% a 3,9% do throughput e de 1,2% a 4,3% de latência. Qualquer coisa muito acima disso aponta problema de configuração ou de framework desatualizado.
O ponto final é uma constatação incômoda e necessária: a NVIDIA resolveu a parte de hardware da equação de segurança, mas o framework de inferência e a infraestrutura em torno dele precisam estar adaptados. Na prática, isso significa que o time de engenharia não pode mais tratar segurança e performance como trade-offs opostos — a arquitetura Blackwell de computação confidencial entrega ambos, mas exige que os dois sejam trabalhados juntos.
No fim das contas, para o negócio, o resultado é claro: a barreira regulatória que impedia a automação de escalar deixou de existir no nível técnico. Agora ela existe apenas no nível de quem ainda não atualizou a infraestrutura — e sabe que o concorrente, esse sim, está rodando agentes confidenciais com acesso completo ao CRM, processando pedidos e dados de clientes sem sair da conformidade.



