EM ALTA · Como Escalar Campanhas Facebook Ads — guia completo
17.05.26 · 150 ARTIGOS
Assinar

Pare de pagar por token: nova compacção do Claude corta contexto entre turnos de agente

O SDK da Anthropic agora compacta o histórico entre turnos de agente, reduzindo tokens por execução. Menos contexto, menos custo por automação.

CB
Celso Bufano
21 de setembro de 2026, 07:04 · 3 MIN DE LEITURA
Mulher de camisa azul sentada à mesa de escritório segura folha dobrada ao lado de pilha de papéis, monitor de costas e cesto cheio de papel.

O problema silencioso dos agentes: contexto crescendo sem limite

A cada automação rodada via API da Anthropic, o custo real de uma execução quase nunca é o prompt inicial — é tudo o que vem depois. Quando um agente executa uma tarefa em múltiplos passos, ele precisa carregar o histórico de conversa a cada chamada seguinte. Para quem usa IA para produção de conteúdo em escala, atendimento automatizado ou fluxos de venda no WhatsApp e e-mail, o padrão é um só: o contexto cresce como uma pilha de arquivos na mesa de um analista desorganizado, e a fatura cresce junto.

Agora, a atualização do SDK Python da Anthropic ataca exatamente esse nó. A versão v1.7.0 no GitHub — e a anterior, v1.6.0 — introduz a compactação como parâmetro oficial e novos blocos de compactação assinados (beta). Mais do que uma novidade de API, é uma resposta direta a um problema de custo operacional: histórico que se encolhe entre turnos em vez de dobrar de tamanho a cada execução.

Para o profissional de marketing que roda agentes em produção, a tradução é simples: o custo por automação cai quando o agente não reenvia todo o contexto em cada chamada.


Como funciona a compactação no fluxo real do tool runner

A atualização está no nível do tool runner, com o método compact_before_next_turn(). Em termos práticos, isso significa que o agente, ao terminar uma etapa e antes de iniciar a próxima, pode compactar o histórico acumulado daquele turno. Em vez de carregar a transcrição inteira da conversa — incluindo respostas longas, logs de ferramentas e mensagens intermediárias que se repetem —, o sistema resume o que é relevante e descarta o resto.

A diferença no bolso é material. Imagine um fluxo de geração de relatórios semanais de performance para um cliente. Na primeira chamada, o agente recebe as instruções. Na segunda, ele precisa da resposta da primeira chamada para decidir o próximo passo. Na terceira, ele vai usar o histórico para formatar o relatório. Sem compactação, cada chamada acumula o conteúdo de todas as anteriores, com frequência multiplicado por múltiplos agentes rodando em paralelo para dezenas de contas de cliente.

Com a compactação ativada, o agente encerra o turno processando um resumo estruturado. O histórico que era de 20.000 tokens pode virar 3.000. Numa operação com 50 automações diárias, a diferença é significativa — e o custo de processamento cai proporcionalmente. O que a Anthropic está entregando não é um novo modelo mais barato ou uma mudança de precificação. É uma ferramenta para você, operador de automações, cortar o excedente do seu próprio uso.

NOTA: Para quem roda agentes via tool runner (com a ferramenta tools configurada), o método compact_before_next_turn() precisa ser ativado no código. Como o projeto é open source, as equipes de marketing com suporte técnico podem atualizar o SDK e testar o comportamento em fluxos controlados antes de escalar.

O que muda na prática para fluxos de conteúdo

No caso concreto de produção de conteúdo em escala — digamos, um blog que publica 20 artigos por mês com um agente que pesquisa, estrutura, escreve e revisa —, o ciclo típico tem de 6 a 10 chamadas. Sem compactação, o agente carrega o esqueleto do artigo na quarta chamada, a primeira versão na quinta, as correções na sexta. O custo de processamento em cada etapa aumenta. Com o novo recurso, o agente resume o que já decidiu em cada ponto de retomada.

Isso também reduz o risco de estouro de janela de contexto — o temido “context length exceeded” que derruba automações no meio do caminho.


Blocos assinados: o controle fino por categoria de custo

A versão v1.7.0 adiciona ao SDK os blocos de compactação assinados, em beta. Esses blocos funcionam como marcadores no fluxo de mensagens: quando o agente compacta o histórico, ele insere um bloco que indica “aqui foi comprimido conforme o padrão oficial”. Isso cria uma camada de previsibilidade na estrutura de resposta da API.

Na prática, para quem opera mais de um agente em paralelo (ex.: um para qualificação de leads no Instagram e outro para follow-up por e-mail), isso significa que a estrutura da resposta passa a ser padronizada mesmo após a compactação. O sistema consegue identificar os limites do que foi compactado — o que reduz os riscos de quebra de parsing na hora de extrair dados.

A assinatura dos blocos também entra num ponto de segurança operacional. Quando o histórico é compactado e assinado, há uma trava contra adulteração entre os bastidores. No contexto de automações de marketing, isso protege o agente contra prompts injetados no meio do histórico por dados externos. Um exemplo claro: num atendimento automatizado em que um cliente envia um link para o agente, e o conteúdo do link tenta influenciar o comportamento futuro de resposta, o bloco assinado garante que a conversa compactada não possa ser falsificada para alterar decisões do sistema.


Implicações de custo: por que parar de pagar por token

O modelo de precificação da Anthropic é por token de entrada e saída. O custo de uma automação é definido pelo volume total. Para operações que rodam 1.000 execuções agendadas por mês, cada token economizado tem impacto direto no CAC operacional. Com a compactação entre turnos, a economia não vem de negociar preço — vem de reduzir o volume real.

Há também um ganho secundário de latência. Menos contexto significa menos tempo de processamento, o que se traduz em respostas mais rápidas na ponta. Para automações de atendimento ao cliente, isso melhora a experiência sem novos investimentos em modelos.

O raciocínio é direto: se você tem um agente que processa 10 rodadas de conversa por tarefa e cada rodada reenvia o histórico acumulado, o custo cresce exponencialmente em tarefas longas. A compactação quebra essa progressão.


Riscos operativos reduzidos para produção de conteúdo e atendimento

A adoção da compactação traz um divisor de águas para fluxos de atendimento ao cliente. No atendimento automatizado, o histórico de interação entre o cliente e o agente é o insumo principal para a próxima resposta. Sem compactação, o agente carrega todo o histórico de compras, dúvidas e interações anteriores — o que é caro e aumenta a chance de alucinação por sobrecarga de informações.

Com a compactação, o agente mantém as informações de alto valor (cliente comprou X, reclamou de Y) e descarta ruído (todas as mensagens completas de saudação). Isso reduz o risco de o modelo se confundir e gerar respostas contraditórias com o histórico.

No caso da produção de conteúdo, o benefício é duplo: reduz o custo e reduz o tempo de processamento. Um agente que sintetiza uma pesquisa de palavras-chave, busca dados de concorrentes e gera um artigo não precisa carregar os 30 resultados de busca completos. Ele résume cada resultado e mantém a essência para a etapa de escrita. O bloco assinado garante que esse resumo não tenha sido alterado no meio do caminho — com implicações para a conformidade do conteúdo gerado.

Comparação para fluxos de venda

No B2B, onde os ciclos de venda envolvem múltiplos toques (e-mail + WhatsApp), o agente precisa acompanhar interações anteriores para não repetir perguntas e soar consistente com a marca. A compactação permite que o agente mantenha apenas os pontos-chave da negociação — orçamento, prazo, objeções principais — e descarte o ruído das mensagens preliminares.

Isso é especialmente relevante para pequenas e médias empresas que querem rodar automações com custo previsível. Em vez de um faturamento variável que explode conforme o funil cresce, a compactação oferece um teto de custo por conversa.


O que muda na precificação e o limite da extrapolação

Vale um aviso de responsabilidade sobre o que a atualização significa — e o que não significa. A mudança no SDK não altera a tabela de preços oficial da Anthropic, tampouco indica um novo modelo. É uma ferramenta que reduz o consumo da sua ponta. A economia vem do uso inteligente, não de crédito promocional.

A adoção do parâmetro compact_before_next_turn() exige que o time de desenvolvimento abrace o padrão. Para operações que dependem de agentes construídos com a API da Anthropic, a atualização do SDK é o primeiro passo. Em seguida, é preciso mapear onde os ganhos de eficiência são maiores: fluxos de longa duração (10+ turnos) se beneficiam mais do que fluxos curtos de 2 a 3 passos.

Vale também uma consideração sobre o descarte da compactação: o impacto máximo vem quando o agente usa a compactação para fins de recuperação, não para truncar informações críticas. O recurso funciona melhor quando usado para reduzir o ruído, não para cortar decisões.


Fontes

NEWSLETTER · TODO DIA ÀS 9H

IA, Dev e tráfego pago na sua caixa.

Curadoria do Celso Bufano sobre IA aplicada, Python, WordPress e estratégias de afiliado. Nada de spam — só o que vale a pena ler.

Um e-mail por dia · cancele a hora que quiser

Comentários


💬 Comentários via Giscus (GitHub) serão integrados aqui.
Configure em src/components/Comments.astro após criar o repo público no GitHub.
CONTINUE LENDO

Relacionados em Era dos Agentes

VER EDITORIA →
Pare de automatizar agentes sem direito de auto-modo: o novo limite do Claude
ERA DOS AGENTES

Pare de automatizar agentes sem direito de auto-modo: o novo limite do Claude

O Claude agora permite agentes gerenciados operar em auto-modo. A novidade indica o rumo da automação de marke…

Celso Bufano · 3 min · 14 DE SET DE 26 · 06:59
Anthropic Cowork: o agente de IA que trabalha nos seus arquivos sem precisar de código
ERA DOS AGENTES

Anthropic Cowork: o agente de IA que trabalha nos seus arquivos sem precisar de código

A Anthropic lançou o Cowork, um agente do Claude Desktop que opera diretamente nos seus arquivos. Veja o que m…

Celso Bufano · 3 min · 01 DE JUL DE 26
Chip de agente da NVIDIA não é pra você: a queda de custo por token é a parte que importa
ERA DOS AGENTES

Chip de agente da NVIDIA não é pra você: a queda de custo por token é a parte que importa

A Vera promete derrubar o custo de rodar agentes — mas para o pequeno negócio a novidade não é comprar chip pr…

Celso Bufano · 5 min · 13 DE SET DE 26 · 07:36