MCP em Coding Agents: Por Que um Servidor Consome 18.000 Tokens Antes de Qualquer Ação e Como Contornar o Problema

O Model Context Protocol (MCP), desenvolvido inicialmente pela Anthropic, revolucionou a forma como agentes de IA interagem com ferramentas externas. No entanto, um problema recorrente tem surgido: servidores MCP podem consumir milhares de tokens apenas para definir suas ferramentas, antes mesmo de executar qualquer tarefa útil. Um caso emblemático é o relato de um servidor MCP que consumiu 18.000 tokens antes de processar qualquer solicitação, um desperdício que impacta diretamente o custo e a eficiência dos agentes de IA.

Por Que Isso Acontece?

O MCP funciona como uma interface padronizada que permite aos agentes de IA descobrirem e interagirem com ferramentas externas, como APIs, bancos de dados e sistemas operacionais. No entanto, cada ferramenta exposta por um servidor MCP requer uma descrição detalhada, incluindo nome, descrição e esquema JSON completo de parâmetros de entrada. Por exemplo:

  • Uma única ferramenta bem documentada pode consumir entre 200 e 500 tokens.
  • Um servidor com 50 ferramentas, comum em ambientes empresariais, pode consumir entre 10.000 e 25.000 tokens apenas para definir as ferramentas, antes mesmo de qualquer interação real.

Esse consumo excessivo de tokens ocorre porque cada ferramenta é incluída no prompt do sistema em cada solicitação, inflacionando custos e reduzindo a janela de contexto disponível para a tarefa real. Além disso, respostas com muitos campos vazios também contribuem para esse desperdício, uma vez que cada campo consome tokens desnecessariamente.

O Caso do Agente de Codificação Pi

O agente de codificação Pi, desenvolvido por Mario Zechner, inicialmente descartou o uso do MCP, argumentando que ele era desnecessário. No entanto, após a aquisição da plataforma pela empresa Earendil em abril de 2026, o Pi incorporou suporte ao MCP em sua versão 1.0, reconhecendo a importância do protocolo para a integração com ferramentas externas.

Apesar dessa evolução, muitos usuários ainda enfrentam desafios com o consumo excessivo de tokens. Por exemplo, um desenvolvedor que conectou três servidores MCP (Supabase, GitHub e Linear) relatou que, ao expor 81 ferramentas, seu agente consumiu mais de 20.000 tokens antes mesmo de processar qualquer mensagem. Isso representa 16% de uma janela de contexto de 128.000 tokens, desperdiçada em cada chamada de API.

Solucionando o Problema: Estratégias para Otimizar o Uso de Tokens

Felizmente, existem várias estratégias para mitigar esse problema e otimizar o uso de tokens em servidores MCP:

1. Medir e Identificar Ferramentas Problemáticas

Antes de otimizar, é essencial medir o consumo de tokens das ferramentas. Ferramentas como o MCP Token Counter permitem analisar o consumo de tokens por ferramenta em segundos, sem necessidade de instalação ou cadastro. Com essas informações, é possível identificar quais ferramentas estão consumindo mais recursos e priorizar otimizações.

2. Otimizar Descrições de Ferramentas

Descrições longas e detalhadas de ferramentas podem ser reduzidas sem perder clareza. Por exemplo:

  • Remover campos nulos ou vazios nas respostas das ferramentas.
  • Simplificar descrições, mantendo apenas informações essenciais para o roteamento.
  • Dividir servidores MCP em grupos menores, expondo apenas as ferramentas necessárias para cada agente.

3. Adotar Técnicas Avançadas de Otimização

Técnicas como a TOON (Tool Output Optimization Notation) podem reduzir o consumo de tokens em até 98% em certos cenários. Além disso, a execução de código e a busca por ferramentas podem ser otimizadas para evitar o carregamento desnecessário de informações.

4. Carregamento Adiado de Ferramentas

Alguns agentes, como o Pi, agora suportam o carregamento adiado de ferramentas, que evita a inclusão de todas as ferramentas no prompt inicial. Em vez disso, as ferramentas são carregadas sob demanda, reduzindo significativamente o consumo inicial de tokens.

5. Limitar o Tamanho das Respostas

Implementar limites de tamanho para as respostas das ferramentas pode evitar que respostas excessivamente grandes consumam a janela de contexto. Isso pode ser feito no nível do cliente ou do servidor, garantindo que apenas informações relevantes sejam incluídas.

Desafios Futuros e Evolução do MCP

Apesar dos avanços, o MCP ainda enfrenta desafios técnicos e de segurança. Um dos principais problemas é a falta de provenância, ou seja, a capacidade de rastrear a origem e a história das ações realizadas por um agente. Além disso, a autenticação e autorização em ambientes empresariais ainda são pontos críticos, exigindo integração com provedores de identidade existentes.

Empresas como a Anthropic e a OpenAI continuam a evoluir o protocolo, introduzindo melhorias como:

  • Suporte a sessões estateless, eliminando a necessidade de handshakes iniciais.
  • Integração com modelos de decisão, como o Jev, para aprimorar a tomada de decisões em agentes.
  • Melhorias na segurança, como autenticação granular e monitoramento de atividades.

O MCP também está sendo adotado em setores como o e-commerce, permitindo que agentes de IA interajam com plataformas como o Shopify de forma padronizada e segura.

Conclusão

O consumo excessivo de tokens em servidores MCP é um desafio real, mas não insuperável. Com as estratégias corretas — como otimização de descrições, carregamento adiado de ferramentas e limitação de respostas — é possível reduzir significativamente o desperdício de recursos e melhorar a eficiência dos agentes de IA.

À medida que o MCP evolui, espera-se que novas melhorias sejam introduzidas para tornar a integração de ferramentas ainda mais eficiente e segura, consolidando seu papel como padrão para a comunicação entre agentes de IA e sistemas externos.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *