O Model Context Protocol (MCP), desenvolvido inicialmente pela Anthropic, revolucionou a forma como agentes de IA interagem com ferramentas externas. No entanto, um problema recorrente tem surgido: servidores MCP podem consumir milhares de tokens apenas para definir suas ferramentas, antes mesmo de executar qualquer tarefa útil. Um caso emblemático é o relato de um servidor MCP que consumiu 18.000 tokens antes de processar qualquer solicitação, um desperdício que impacta diretamente o custo e a eficiência dos agentes de IA.
Por Que Isso Acontece?
O MCP funciona como uma interface padronizada que permite aos agentes de IA descobrirem e interagirem com ferramentas externas, como APIs, bancos de dados e sistemas operacionais. No entanto, cada ferramenta exposta por um servidor MCP requer uma descrição detalhada, incluindo nome, descrição e esquema JSON completo de parâmetros de entrada. Por exemplo:
- Uma única ferramenta bem documentada pode consumir entre 200 e 500 tokens.
- Um servidor com 50 ferramentas, comum em ambientes empresariais, pode consumir entre 10.000 e 25.000 tokens apenas para definir as ferramentas, antes mesmo de qualquer interação real.
Esse consumo excessivo de tokens ocorre porque cada ferramenta é incluída no prompt do sistema em cada solicitação, inflacionando custos e reduzindo a janela de contexto disponível para a tarefa real. Além disso, respostas com muitos campos vazios também contribuem para esse desperdício, uma vez que cada campo consome tokens desnecessariamente.
O Caso do Agente de Codificação Pi
O agente de codificação Pi, desenvolvido por Mario Zechner, inicialmente descartou o uso do MCP, argumentando que ele era desnecessário. No entanto, após a aquisição da plataforma pela empresa Earendil em abril de 2026, o Pi incorporou suporte ao MCP em sua versão 1.0, reconhecendo a importância do protocolo para a integração com ferramentas externas.
Apesar dessa evolução, muitos usuários ainda enfrentam desafios com o consumo excessivo de tokens. Por exemplo, um desenvolvedor que conectou três servidores MCP (Supabase, GitHub e Linear) relatou que, ao expor 81 ferramentas, seu agente consumiu mais de 20.000 tokens antes mesmo de processar qualquer mensagem. Isso representa 16% de uma janela de contexto de 128.000 tokens, desperdiçada em cada chamada de API.
Solucionando o Problema: Estratégias para Otimizar o Uso de Tokens
Felizmente, existem várias estratégias para mitigar esse problema e otimizar o uso de tokens em servidores MCP:
1. Medir e Identificar Ferramentas Problemáticas
Antes de otimizar, é essencial medir o consumo de tokens das ferramentas. Ferramentas como o MCP Token Counter permitem analisar o consumo de tokens por ferramenta em segundos, sem necessidade de instalação ou cadastro. Com essas informações, é possível identificar quais ferramentas estão consumindo mais recursos e priorizar otimizações.
2. Otimizar Descrições de Ferramentas
Descrições longas e detalhadas de ferramentas podem ser reduzidas sem perder clareza. Por exemplo:
- Remover campos nulos ou vazios nas respostas das ferramentas.
- Simplificar descrições, mantendo apenas informações essenciais para o roteamento.
- Dividir servidores MCP em grupos menores, expondo apenas as ferramentas necessárias para cada agente.
3. Adotar Técnicas Avançadas de Otimização
Técnicas como a TOON (Tool Output Optimization Notation) podem reduzir o consumo de tokens em até 98% em certos cenários. Além disso, a execução de código e a busca por ferramentas podem ser otimizadas para evitar o carregamento desnecessário de informações.
4. Carregamento Adiado de Ferramentas
Alguns agentes, como o Pi, agora suportam o carregamento adiado de ferramentas, que evita a inclusão de todas as ferramentas no prompt inicial. Em vez disso, as ferramentas são carregadas sob demanda, reduzindo significativamente o consumo inicial de tokens.
5. Limitar o Tamanho das Respostas
Implementar limites de tamanho para as respostas das ferramentas pode evitar que respostas excessivamente grandes consumam a janela de contexto. Isso pode ser feito no nível do cliente ou do servidor, garantindo que apenas informações relevantes sejam incluídas.
Desafios Futuros e Evolução do MCP
Apesar dos avanços, o MCP ainda enfrenta desafios técnicos e de segurança. Um dos principais problemas é a falta de provenância, ou seja, a capacidade de rastrear a origem e a história das ações realizadas por um agente. Além disso, a autenticação e autorização em ambientes empresariais ainda são pontos críticos, exigindo integração com provedores de identidade existentes.
Empresas como a Anthropic e a OpenAI continuam a evoluir o protocolo, introduzindo melhorias como:
- Suporte a sessões estateless, eliminando a necessidade de handshakes iniciais.
- Integração com modelos de decisão, como o Jev, para aprimorar a tomada de decisões em agentes.
- Melhorias na segurança, como autenticação granular e monitoramento de atividades.
O MCP também está sendo adotado em setores como o e-commerce, permitindo que agentes de IA interajam com plataformas como o Shopify de forma padronizada e segura.
Conclusão
O consumo excessivo de tokens em servidores MCP é um desafio real, mas não insuperável. Com as estratégias corretas — como otimização de descrições, carregamento adiado de ferramentas e limitação de respostas — é possível reduzir significativamente o desperdício de recursos e melhorar a eficiência dos agentes de IA.
À medida que o MCP evolui, espera-se que novas melhorias sejam introduzidas para tornar a integração de ferramentas ainda mais eficiente e segura, consolidando seu papel como padrão para a comunicação entre agentes de IA e sistemas externos.