Volver al Blog
Blog

Cómo los servidores MCP consumen silenciosamente tu presupuesto de tokens en Claude y cómo evitarlo

Aug 7, 2026·7 min read·Jigar Mehta
#MCP#Claude Code#Token#Budget#Servers
Cómo los servidores MCP consumen silenciosamente tu presupuesto de tokens en Claude y cómo evitarlo

Conecta cinco servidores MCP a Claude Code, no escribas nada, y ya habrás consumido 50.000 tokens antes de que el modelo lea una sola línea de tu prompt. Sin errores. Sin advertencias. Solo una sesión más lenta, más cara y silenciosamente menos inteligente, y la mayoría de los equipos nunca descubren por qué.

Pasamos mucho tiempo alrededor de ingenieros que construyen con Claude Code a diario, y este es el problema de costos que sorprende a casi todos. No porque sea oscuro. Porque es invisible por diseño. Los servidores MCP hacen exactamente lo que se supone que deben hacer. Nadie te dijo qué cuesta eso.

Qué carga realmente MCP en el contexto

Model Context Protocol (MCP) es el estándar abierto de Anthropic para conectar Claude a herramientas externas: GitHub, Slack, bases de datos, APIs internas, lo que tu stack necesite. Cada servidor que conectas registra sus herramientas, y cada herramienta incluye un nombre, una descripción y un esquema de parámetros. Esa es la parte que nadie lee dos veces antes de hacer clic en conectar.

Aquí viene lo importante: esas definiciones se cargan en el contexto, y dependiendo de tu configuración, esa carga puede suceder en cada turno, no solo al inicio de la sesión. Un servidor con dos herramientas limpias cuesta casi nada. Un servidor con noventa cuesta dinero real y atención real, uses esas herramientas en esa sesión o no.

La diferencia entre servidores es enorme. Un servidor SQLite mínimo puede funcionar con menos de 500 tokens. El servidor MCP completo de GitHub, en contraste, ha sido medido de forma independiente en aproximadamente 26.000 a 55.000 tokens solo en definiciones de herramientas, entre el 13 y el 27 por ciento de una ventana de contexto de 200.000 tokens, antes de que se te pida hacer nada.

Los dos gastos diferentes que estás pagando

Ayuda dividir esto en dos costos porque las soluciones son diferentes para cada uno.

  • Costo fijo: las definiciones de herramientas en sí. Cada servidor conectado inyecta nombres, descripciones y esquemas al inicio de la sesión. Esta es la parte que sorprende a la gente, porque se paga haya o no se usen las herramientas.

  • Costo variable: los resultados. Cada llamada a herramienta devuelve su salida completa al contexto, no un resumen. Una consulta de base de datos de 10.000 filas, un archivo de registro extenso, una respuesta JSON voluminosa, todo permanece en la ventana para el resto de la sesión, y Claude relee toda la conversación en cada mensaje posterior. El mensaje 50 cuesta más que el mensaje 5, puramente por lo que vino antes.

Conecta tres o cuatro servidores sin pensar en ninguno de estos costos, y es realista quemar más de la mitad de tu ventana de contexto en sobrecarga antes de que comience el trabajo real.

Por qué esto no es solo un problema de costos

El gasto de tokens es la cantidad que aparece en una factura, así que es la parte que la gente nota primero. No es la parte más dañina.

La calidad de salida se degrada cuando demasiadas definiciones de herramientas compiten por la atención del modelo. Los equipos que ejecutan configuraciones MCP más pesadas han reportado que el modelo comienza a perseguir herramientas irrelevantes durante la tarea, sugiriendo con confianza algo como crear un problema de GitHub como solución para un agotamiento de tiempo de base de datos. Más herramientas cargadas no significan más capacidad. Pasado cierto punto, significa que el modelo razona sobre una superficie desordenada en lugar de tu problema real.

Para un fundador o líder de ingeniería, esto reencuadra la pregunta. No es "¿podemos pagar los tokens extra?" Es "¿Estamos silenciosamente empeorando cada sesión dejando ocho servidores MCP conectados que usamos dos veces al mes?"

La solución que Anthropic ya implementó, y las que aún dependen de ti

La buena noticia es que el protocolo en sí ha avanzado. Anthropic implementó una capacidad de búsqueda de herramientas que difiere la carga de esquemas completos hasta que una herramienta sea realmente necesaria, en lugar de descargar cada definición de una vez. Los resultados iniciales reportados muestran que el costo de token de inicio se reduce aproximadamente un 83 por ciento cuando esto está activo, y una medición de producción ampliamente citada pasó de aproximadamente 51.000 tokens de sobrecarga a 8.500 después de habilitarlo, una reducción cercana al 83 por ciento, sin reescribir un solo prompt.

Esa es la solución de infraestructura. Aún no está activada por defecto en todas partes universalmente, y no reemplaza los buenos hábitos.

Cuatro cosas que vale la pena hacer esta semana

  1. Ejecuta /context. Ve exactamente a dónde van tus tokens antes de adivinar. Esto toma treinta segundos y generalmente sorprende a la gente.

  2. Audita tus servidores conectados. La mayoría de los desarrolladores tienen tres o cuatro servidores MCP cargados que tocan una vez a la semana. Desconectalos. Reconecta cuando la tarea realmente los necesite.

  3. Crea una lista blanca de herramientas; no cargues servidores completos. Si usas cinco operaciones de cincuenta en un servidor, expón solo las cinco. Esto solo puede reducir la sobrecarga de un servidor aproximadamente entre 80 y 90 por ciento.

  4. Preprocesa antes de que llegue al contexto. Un gancho que busca en un registro de 10.000 líneas la palabra "error" y devuelve solo las coincidencias. Esto convierte decenas de miles de tokens en algunos cientos. Claude no necesita el pajar, solo la aguja.

FAQ: MCP, costos de tokens y construcción de un equipo que entienda esto

P. ¿Conectar un servidor MCP cuesta tokens incluso si nunca lo uso en esa sesión?

Sí, en una configuración predeterminada. Las definiciones de herramientas se cargan al inicio de la sesión independientemente de si llamas la herramienta. La carga diferida cambia esto, pero solo donde está configurada activamente.

P. ¿Es una ventana de contexto más grande la solución para la sobrecarga de MCP?

No. Una ventana más grande solo da más espacio a la sobrecarga para esconderse. La sobrecarga sigue siendo un costo real, y la comprensión en tamaños de contexto grandes varía significativamente entre modelos, así que una ventana abarrotada raramente funciona tan bien como una limpia.

P. ¿Cómo sabemos si un candidato realmente entiende esto, versus solo saber cómo conectar un servidor?

Pídele que recorra una auditoría de costos de Claude Code que realmente haya ejecutado y qué desconectó como resultado. Los ingenieros que han experimentado una ventana de contexto abarrotada en producción hablan específicamente sobre qué cortaron. Los ingenieros que no lo han hecho tienden a hablar sobre MCP en abstracto.

P. ¿Dónde encontramos ingenieros que ya construyen con esta disciplina?

Esta es una de las señales prácticas que buscamos al evaluar desarrolladores para clientes de MyNextDeveloper, porque la ingeniería de contexto consciente del costo dice más sobre cómo alguien realmente trabaja con herramientas de IA día a día que una línea de resume sobre "experiencia en IA" jamás lo hará.

Puntos clave

  • Los servidores MCP cargan esquemas de herramientas completos en el contexto, a veces en cada turno, haya o no se usen las herramientas.

  • El servidor MCP de GitHub solo ha sido medido entre aproximadamente 26.000 y 55.000 tokens de sobrecarga antes de tu primer prompt.

  • El contexto sobrecargado no solo cuesta dinero. Degrada la calidad de salida, a veces visiblemente.

  • La carga diferida de herramientas, listas blancas y ganchos de preprocesamiento son las soluciones prácticas y disponibles hoy.

  • Ejecuta /context antes de asumir que sabes a dónde van realmente tus tokens. La mayoría de la gente no lo sabe.

Por qué importa

Los servidores MCP son genuinamente útiles, y nada de esto es un argumento en contra de conectarlos. Es un argumento en contra de conectarlos y olvidar que están ahí. La sobrecarga es medible, las soluciones están disponibles, y los equipos que avanzan son los que tratan el contexto como un presupuesto en lugar de una idea tardía.

Ese tipo de disciplina no aparece en un resume, pero aparece rápidamente en cómo alguien realmente trabaja. Es exactamente el tipo de juicio que evaluamos en MyNextDeveloper cuando emparejamos fundadores con ingenieros que ya construyen de esta manera, no con los que aún la están aprendiendo con tu dinero.

TL;DR

Cada servidor MCP conectado a Claude Code carga su esquema de herramientas completo en el contexto, a veces en cada turno, uses o no esa herramienta. El servidor MCP de GitHub solo ha sido medido entre aproximadamente 26.000 y 55.000 tokens de sobrecarga antes de que hayas escrito un solo prompt. Esto no es solo un problema de costos: el contexto sobrecargado también degrada la calidad de salida, a veces haciendo que el modelo persiga herramientas irrelevantes durante la tarea. La característica de carga diferida de herramientas de Anthropic ayuda, pero crear listas blancas de herramientas, desconectar servidores no utilizados y preprocesar salidas de herramientas ruidosas dependen aún de ti. Ejecuta /context antes de asumir que sabes a dónde van realmente tus tokens.

¿Buscas construir un equipo tecnológico remoto de alto rendimiento?

Consulta MyNextDeveloper, una plataforma donde puedes encontrar el 3% superior de ingenieros de software que están profundamente apasionados por la innovación. Nuestras soluciones de talento de software bajo demanda, dedicadas y exhaustivas proporcionan una solución integral para todos tus requisitos de software.

Visita nuestro sitio web para explorar cómo podemos ayudarte a armar tu equipo perfecto.