Retour au Blog
Blog

Comment les serveurs MCP consomment silencieusement votre budget de tokens Claude et comment l'éviter

Aug 7, 2026·7 min read·Jigar Mehta
#MCP#Claude Code#Token#Budget#Servers
Comment les serveurs MCP consomment silencieusement votre budget de tokens Claude et comment l'éviter

Connectez cinq serveurs MCP à Claude Code, ne tapez rien, et vous pouvez déjà consommer 50 000 tokens avant que le modèle ait lu une seule ligne de votre invite. Aucune erreur. Aucun avertissement. Juste une session plus lente, plus coûteuse, silencieusement moins performante, et la plupart des équipes ne découvrent jamais pourquoi.

Nous travaillons régulièrement avec des ingénieurs qui utilisent Claude Code au quotidien, et c'est le problème de coût qui surprend presque tout le monde. Non pas parce qu'il est obscur. Parce qu'il est invisible par conception. Les serveurs MCP font exactement ce qu'ils sont censés faire. Personne ne vous a dit quel était le prix.

Ce que MCP charge réellement dans le contexte

Model Context Protocol (MCP) est la norme ouverte d'Anthropic pour connecter Claude à des outils externes : GitHub, Slack, des bases de données, des API internes, tout ce que votre stack a besoin. Chaque serveur que vous connectez enregistre ses outils, et chaque outil inclut un nom, une description et un schéma de paramètres. C'est la partie que personne ne relit deux fois avant de cliquer sur connexion.

Voici la partie importante : ces définitions sont chargées dans le contexte, et selon votre configuration, ce chargement peut se faire à chaque tour, pas une seule fois au début de la session. Un serveur avec deux outils simples ne coûte presque rien. Un serveur avec quatre-vingt-dix coûte de l'argent réel et de l'attention réelle, que vous l'utilisiez cette session ou non.

L'écart entre les serveurs est énorme. Un serveur SQLite minimal peut fonctionner avec moins de 500 tokens. Le serveur GitHub MCP complet, en revanche, a été mesuré indépendamment à environ 26 000 à 55 000 tokens de définitions d'outils uniquement, soit entre 13 et 27 pour cent d'une fenêtre de contexte de 200 000 tokens, avant de lui demander de faire quoi que ce soit.

Les deux factures différentes que vous payez

Il est utile de diviser cela en deux coûts car les solutions sont différentes pour chacun.

  • Coût fixe : les définitions d'outils elles-mêmes. Chaque serveur connecté injecte des noms, des descriptions et des schémas au démarrage de la session. C'est la partie qui surprend les gens, car elle est payée que les outils soient utilisés ou non.

  • Coût variable : les résultats. Chaque appel d'outil retourne son intégralité dans le contexte, pas un résumé. Une requête de base de données de 10 000 lignes, un fichier journal volumineux, une réponse JSON gonflée — tout cela reste dans la fenêtre pour le reste de la session, et Claude relit toute la conversation à chaque message ultérieur. Le message 50 coûte plus cher que le message 5, uniquement à cause de ce qui l'a précédé.

Connectez trois ou quatre serveurs sans réfléchir à l'un ou l'autre des coûts, et il est réaliste de brûler bien plus de la moitié de votre fenêtre de contexte en surcharge avant que le travail réel commence.

Pourquoi ce n'est pas seulement un problème de coût

La dépense en tokens est le montant qui apparaît sur une facture, donc c'est ce que les gens remarquent en premier. Ce n'est pas la partie la plus dommageable.

La qualité des résultats se dégrade lorsque trop de définitions d'outils se disputent l'attention du modèle. Les équipes utilisant des configurations MCP plus lourdes ont signalé que le modèle commence à chasser des outils non pertinents au milieu d'une tâche, suggérant avec confiance quelque chose comme créer un problème GitHub comme solution à un délai d'attente de base de données. Plus d'outils chargés ne signifie pas plus de capacités. Passé un certain point, cela signifie que le modèle raisonne sur une surface encombrer au lieu de votre vrai problème.

Pour un fondateur ou un responsable d'ingénierie, cela repose la question. Ce n'est pas « pouvons-nous nous permettre les tokens supplémentaires ? » C'est « Rendons-nous silencieusement chaque session pire en gardant huit serveurs MCP connectés que nous utilisons deux fois par mois ? »

La solution qu'Anthropic a déjà déployée, et celle que vous contrôlez encore

La bonne nouvelle, c'est que le protocole lui-même a évolué. Anthropic a déployé une capacité de recherche d'outils qui reporte le chargement des schémas complets jusqu'à ce qu'un outil soit réellement nécessaire, au lieu de déverser chaque définition d'avance. Les premiers résultats signalent une baisse du coût des tokens au démarrage d'environ 83 pour cent lorsque cela est actif, et une mesure de production largement citée est passée d'environ 51 000 tokens de surcharge à 8 500 après l'activation, une réduction d'environ 83 pour cent, sans réécrire une seule invite.

C'est la solution d'infrastructure. Ce n'est pas encore universellement activé par défaut partout, et cela ne remplace pas les bonnes habitudes.

Quatre choses qui valent la peine cette semaine

  1. Exécutez /context. Voyez exactement où vos tokens vont avant de deviner. Cela prend trente secondes et surprend généralement les gens.

  2. Auditez vos serveurs connectés. La plupart des développeurs ont trois ou quatre serveurs MCP chargés qu'ils utilisent une fois par semaine. Déconnectez-les. Reconnectez-les quand la tâche les nécessite réellement.

  3. Mettez en liste blanche les outils ; ne chargez pas les serveurs complets. Si vous utilisez cinq opérations sur cinquante sur un serveur, n'exposez que les cinq. Cela seul peut réduire la surcharge d'un serveur d'environ 80 à 90 pour cent.

  4. Prétraitez avant qu'il n'entre dans le contexte. Un hook qui filtre un fichier journal de 10 000 lignes pour le mot « erreur » et ne retourne que les correspondances. Cela transforme des dizaines de milliers de tokens en quelques centaines. Claude n'a besoin que de l'aiguille, pas de la botte de foin.

FAQ : MCP, coûts en tokens, et construction d'une équipe qui comprend ça

Q. Connecter un serveur MCP coûte-t-il des tokens même si je ne l'utilise jamais cette session ?

Oui, dans une configuration par défaut. Les définitions d'outils sont chargées au démarrage de la session, que vous appeliez l'outil ou non. Le chargement différé change cela, mais seulement où il est activement configuré.

Q. Une plus grande fenêtre de contexte est-elle la solution à la surcharge MCP ?

Non. Une plus grande fenêtre donne juste à la surcharge plus de place pour se cacher. La surcharge est toujours un coût réel, et la compréhension à grandes tailles de contexte varie considérablement entre les modèles, donc une fenêtre remplie fonctionnera rarement aussi bien qu'une fenêtre léchée.

Q. Comment savons-nous si un candidat comprend vraiment cela, par rapport à simplement savoir comment connecter un serveur ?

Demandez-lui de vous expliquer un audit de coût Claude Code qu'il a réellement exécuté et ce qu'il a déconnecté en conséquence. Les ingénieurs qui ont rencontré une fenêtre de contexte gonflée en production parlent spécifiquement de ce qu'ils ont coupé. Les ingénieurs qui ne l'ont pas fait parlent généralement de MCP en abstrait.

Q. Où trouver des ingénieurs qui construisent déjà avec cette discipline ?

C'est l'un des signaux pratiques que nous recherchons en examinant les développeurs pour les clients de MyNextDeveloper, car l'ingénierie de contexte consciente des coûts en dit plus sur la façon dont quelqu'un travaille réellement avec les outils IA au quotidien qu'une ligne de CV sur « expérience en IA » ne le fera jamais.

Points clés

  • Les serveurs MCP chargent les schémas d'outils complets dans le contexte, parfois à chaque tour, que les outils soient utilisés ou non.

  • Le serveur GitHub MCP seul a été mesuré entre environ 26 000 et 55 000 tokens de surcharge avant votre première invite.

  • Un contexte surchargé ne coûte pas seulement de l'argent. Cela dégrade la qualité des résultats, parfois visiblement.

  • Le chargement différé des outils, la mise en liste blanche et les hooks de prétraitement sont les solutions pratiques et disponibles aujourd'hui.

  • Exécutez /context avant de supposer que vous savez où vos tokens vont réellement. La plupart des gens ne le savent pas.

Pourquoi c'est important

Les serveurs MCP sont véritablement utiles, et rien de tout cela n'est un argument contre leur connexion. C'est un argument contre leur connexion et l'oubli de leur présence. La surcharge est mesurable, les solutions sont disponibles, et les équipes qui progressent sont celles qui traitent le contexte comme un budget au lieu d'un a posteriori.

Ce genre de discipline n'apparaît pas sur un CV, mais elle apparaît rapidement dans la façon dont quelqu'un travaille réellement. C'est exactement le type de jugement que nous testons chez MyNextDeveloper quand nous appareillons les fondateurs avec des ingénieurs qui construisent déjà de cette façon, pas ceux qui l'apprennent encore à vos frais.

TL;DR

Chaque serveur MCP connecté à Claude Code charge son schéma d'outils complet dans le contexte, parfois à chaque tour, que vous l'utilisiez ou non. Le serveur GitHub MCP seul a été mesuré entre environ 26 000 et 55 000 tokens de surcharge avant que vous ayez tapé une seule invite. Ce n'est pas seulement un problème de coût : un contexte surchargé dégrade également la qualité des résultats, parfois en poussant le modèle à chasser des outils non pertinents au milieu d'une tâche. La fonction de chargement différé des outils d'Anthropic aide, mais mettre en liste blanche les outils, déconnecter les serveurs non utilisés et prétraiter les résultats d'outils bruyants dépendent toujours de vous. Exécutez /context avant de supposer que vous savez réellement où vos tokens vont.

Cherchez-vous à construire une équipe technique hautement performante en télétravail ?

Consultez MyNextDeveloper, une plateforme où vous pouvez trouver les 3 % meilleurs d'ingénieurs logiciels profondément passionnés par l'innovation. Nos solutions de talent logiciel à la demande, dédiées et approfondies offrent une solution complète pour tous vos besoins logiciels.

Visitez notre site web pour explorer comment nous pouvons vous aider à assembler votre équipe parfaite.