Verbind vijf MCP-servers met Claude Code, typ niets, en je bent al 50.000 tokens kwijt voordat het model een enkele regel van je prompt heeft gelezen. Geen fout. Geen waarschuwing. Gewoon een tragere, durdere en stilletjes domere sessie, en de meeste teams ontdekken nooit waarom.
We brengen veel tijd door met engineers die dagelijks met Claude Code bouwen, en dit is het kostprobleem dat bijna iedereen overvalt. Niet omdat het obscuur is. Omdat het opzettelijk onzichtbaar is. MCP-servers doen precies wat ze moeten doen. Niemand vertelde je wat dat kost.
Wat MCP eigenlijk in context laadt
Model Context Protocol (MCP) is Anthropic's open standaard voor het verbinden van Claude met externe tools: GitHub, Slack, databases, interne API's, wat je stack ook nodig heeft. Elke server die je verbindt registreert zijn tools, en elke tool heeft een naam, een beschrijving en een parameterschema. Dat is het gedeelte dat niemand twee keer leest voordat hij op verbinden klikt.
Hier komt het belangrijke gedeelte: die definities worden in context geladen, en afhankelijk van je configuratie kan die belasting op elke beurt gebeuren, niet eenmalig aan het begin van de sessie. Een server met twee schone tools kost bijna niets. Een server met negentig kost echt geld en echt aandacht, of je die sessie gebruikt of niet.
Het verschil tussen servers is enorm. Een minimale SQLite-server werkt onder de 500 tokens. De volledige GitHub MCP-server daarentegen is onafhankelijk gemeten op ongeveer 26.000 tot 55.000 tokens alleen al voor tool-definities, ergens tussen de 13 en 27 procent van een 200.000-token contextvenster, voordat je het iets hebt gevraagd.
De twee verschillende rekeningen die je betaalt
Het helpt om dit in twee kosten op te splitsen omdat de oplossingen voor elk verschillend zijn.
Vaste kosten: de tool-definities zelf. Elke verbonden server injecteert namen, beschrijvingen en schema's bij het begin van de sessie. Dit is het gedeelte dat mensen verrast, omdat het wordt betaald ongeacht of de tools ooit worden gebruikt.
Variabele kosten: de resultaten. Elke tool-aanroep retourneert zijn volledige output in context, niet een samenvatting. Een databasequery met 10.000 rijen, een uitgebreid logbestand, een opgeblazen JSON-respons — het zit allemaal in het venster voor de rest van de sessie, en Claude leest het volledige gesprek bij elk volgend bericht opnieuw. Bericht 50 kost meer dan bericht 5, puur vanwege wat ervoor kwam.
Verbind zonder nadenken drie of vier servers, en het is realistisch om meer dan de helft van je contextvenster op overhead te verbranden voordat het eigenlijke werk begint.
Waarom dit niet zomaar een kostprobleem is
Token-uitgaven zijn het bedrag dat op een rekening verschijnt, dus het is het gedeelte dat mensen eerst opmerken. Het is niet het meest schadelijke gedeelte.
De kwaliteit van de uitvoer verslechtert wanneer er te veel tool-definities om de aandacht van het model concurreren. Teams die zwaardere MCP-setups uitvoeren, hebben gerapporteerd dat het model midden in een taak irrelevante tools begint na te streven en vol zelfvertrouwen iets suggereert als het aanmaken van een GitHub-issue als oplossing voor een databasetime-out. Meer geladen tools betekenen niet meer mogelijkheid. Na een bepaald punt betekent het dat het model redeneert over een rommelig oppervlak in plaats van je werkelijk probleem.
Voor een founder of engineering lead stelt dit de vraag opnieuw in. Het is niet "kunnen we ons de extra tokens veroorloven?" Het is "maken we elke sessie stilletjes slechter door acht MCP-servers verbonden te houden die we twee keer per maand gebruiken?"
De fix die Anthropic al heeft verzonden, en de fixes die je nog steeds bezit
Het goede nieuws is dat het protocol zelf vooruit is gegaan. Anthropic heeft een tool-zoekfunctie verzonden die het laden van volledige schema's uitstelt totdat een tool werkelijk nodig is, in plaats van elke definitie vooraf te dumpen. Gerapporteerde vroege resultaten tonen dat de opstarttoken-kosten met ongeveer 83 procent dalen wanneer dit actief is, en één veel geciteerde productiemeting ging van ongeveer 51.000 tokens overhead tot 8.500 na inschakeling ervan, een verlaging van bijna 83 procent, zonder een enkele prompt te herschrijven.
Dat is de infrastructuurfix. Het is nog niet overal standaard ingeschakeld, en het vervangt goede gewoonten niet.
Vier dingen die deze week de moeite waard zijn
Voer /context uit. Zie precies waar je tokens naartoe gaan voordat je raadt. Dit kost dertig seconden en verrast meestal mensen.
Controleer je verbonden servers. De meeste developers hebben drie of vier MCP-servers geladen die ze eenmaal per week aanraken. Verbreek ze. Verbind opnieuw wanneer de taak ze werkelijk nodig heeft.
Maak tools op een allowlist; laad geen hele servers. Als je vijf bewerkingen uit vijftig op een server gebruikt, stel dan alleen de vijf beschikbaar. Dit alleen kan de overhead van een server met ongeveer 80 tot 90 procent verminderen.
Verwerk voor het in context komt. Een hook die een 10.000-regellogbestand doorzoekt naar het woord "error" en alleen overeenkomsten retourneert. Dit verandert tienduizenden tokens in enkele honderden. Claude heeft niet de hooiberg nodig, alleen de naald.
Veelgestelde vragen: MCP, Token-kosten en het bouwen van een team dat dit goed aanpakt
V. Kost het verbinden van een MCP-server tokens, zelfs als ik het die sessie nooit gebruik?
Ja, in een standaardconfiguratie. De tool-definities worden geladen bij het begin van de sessie, ongeacht of je de tool aanroept. Uitgesteld laden verandert dit, maar alleen waar dit actief is geconfigureerd.
V. Is een groter contextvenster de oplossing voor MCP-overhead?
Nee. Een groter venster geeft de overhead gewoon meer plaats om zich te verbergen. De overhead is nog steeds een echte kosten, en begrip bij grote contextgroottes verschilt aanzienlijk tussen modellen, dus een volgestopt venster presteert zelden net zo goed als een schoon.
V. Hoe weten we of een kandidaat dit werkelijk begrijpt, versus alleen weet hoe je een server verbindt?
Vraag hen om door een Claude Code-kostenaudit te lopen die ze werkelijk hebben uitgevoerd en wat ze hebben verbroken. Engineers die een opgeblazen contextvenster in productie hebben geraakt, spreken specifiek over wat ze hebben gesneden. Engineers die het niet hebben gedaan, spreken meestal over MCP in abstracto.
V. Waar vinden we engineers die al met deze discipline bouwen?
Dit is een van de praktische signalen waar we naar zoeken bij het controleren van developers voor MyNextDeveloper-clients, omdat kostenaware context-engineering veel meer zegt over hoe iemand werkelijk met AI-tools omgaat dan een resuméline over "AI-ervaring" ooit zal.
Belangrijkste inzichten
MCP-servers laden volledige tool-schema's in context, soms bij elke beurt, ongeacht of de tools worden gebruikt of niet.
De GitHub MCP-server alleen is gemeten tussen ongeveer 26.000 en 55.000 tokens overhead voordat je eerste prompt.
Overbelaste context kost niet alleen geld. Het verslechtert de kwaliteit van de uitvoer, soms zichtbaar.
Uitgesteld tool-laden, allowlisting en preprocessing-hooks zijn de praktische, beschikbare fixes vandaag.
Voer /context uit voordat je aanneemt dat je weet waar je tokens naartoe gaan. De meeste mensen weten het niet.
Waarom het belangrijk is
MCP-servers zijn werkelijk nuttig, en dit is geen argument tegen het verbinden ervan. Het is een argument tegen het verbinden en vergeten dat ze daar zijn. De overhead is meetbaar, de fixes zijn beschikbaar, en de teams die vooruitgaan zijn de teams die context als een budget behandelen in plaats van een nagedachte.
Dit soort discipline verschijnt niet op een resume, maar het verschijnt snel in hoe iemand werkelijk werkt. Het is precies het soort oordeel dat we controleren op MyNextDeveloper wanneer we founders afstemmen op engineers die al op deze manier bouwen, niet op engineers die het nog op jouw duur leren.
TL;DR
Elke MCP-server die met Claude Code is verbonden, laadt zijn volledige tool-schema in context, soms bij elke beurt, ongeacht of je het gebruikt of niet. De GitHub MCP-server alleen is gemeten tussen ongeveer 26.000 en 55.000 tokens overhead voordat je een enkel prompt hebt getypt. Dit is niet alleen een kostprobleem: opgeblazen context verslechtert ook de kwaliteit van de uitvoer, soms zoveel dat het model midden in een taak irrelevante tools achternagaat. De uitgestelde tool-loading-functie van Anthropic helpt, maar tools op allowlist zetten, ongebruikte servers verbreken en lawaaierige tool-output voorverwerken liggen nog steeds op jouw bord. Voer /context uit voordat je aanneemt dat je weet waar je tokens werkelijk naartoe gaan.
Op zoek naar het bouwen van een high-performing remote tech-team?
Bekijk MyNextDeveloper, een platform waar je de top 3% van softwareengineers kunt vinden die diep gepassioneerd zijn over innovatie. Onze on-demand, dedicated en grondige softwaretalent-oplossingen bieden een uitgebreide oplossing voor al je softwarevereisten.
Bezoek onze website om te ontdekken hoe we je kunnen helpen je perfecte team samen te stellen.




