Zpět na Blog
Blog

Jak MCP servery tiše vám ubírají token budget a jak to zastavit

Aug 7, 2026·7 min read·Jigar Mehta
#MCP#Claude Code#Token#Budget#Servers
Jak MCP servery tiše vám ubírají token budget a jak to zastavit

Připojte pět MCP serverů do Claude Code, nenapište nic, a už jste ztrávili 50 000 tokenů předtím, než model přečetl jediný řádek vašeho promptu. Žádná chyba. Žádné varování. Jen pomalejší, dražší, tiše hloupější relace, a většina týmů nikdy nevysvětlí proč.

Trávíme spoustu času s inženýry, kteří s Claude Code pracují denně, a to je problém s cenou, který všechny překvapí. Ne proto, že je nejasný. Protože je skrytý úmyslně. MCP servery dělají přesně to, co by měly. Nikdo vám neřekl, co to stojí.

Co se skutečně načítá do kontextu v MCP

Model Context Protocol (MCP) je otevřený standard od Anthropic pro připojení Claude k externím nástrojům: GitHub, Slack, databáze, interní API, cokoli co váš zásobník potřebuje. Každý server, který připojíte, registruje svoje nástroje, a každý nástroj přichází se jménem, popisem a schématem parametrů. To je část, kterou si nikdo nevčte podruhé předtím, než klikne na připojit.

Tady je část, která záleží: tyto definice se načítají do kontextu, a podle vaší konfigurace se to načítání může stát v každém tahu, ne jen jednou na začátku relace. Server se dvěma čistými nástroji stojí téměř nic. Server s devadesáti nástroji stojí opravdu peníze a pozornost, ať jste ho v té relaci použili, nebo ne.

Rozdíl mezi servery je obrovský. Minimální SQLite server běží pod 500 tokenů. Úplný GitHub MCP server naproti tomu byl nezávisle měřen na přibližně 26 000 až 55 000 tokenů samotných definic nástrojů, někde mezi 13 a 27 procenty kontextového okna s 200 000 tokeny, předtím, než jste mu něco řekli.

Dvě různé účty, které platíte

Pomáhá rozdělit to na dvě náklady, protože opravy se liší pro každou.

  • Pevné náklady: samotné definice nástrojů. Každý připojený server vloží jména, popisy a schémata na začátek relace. To je část, která lidi překvapí, protože se za to platí, ať se nástroje použijí, nebo ne.

  • Variabilní náklady: výsledky. Každé volání nástroje vrací svůj plný výstup do kontextu, ne shrnutí. Dotaz na databázi s 10 000 řádky, rozsáhlý soubor protokolu, nafouklá JSON odpověď — všechno to zůstane v okně pro zbytek relace, a Claude si přečte celou konverzaci v každé následné zprávě. Zpráva 50 stojí více než zpráva 5, čistě kvůli tomu, co jí předcházelo.

Připojte tři nebo čtyři servery bez přemýšlení o kterékoliv náklady, a je realistické spálit více než polovinu vašeho kontextového okna na režii předtím, než skutečná práce začne.

Proč to není jen problém s cenou

Výdaje tokenů jsou částka, která se objeví na účtu, takže je to část, kterou lidé všimnou jako první. Není to nejškodlivější část.

Kvalita výstupu se zhoršuje, když si příliš mnoho definic nástrojů konkuruje o pozornost modelu. Týmy s těžšími MCP nastavením hlásily, že model začíná sledovat irelevantní nástroje v polovině úkolu, sebevědomě navrhuje něco jako vytvoření GitHub problému jako řešení databázového timeoutu. Více nástrojů načteno neznamená více schopnosti. Po určitém bodě to znamená, že model důvody přes znesnadněný povrch místo vašeho skutečného problému.

Pro zakladatele nebo vedoucího inženýrství to přeformuluje otázku. Není to "můžeme si dovolit extra tokeny?" Ale "Tiše zhoršujeme každou relaci tím, že máme osm MCP serverů připojených, které používáme dvakrát měsíčně?"

Oprava, kterou Anthropic už poslal, a ty, které vlastníte

Dobrou zprávou je, že se samotný protokol posunul. Anthropic poslal schopnost hledání nástrojů, která odloží načítání úplných schémat, dokud se nástroj skutečně nepoužije, místo aby vypnul každou definici dopředu. Hlášené časné výsledky ukazují, že náklady na spuštění tokenů se snižují přibližně o 83 procent, když je to aktivní, a jedno často citované měření v produkci šlo z přibližně 51 000 tokenů režie dolů na 8 500 po aktivaci, snížení blízké 83 procent, bez přepsání jediného promptu.

To je infrastrukturní oprava. Není univerzálně zapnutá všude jako výchozí, a nenahrazuje dobré zvyky.

Čtyři věci, které stojí za to dělat tento týden

  1. Spusťte /context. Uvidíte přesně, kam jdou vaše tokeny předtím, než hádáte. Toto trvá třicet sekund a obvykle lidi překvapí.

  2. Auditujte své připojené servery. Většina vývojářů má tři nebo čtyři MCP servery načtené, které se dotýkají jednou za týden. Odpojte je. Znovu připojte, když to úkol skutečně potřebuje.

  3. Povolte seznam nástrojů; nenačítejte celé servery. Pokud používáte pět operací z padesáti na serveru, zveřejněte jen pět. To samo o sobě může snížit režii serveru přibližně o 80 až 90 procent.

  4. Předzpracujte, než se to dostane do kontextu. Hák, který grepu 10 000-řádkový protokol pro slovo "chyba" a vrátí jen zápasy. To změní desítky tisíc tokenů na pár set. Claude nepotřebuje seník, jen jehlu.

FAQ: MCP, náklady tokenů a budování týmu, který tomu rozumí správně

Otázka: Stojí připojení MCP serveru tokeny, i když ho v té relaci nikdy nepoužiji?

Ano, ve výchozí konfiguraci. Definice nástrojů se načítají na začátku relace bez ohledu na to, zda nástroj zavoláte. Odložené načítání to mění, ale jen tam, kde je aktivně nakonfigurováno.

Otázka: Je větší kontextové okno opravou MCP režie?

Ne. Větší okno jen dává režii více místa k ukrytí. Režie je stále skutečná cena, a porozumění při velkých velikostech kontextu se mezi modely výrazně liší, takže naplněné okno se zřídka chová tak dobře jako štíhle.

Otázka: Jak poznáme, zda kandidát tomu skutečně rozumí, versus jen ví, jak připojit server?

Požádejte je, aby vám prošli auditovat náklady Claude Code, který skutečně provedli, a co odpojili v důsledku. Inženýři, kteří v produkci narazili na nafouklý kontextové okno, konkrétně mluví o tom, co odstranili. Inženýři, kteří ne, mají tendenci mluvit o MCP abstraktně.

Otázka: Kde najdeme inženýry, kteří už stavějí s touto disciplínou?

To je jeden z praktických signálů, které hledáme při prověřování vývojářů pro klienty MyNextDeveloper, protože inženýrství kontextu vědomé nákladů říká více o tom, jak někdo skutečně pracuje s AI nástroji denně, než řádek na životopisu o "zkušenosti s AI" kdykoliv bude.

Hlavní poznatky

  • MCP servery načítají úplná schémata nástrojů do kontextu, někdy v každém tahu, ať se nástroje používají, nebo ne.

  • Samotný GitHub MCP server byl měřen mezi přibližně 26 000 a 55 000 tokenů režie před vaším prvním promptem.

  • Přetížený kontext nestojí jen peníze. Snižuje kvalitu výstupu, někdy viditelně.

  • Odložené načítání nástrojů, povolení seznamu a háky na předzpracování jsou praktické, dostupné opravy dnes.

  • Spusťte /context předtím, než předpokládáte, že víte, kde jdou vaše tokeny. Většina lidí ne.

Proč na tom záleží

MCP servery jsou skutečně užitečné, a nic z toho není argument proti jejich připojení. Je to argument proti jejich připojení a zapomenutí, že tam jsou. Režie je měřitelná, opravy jsou dostupné, a týmy, které se dostávají dopředu, jsou ty, které se chováním k kontextu jako k rozpočtu místo k vedlejší myšlence. Takový typ disciplíny se neobjevuje na životopisu, ale objevuje se rychle v tom, jak někdo skutečně pracuje. Je to přesně ten typ úsudku, na který se podíváme v MyNextDeveloper, když spojujeme zakladatele s inženýry, kteří už tímto způsobem stavějí, ne s těmi, kteří se to ještě učí na vaše náklady.

TL;DR

Každý MCP server připojený k Claude Code načítá své úplné schéma nástroje do kontextu, někdy v každém tahu, ať ho používáte, nebo ne. Samotný GitHub MCP server byl měřen mezi přibližně 26 000 a 55 000 tokenů režie předtím, než jste napsal jediný prompt. Toto není jen problém s cenou: přetížený kontext také snižuje kvalitu výstupu, někdy způsobuje, že model sleduje irelevantní nástroje v polovině úkolu. Odložené načítání nástrojů od Anthropic pomáhá, ale povolení seznamu nástrojů, odpojení nepoužívaných serverů a předzpracování hlučného výstupu nástrojů jsou stále na vás. Spusťte /context předtím, než předpokládáte, že víte, kam vaše tokeny skutečně jdou.

Hledáte si vysokovýkonný vzdálený tech tým?

Podívejte se na MyNextDeveloper, platformu, kde najdete top 3 % softwarových inženýrů, kteří jsou hluboce vášnivě zanícení inovacemi. Naše na vyžádání, vyhrazená a důkladná řešení softwarového talentu poskytují komplexní řešení pro všechny vaše softwarové potřeby.

Navštivte naše webové stránky a zjistěte, jak vám můžeme pomoci při sestavování vašeho dokonalého týmu.