Torna al Blog
Blog

Come i server MCP consumano silenziosamente il tuo budget di token Claude e come fermarli

Aug 7, 2026·7 min read·Jigar Mehta
#MCP#Claude Code#Token#Budget#Servers
Come i server MCP consumano silenziosamente il tuo budget di token Claude e come fermarli

Connetti cinque server MCP a Claude Code, non digita nulla, e avrai già consumato 50.000 token prima che il modello abbia letto una sola riga del tuo prompt. Nessun errore. Nessun avviso. Solo una sessione più lenta, più costosa e tranquillamente più debole, e la maggior parte dei team non scopre mai il motivo.

Passiamo molto tempo con ingegneri che costruiscono con Claude Code quotidianamente, e questo è il problema di costo che sorprende quasi tutti. Non perché sia oscuro. Perché è invisibile per design. I server MCP fanno esattamente quello che dovrebbero fare. Nessuno ti ha detto quanto costa.

Cosa MCP carica effettivamente nel contesto

Model Context Protocol (MCP) è lo standard aperto di Anthropic per connettere Claude a strumenti esterni: GitHub, Slack, database, API interne, quello che il tuo stack ha bisogno. Ogni server che connetti registra i suoi strumenti, e ogni strumento ha un nome, una descrizione e uno schema dei parametri. È la parte che nessuno legge due volte prima di cliccare su connetti.

Ecco la parte che conta: quelle definizioni vengono caricate nel contesto, e a seconda della tua configurazione, quel caricamento può avvenire ad ogni singolo turno, non una sola volta all'inizio della sessione. Un server con due strumenti puliti costa quasi nulla. Un server con novanta costa soldi veri e attenzione vera, che lo usi in quella sessione o no.

La differenza tra i server è enorme. Un server SQLite minimalista può funzionare con meno di 500 token. Il server MCP GitHub completo, al contrario, è stato misurato indipendentemente a circa 26.000-55.000 token di sole definizioni di strumenti, tra il 13 e il 27 percento di una finestra di contesto di 200.000 token, prima ancora di chiedergli di fare qualcosa.

I due conti diversi che stai pagando

Aiuta a dividere questo in due costi perché le soluzioni sono diverse per ognuno.

  • Costo fisso: le definizioni degli strumenti stessi. Ogni server connesso inietta nomi, descrizioni e schemi all'inizio della sessione. Questa è la parte che sorprende le persone, perché viene pagata indipendentemente dal fatto che gli strumenti vengano mai utilizzati.

  • Costo variabile: i risultati. Ogni chiamata di strumento restituisce il suo output completo nel contesto, non un riassunto. Una query di database con 10.000 righe, un file di log complesso, una risposta JSON gonfia — tutto rimane nella finestra per il resto della sessione, e Claude rilegge l'intera conversazione ad ogni messaggio successivo. Il messaggio 50 costa più del messaggio 5, puramente a causa di quello che è venuto prima.

Connetti tre o quattro server senza pensare a nessuno dei due costi, e è realistico bruciare ben oltre la metà della tua finestra di contesto su overhead prima che il lavoro vero cominci.

Perché questo non è solo un problema di costo

La spesa di token è l'importo che appare su una fattura, quindi è la parte che la gente nota per prima. Non è la parte più dannosa.

La qualità dell'output degrada quando troppe definizioni di strumenti competono per l'attenzione del modello. I team che utilizzano configurazioni MCP più pesanti hanno riferito che il modello inizia a inseguire strumenti irrilevanti a metà compito, suggerendo con sicurezza qualcosa come la creazione di un'issue su GitHub come soluzione a un timeout di database. Più strumenti caricati non significano più capacità. Oltre un certo punto, significa che il modello sta ragionando su una superficie disordinata invece del tuo problema effettivo.

Per un fondatore o un leader di ingegneria, questo ricondiziona la domanda. Non è "possiamo permetterci i token extra?" È "Stiamo tranquillamente peggiorando ogni sessione lasciando otto server MCP connessi che usiamo due volte al mese?"

La correzione che Anthropic ha già spedito e quelle di cui sei ancora responsabile

La buona notizia è che il protocollo stesso è avanzato. Anthropic ha spedito una capacità di ricerca degli strumenti che differisce il caricamento degli schemi completi fino a quando uno strumento non è effettivamente necessario, piuttosto che scaricare ogni definizione in anticipo. I risultati iniziali riportati mostrano il costo del token di avvio che si riduce di circa l'83 percento quando questo è attivo, e una misurazione di produzione ampiamente citata è andata da circa 51.000 token di overhead a 8.500 dopo averlo abilitato, una riduzione di quasi l'83 percento, senza riscrivere un singolo prompt.

Questa è la correzione dell'infrastruttura. Non è universalmente attiva per impostazione predefinita ovunque ancora, e non sostituisce le buone abitudini.

Quattro cose che vale la pena fare questa settimana

  1. Esegui /context. Vedi esattamente dove stanno andando i tuoi token prima di indovinare. Questo richiede trenta secondi e di solito sorprende le persone.

  2. Controlla i server connessi. La maggior parte degli sviluppatori ha tre o quattro server MCP caricati che toccano una volta a settimana. Disconnettili. Riconnettiti quando il compito effettivamente li ha bisogno.

  3. Consenti-elenca gli strumenti; non caricare interi server. Se usi cinque operazioni su cinquanta su un server, esponi solo le cinque. Questo da solo può tagliare l'overhead di un server di circa l'80-90 percento.

  4. Preelabora prima che entri nel contesto. Un hook che grep un log di 10.000 righe per la parola "errore" e restituisce solo le corrispondenze. Questo trasforma decine di migliaia di token in poche centinaia. Claude non ha bisogno del mucchio di fieno, solo dell'ago.

FAQ: MCP, costi dei token e costruire un team che lo capisce

D. Connettere un server MCP costa token anche se non lo uso in quella sessione?

Sì, in una configurazione predefinita. Le definizioni degli strumenti si caricano all'inizio della sessione indipendentemente dal fatto che chiami lo strumento. Il caricamento differito cambia questo, ma solo dove è attivamente configurato.

D. Una finestra di contesto più grande è la soluzione per l'overhead MCP?

No. Una finestra più grande dà all'overhead più spazio per nascondersi. L'overhead è ancora un costo reale, e la comprensione a dimensioni di contesto grandi varia significativamente tra i modelli, quindi una finestra piena difficilmente funziona meglio di una snella.

D. Come sappiamo se un candidato effettivamente comprende questo, rispetto a solo sapere come connettere un server?

Chiedigli di camminare attraverso un audit di costo Claude Code che ha effettivamente eseguito e cosa hanno disconnesso di conseguenza. Gli ingegneri che hanno colpito una finestra di contesto gonfia in produzione parlano specificamente di quello che hanno tagliato. Gli ingegneri che non l'hanno fatto tendono a parlare di MCP in astratto.

D. Dove troviamo ingegneri che già costruiscono con questa disciplina?

Questo è uno dei segnali pratici che cerchiamo quando esaminiamo gli sviluppatori per i clienti di MyNextDeveloper, perché l'ingegneria del contesto consapevole dei costi dice di più su come qualcuno effettivamente funziona con gli strumenti di AI giorno per giorno di quanto una linea di curriculum su "esperienza di AI" farà mai.

Punti chiave

  • I server MCP caricano gli schemi completi degli strumenti nel contesto, a volte ad ogni turno, indipendentemente dal fatto che gli strumenti vengano utilizzati o meno.

  • Il server MCP GitHub da solo è stato misurato tra circa 26.000 e 55.000 token di overhead prima del tuo primo prompt.

  • Un contesto sovraccarico non costa solo soldi. Degrada la qualità dell'output, a volte visibilmente.

  • Il caricamento differito degli strumenti, l'allow-listing e gli hook di preelaborazione sono le correzioni pratiche e disponibili oggi.

  • Esegui /context prima di assumere che sai dove stanno andando i tuoi token. La maggior parte delle persone non lo sa.

Perché conta

I server MCP sono genuinamente utili, e niente di questo è un argomento contro il connetterli. È un argomento contro il connetterli e dimenticare che sono lì. L'overhead è misurabile, le correzioni sono disponibili, e i team che stanno andando avanti sono quelli che trattano il contesto come un budget invece che come un ripensamento.

Quel tipo di disciplina non si mostra su un curriculum, ma si mostra velocemente in come qualcuno effettivamente funziona. È esattamente il tipo di giudizio che esaminiamo a MyNextDeveloper quando accoppiamo fondatori con ingegneri che già costruiscono in questo modo, non quelli che ancora lo stanno imparando a tue spese.

TL;DR

Ogni server MCP connesso a Claude Code carica il suo schema completo degli strumenti nel contesto, a volte ad ogni turno, indipendentemente dal fatto che lo usi o meno. Il server MCP GitHub da solo è stato misurato tra circa 26.000 e 55.000 token di overhead prima che tu abbia digitato un singolo prompt. Questo non è solo un problema di costo: un contesto sovraccarico degrada anche la qualità dell'output, a volte causando al modello di inseguire strumenti irrilevanti a metà compito. La funzione di caricamento differito degli strumenti di Anthropic aiuta, ma l'allow-listing degli strumenti, la disconnessione dei server inutilizzati e la preelaborazione dell'output degli strumenti rumorosi sono ancora responsabilità tua. Esegui /context prima di assumere che sai dove stanno effettivamente andando i tuoi token.

Stai cercando di costruire un team di tecnologia ad alte prestazioni in remoto?

Controlla MyNextDeveloper, una piattaforma dove puoi trovare il 3% più importante di ingegneri del software che sono profondamente appassionati di innovazione. Le nostre soluzioni di talento software su richiesta, dedicate e approfondite forniscono una soluzione completa per tutti i tuoi requisiti software.

Visita il nostro sito web per esplorare come possiamo aiutarti ad assemblare il tuo team perfetto.