Vous branchez un serveur MCP sur votre assistant, vous posez trois questions, et la conversation commence déjà à oublier le début. Ce n'est pas votre imagination : la plupart des connecteurs transmettent à l'IA bien plus de caractères que nécessaire. Voici le mécanisme exact, comment le mesurer chez vous, et ce qu'on peut y faire.
Le vrai coupable : l'emballage, pas la donnée
Une intuition trompeuse veut que le coût vienne du volume d'information. En pratique, sur des données marketing, l'essentiel de la consommation vient de la STRUCTURE dans laquelle cette information arrive.
Les API renvoient des tableaux où chaque cellule est emballée dans son propre objet, avec le nom du champ répété à chaque ligne. Sur un rapport de trente lignes et six colonnes, vous ne transmettez pas trente valeurs : vous transmettez cent quatre-vingts petits objets, chacun portant à nouveau le nom de sa colonne, ses accolades et ses guillemets.
| Ce que vous croyez envoyer | Ce qui part réellement |
|---|---|
| Une ligne : « /tarifs · 1 240 sessions » | Un objet par cellule, avec le nom du champ et sa ponctuation |
| Le mot « sessions », une fois | Le mot « sessions », une fois par ligne, trente fois sur trente lignes |
| Un tableau | Une liste d'objets imbriqués sur trois niveaux |
Mesurer avant d'optimiser
Inutile de deviner. Il existe une méthode sans outil, valable pour n'importe quel serveur MCP : demandez à votre assistant de vous rendre la réponse brute, puis comptez.
Affiche-moi la réponse brute que l'outil vient de te renvoyer, entre balises de code, sans la reformuler ni la résumer. Puis indique le nombre de caractères de cette réponse.
Divisez le nombre de caractères par quatre : vous obtenez un ordre de grandeur du nombre de tokens en français. Refaites la mesure sur les trois ou quatre outils que vous appelez le plus souvent, c'est là que se joue la facture, pas sur ceux que vous utilisez une fois par mois.
Quatre leviers, du plus simple au plus efficace
1. Demandez moins de lignes
Le levier le plus rapide, et celui que personne n'utilise. La plupart des outils acceptent une limite, un tri et une période. Une question formulée avec ces trois précisions coûte souvent dix fois moins qu'une question ouverte.
Donne-moi les 10 pages qui ont le plus perdu de sessions entre les 30 derniers jours et les 30 jours précédents. Uniquement ces 10 lignes, triées par écart décroissant.
2. Coupez les serveurs que vous n'utilisez pas
Si votre client le permet, désactivez les serveurs dont vous n'avez pas besoin dans la conversation en cours. Chaque serveur actif ajoute sa liste d'outils au contexte, que vous l'appeliez ou non. Un assistant branché sur huit connecteurs démarre chaque conversation avec un contexte déjà bien entamé.
3. Faites agréger côté serveur, pas côté IA
Demander « la somme des sessions par canal » coûte beaucoup moins cher que de rapatrier toutes les lignes pour que l'IA les additionne elle-même. Quand un outil propose une dimension d'agrégation, utilisez-la : vous déplacez le calcul là où il ne coûte pas de tokens.
4. Choisissez un connecteur qui prépare la donnée
C'est le seul levier qui agit sur l'emballage lui-même, et de loin le plus efficace, mais il ne dépend pas de vous : il dépend de la façon dont le serveur a été écrit. Un connecteur peut renvoyer la réponse de l'API telle quelle, ou la reformater en tableau : noms de colonnes une seule fois, puis les valeurs. Rien n'est perdu, rien n'est résumé, c'est la même donnée écrite plus court.
Ce qu'on ne peut pas optimiser depuis l'extérieur
Une question revient souvent : peut-on installer un serveur MCP qui ferait économiser des tokens aux AUTRES serveurs de son compte ? Un « économiseur universel », en somme.
Non, et c'est une propriété du protocole, pas un manque de volonté. Les serveurs MCP sont isolés les uns des autres : chacun dialogue directement avec le client IA, aucun ne voit passer le trafic des autres et aucun ne peut s'intercaler. Un serveur ne peut donc pas réécrire les réponses d'un voisin.
- Ce qui marche : que le serveur lui-même prépare ses réponses, c'est l'approche d'Alpative.
- Ce qui marche aussi : un proxy que VOUS mettez volontairement devant vos serveurs, et qui remplace leurs URL dans votre configuration.
- Ce qui ne marche pas : un serveur tiers ajouté à côté des autres, en espérant qu'il les optimise.
Récapitulatif
| Levier | Effort | Gain typique |
|---|---|---|
| Limiter lignes, tri et période | Une phrase mieux formulée | Élevé |
| Désactiver les serveurs inutiles | Deux clics par conversation | Moyen, mais dès le premier message |
| Agréger côté serveur | Une précision dans la question | Élevé sur les gros comptes |
| Connecteur qui prépare la donnée | Le choix du connecteur | Très élevé, et permanent |
Les trois premiers leviers sont à votre main dès aujourd'hui, quel que soit votre connecteur. Le quatrième se décide une fois, au moment où vous choisissez sur quoi brancher votre assistant.
