
10 leviers pour diviser ta facture de tokens par 5 (Copilot, Claude Code, Cursor)
Opus à 25 $/M tokens, Haiku à 5 $. 10 leviers concrets pour réduire ta consommation de 60 à 90 % sur tous les agents IA.

Cliquer pour agrandir
/compact. Grâce à ce que j'avais configuré avant même d'écrire mon premier prompt./cost qui affiche la consommation en temps réel de la session en cours :Total cost: $0.87 Total duration (API): 8m 42.3s
node_modules/ pour comprendre une lib. Lire package-lock.json (300 000 lignes) pour vérifier une version. Explorer .next/ parce qu'il cherche un fichier de config. Scanner dist/ pour comprendre la sortie du build.CLAUDE.md est un fichier Markdown placé à la racine du projet que Claude Code charge automatiquement au démarrage de chaque session. Il joue le rôle de mémoire persistante : conventions de code, architecture, commandes, fichiers à ignorer.CLAUDE.md à la racine du projet, c'est le truc le plus sous-estimé de Claude Code. Il est chargé automatiquement à chaque session. Le mien fait une centaine de lignes et contient tout ce que Claude a besoin de savoir sur le projet : la stack, les conventions de code, les commandes Docker, l'architecture des dossiers.## Conventions de code - Backend : snake_case fichiers, camelCase variables, PascalCase classes - Frontend : PascalCase composants, camelCase fonctions - Indentation : 4 espaces (2 pour JSON) - Commits : feat:, fix:, refactor:, test:, docs:
.claude/rules/, tu peux poser des fichiers Markdown chargés automatiquement dans toute session et tout agent. Contrairement au CLAUDE.md qui décrit le projet, ces fichiers imposent des comportements — des règles que Claude doit respecter en permanence, quoi qu'il arrive..claude/rules/, tu peux poser des fichiers Markdown qui sont chargés automatiquement dans toute session et tout agent. Mon token-economy.md contient les règles d'économie de tokens que Claude doit respecter en permanence :# Économie de tokens — règles obligatoires ## Exploration de fichiers - Grep/Glob avant Read : toujours cibler avant d'ouvrir un fichier. - Ne jamais lire : node_modules/, .next/, dist/, *.lock, DerivedData/ - Stopper l'exploration dès qu'on a trouvé ce qu'on cherche. ## Contexte et réponses - Réponses courtes. Pas de récapitulatif de ce qui vient d'être fait. - Ne pas relire un fichier déjà lu dans la même session. - Pas de prose introductive ("Je vais maintenant...", "Bien sûr !").
Grep ciblé, trouve le fichier en une requête, et lit uniquement celui-là. La règle "pas de récapitulatif" coupe aussi pas mal : par défaut, Claude adore résumer tout ce qu'il vient de faire avant de passer à la suite. C'est rassurant, mais ça coûte des tokens pour rien.PreToolUse est un script (bash ou JSON) que Claude Code exécute automatiquement avant chaque appel d'outil. Il peut bloquer l'action, la modifier ou la laisser passer — sans que tu aies besoin d'intervenir.PreToolUse qui bloque toute lecture dans les dossiers de build :{ "hooks": { "PreToolUse": [ { "matcher": "Read", "hooks": [ { "type": "command", "if": "Read(node_modules/*)", "command": "echo 'Lecture node_modules bloquée' >&2 && exit 2" } ] } ] } }
node_modules/ ? Bloqué. Il ne perd pas 2000 tokens à lire le code source de React pour comprendre un type. Il utilise la doc officielle ou le type exporté, point.@fichier injecte le contenu d'un fichier directement dans le contexte du prompt, sans que Claude ait besoin de l'explorer ou de le chercher.@fichier pour injecter un fichier dans le contexte du prompt. C'est le raccourci ultime : au lieu de laisser Claude explorer pour trouver le bon fichier, tu le lui donnes.@src/components/Landing/Hero.tsx refactore le useEffect pour éviter le re-render
.claude/agents/, chaque fichier de définition d'agent expose un champ permission qui liste les outils auxquels il a accès : read, write, bash, grep, glob, task...write. Un agent de rédaction n'a pas besoin de bash. La règle : donner à chaque agent le minimum viable pour sa tâche.# .claude/agents/recherche.md permission: read: allow grep: allow glob: allow # write: non. bash: non. task: non.
.claude/skills/, ce contexte n'est injecté que quand l'agent en a explicitement besoin. Sur un workflow de 10 appels agentiques, la différence est significative : tu ne paies le contexte que quand il sert.blog-writer.md contient 200 lignes de guidelines de rédaction. Sans Skills, ces 200 lignes sont dans le contexte de chaque appel. Avec, elles ne sont chargées que quand un agent rédige un article — pas quand il fait une recherche Tavily ou une analyse de code..claude/commands/ c'est un prompt ultra structuré avec les contraintes déjà posées, les fichiers déjà référencés, le périmètre déjà défini. Versus un prompt vague tapé à la main qui va déclencher 2-3 tours d'exploration avant que l'agent comprenne ce qu'on veut.# .claude/commands/article-blog.md Rédige un article en suivant le skill blog-writer. Lis uniquement : Blog-livate/content/Livate/Article de blog/fr/[dernier article].mdx Ne pas explorer le reste du dossier.
/article-blog et "écris-moi un article de blog" : le premier démarre avec le bon contexte et les bonnes contraintes. Le second explore, pose des questions, lit des fichiers pour comprendre le format. Quelques milliers de tokens d'écart, multiplié par chaque invocation.model dans chaque agent. Haiku coûte 25 fois moins cher qu'Opus à résultat équivalent sur des tâches de scan, grep, résumé ou classification. Réserver Sonnet et Opus aux agents qui font vraiment de la génération complexe ou de l'analyse architecturale.# Agent de recherche Tavily → Haiku suffit largement model: claude-haiku # Agent d'implémentation technique → Sonnet ou Opus model: claude-sonnet
token-economy.md, les hooks de base, des exemples de prompts ciblés. L'idée c'est un repo GitHub public que tu peux cloner et adapter à ton projet en 10 minutes./compact est réactif : il résume le contexte une fois que la fenêtre est pleine. Les règles proactives (CLAUDE.md, hooks, fichiers de règles) empêchent le contexte de grossir en premier lieu. L'un répare, l'autre prévient.PreToolUse en bash qui filtre un chemin s'exécute en quelques millisecondes. Le gain en tokens économisés est sans commune mesure avec la latence ajoutée./compact toutes les 30 minutes. C'est ce que je faisais. Et c'est ce que font la plupart des devs qui se plaignent de leur facture Claude Code. Mais /compact, c'est le Doliprane du contexte. Ça soulage, ça traite pas la cause.
Opus à 25 $/M tokens, Haiku à 5 $. 10 leviers concrets pour réduire ta consommation de 60 à 90 % sur tous les agents IA.

Forbes pose le mot dessus aujourd'hui. 92 % des devs utilisent l'IA au quotidien, 46 % du nouveau code est généré par IA — et 97 % des apps vibe-codées ne passent jamais en prod.
Boucle agentic, sous-agents hiérarchiques, protocole MCP : plongée technique dans l'architecture des agents de code et retour d'expérience après 8 mois de dev solo avec Claude Code.
Tu as un avis sur cet article ?
Crée un compte gratuit en 10 secondes pour commenter, laisser des likes et recevoir les prochains articles directement dans ta boîte mail.
Pas encore de compte ?