Claude Sonnet 5 : la fin du tarif promotionnel le 31 août, ce qu’une hausse de 50 % change pour les agents IA de votre PME
La page tarifaire d’Anthropic le confirme : le tarif de lancement de Claude Sonnet 5 expire le 31 août 2026, et le tarif standard s’applique dès le 1ᵉʳ septembre — 50 % de plus par token, sur le modèle sur lequel tournent la plupart des agents IA en production. Ce qu’il faut vérifier avant que la facture ne change.
Quand Anthropic a lancé Claude Sonnet 5 fin juin 2026, le modèle est sorti à un tarif de lancement de 2 $ par million de tokens en entrée et 10 $ par million de tokens en sortie — explicitement présenté comme temporaire dès le premier jour. La documentation tarifaire officielle d’Anthropic confirme aujourd’hui l’échéance : ce tarif tient jusqu’au 31 août 2026, et le tarif standard de 3 $ par million de tokens en entrée et 15 $ par million de tokens en sortie s’applique à partir du 1ᵉʳ septembre — une hausse de 50 % sur l’entrée comme sur la sortie, dans trois semaines.
Pourquoi ce n’est pas un détail tarifaire mineur
Les modèles de la gamme Sonnet sont, selon les recommandations d’Anthropic elle-même, ceux préconisés pour « la plupart des charges de travail en production » — Haiku pour les tâches simples, Opus pour le raisonnement le plus exigeant, Sonnet pour tout le reste. Dans les faits, c’est cette gamme intermédiaire qui fait tourner la majorité des agents IA actuellement en production : un agent support client, un agent de rapprochement de factures, un agent de tri d’emails. Une hausse de 50 % sur le modèle de production par défaut n’est pas un arrondi sur la prochaine facture — c’est la deuxième ou troisième fois en 2026 que le prix sous-jacent d’un agent bouge de manière significative, après l’arrivée de Claude Opus 5 à un tarif inférieur à son prédécesseur en juillet. Les prix ne se stabilisent pas : ils bougent dans les deux sens plusieurs fois par an désormais, et un budget fixé au printemps est déjà dépassé.
Ce que ça change pour votre PME
L’impact réel dépend entièrement de vos propres volumes de tokens, pas du pourcentage affiché dans l’annonce — la même leçon vaut à chaque mouvement de prix d’un modèle. C’est précisément parce que ce calcul est difficile à faire correctement que des chercheurs s’y penchent désormais directement : une étude de janvier 2026 de Jonathan Knoop et Hendrik Holtmann, Private LLM Inference on Consumer Blackwell GPUs: A Practical Guide for Cost-Effective Local Deployment in SMEs, évalue si l’exécution de modèles ouverts sur du matériel grand public peut revenir moins cher que les API cloud pour les PME — la preuve que le coût d’inférence est devenu un poste à piloter activement, pas une ligne à simplement payer. Que l’hébergement local ait un sens pour votre cas ou non, la pression documentée par cette étude est la même que celle derrière cette hausse : le prix des tokens bouge, et une entreprise qui fait tourner des agents à l’échelle doit suivre ce mouvement plutôt que supposer que le chiffre budgété tient toujours.
Quels que soient les agents que fait tourner votre entreprise — agent de tri d’emails, agent commercial WhatsApp, agent de veille réglementaire, agent de relance d’impayés — chacun appelle un modèle à chaque exécution, et chaque appel est facturé au tarif en vigueur ce jour-là. Un agent qui coûtait peu cher en juillet n’a aucune garantie de coûter aussi peu en septembre, et la seule façon de le savoir est de vérifier ses propres chiffres, pas le pourcentage de l’annonce.
Quatre vérifications à faire avant le 1ᵉʳ septembre
- →Sortez votre volume réel de tokens mensuel par agent, entrée et sortie séparément, et multipliez-le par les nouveaux tarifs de septembre pour connaître l’impact réel en euros — pas le pourcentage affiché, votre propre facture.
- →Vérifiez si les tâches routinières et à faible enjeu (tri d’emails simple, réponses aux questions fréquentes) peuvent tourner sur un modèle moins cher, en réservant le modèle le plus onéreux aux tâches où la précision justifie réellement le coût.
- →Si le prompt caching n’est pas déjà activé sur vos agents, activez-le — les tokens mis en cache sont facturés à une fraction du tarif standard et peuvent absorber une partie de la hausse sur le contexte répété.
- →Inscrivez une vérification trimestrielle récurrente de la grille tarifaire de chaque modèle IA dont dépendent vos agents — 2026 a déjà montré que ces chiffres bougent plus d’une fois par an, dans les deux sens.
Rien de tout cela n’exige de changer de fournisseur ou de suspendre un projet. Cela exige de traiter le tarif d’un modèle comme n’importe quel autre coût fournisseur récurrent : révisé sur un calendrier, pas supposé fixe le jour de la souscription.
Ressource gratuite
La grille d’auto-diagnostic : 20 tâches automatisables par l’IA
Commercial, administratif, support, opérations : les 20 tâches que des agents IA prennent déjà en charge en PME — avec, pour chacune, le signal qui montre que vos équipes sont concernées.
À lire ensuite
Stratégie, coûts & ROI
IA et emploi : votre PME doit-elle revoir les salaires de ses juniors ?
19 août 2026·5 min de lecture
Stratégie, coûts & ROI
ChatGPT Business Premium à 125 $ : ce que la nouvelle offre d’OpenAI révèle sur le vrai coût de l’IA agentique en PME
12 août 2026·5 min de lecture
Stratégie, coûts & ROI
Au travail, l’IA fait déborder les métiers : une étude d’OpenAI chiffre à 43 % l’usage hors périmètre — ce que ça change pour votre PME
29 juillet 2026·5 min de lecture