Le prix du token ne bouge pas
Anthropic a lancé Claude Sonnet 5.5 le 28 septembre 2026. Le modèle est disponible dans Claude ainsi que via la Claude Platform, Amazon Web Services, Google Cloud et Microsoft Foundry. Son identifiant API est claude-sonnet-5-5.
La tarification standard reste exactement celle de Sonnet 5 : 2 dollars par million de tokens en entrée et 10 dollars par million en sortie. Les lectures depuis le cache coûtent 0,20 dollar par million de tokens. Les écritures de cache de cinq minutes sont facturées 2,50 dollars et celles d'une heure 4 dollars par million.
Le Batch API applique une réduction de 50 % aux tokens d'entrée et de sortie. La fenêtre de contexte atteint jusqu'à un million de tokens et la sortie maximale standard est de 128 000 tokens, avec jusqu'à 300 000 tokens dans le Batch API en bêta.
Les 30 % d'économie sont une promesse par tâche
La nuance est importante pour un budget API. Anthropic ne dit pas que chaque million de tokens coûte 30 % moins cher. La société affirme que Sonnet 5.5 utilise généralement moins de tokens pour effectuer le même travail et annonce jusqu'à 30 % de réduction du coût total d'une tâche par rapport à Sonnet 5.
Même distinction pour la vitesse : Anthropic annonce une génération de sortie plus de 30 % rapide que Sonnet 5. Le chiffre décrit les mesures du constructeur et ne garantit pas qu'une application complète terminera chaque opération 30 % plus vite. Latence réseau, outils externes, recherche, longueur du raisonnement et réglage d'effort restent dans le chemin.
Plusieurs premiers utilisateurs cités par Anthropic rapportent toutefois le même type d'amélioration. Slack indique environ 14 % de tokens de sortie en moins dans ses évaluations hors ligne. Lovable rapporte environ un tiers d'appels d'outils en moins et moitié moins d'exécutions shell. Box dit avoir mesuré 2,4 fois plus de vitesse et 12 % de tokens totaux en moins sur ses propres charges.
Sonnet se rapproche fortement d'Opus dans les tests publiés
Anthropic publie 70,6 % pour Sonnet 5.5 sur Terminal-Bench 4.0, une évaluation de programmation agentique. Sonnet 5 était crédité de 10,3 % dans la même présentation. Opus 5.5 atteint 66,4 % dans la configuration Xhigh retenue pour son meilleur résultat.
Sur CursorBench 4.0, Sonnet 5.5 atteint 55,5 %, contre 34,1 % pour Sonnet 5 et 57,8 % pour Opus 5.5. Sur GDPval-AA v2.1, consacré à des tâches professionnelles, les scores Elo publiés sont de 1 844 pour Sonnet 5.5 et 1 846 pour Opus 5.5.
Ces écarts ne suffisent pas à conclure que Sonnet remplace Opus. Anthropic elle-même décrit Opus 5.5 comme supérieur sur les problèmes complexes, ouverts et nécessitant un jugement soutenu. Les benchmarks de lancement mesurent des scénarios précis et une grande partie des chiffres est sélectionnée ou publiée dans le matériel d'Anthropic.
Un benchmark montre même que davantage d'effort peut faire moins bien
FrontierCode 1.1 fournit un contre-exemple utile à l'idée selon laquelle davantage de calcul améliore mécaniquement le résultat. Sonnet 5.5 obtient 46,2 % au niveau Max mais 52,1 % au niveau Xhigh dans les chiffres publiés par Anthropic.
Anthropic explique cette inversion par le comportement du modèle à Max. Sonnet 5.5 lançait plus souvent la fonction de revue de code de Claude Code, qui répartit le travail entre plusieurs sous-agents. Dans deux cas examinés par Cognition, cette stratégie a provoqué un dépassement de temps ou des modifications dépassant le périmètre demandé, ce que FrontierCode pénalise.
C'est une limite assez concrète pour un modèle agentique. Augmenter l'effort peut déclencher davantage d'actions, et davantage d'actions signifie aussi davantage d'occasions de faire quelque chose que la tâche ne demandait pas.
Le niveau d'effort devient un paramètre économique
Anthropic permet d'ajuster l'effort afin d'échanger vitesse et coût contre davantage de raisonnement. Dans Claude Code et les applications Claude, le réglage par défaut est Medium. Sur la Claude Platform, le défaut est High.
Un développeur ne peut donc pas extrapoler le coût d'une application à partir du seul tarif de 2 et 10 dollars. Deux appels utilisant le même modèle et le même prix unitaire peuvent produire des factures très différentes si l'un raisonne plus longtemps, utilise davantage d'outils ou génère beaucoup plus de tokens.
C'est précisément pourquoi la promesse de 30 % doit être testée sur la charge réelle. Pour un agent qui économise plusieurs recherches, appels shell ou boucles de correction, le gain peut devenir important. Pour une requête simple où Sonnet 5 utilisait déjà peu de tokens, il reste beaucoup moins de dépenses à éliminer.
Les entreprises fournissent des chiffres impressionnants, mais privés
Balyasny Asset Management indique avoir évalué Sonnet 5.5 sur 2 441 tâches financières privées couvrant questions-réponses, extraction, analyse et prévisions. Selon son témoignage publié par Anthropic, Sonnet 5.5 utilisait environ 121 000 tokens par réponse là où Sonnet 5 en utilisait 497 000.
Base44 rapporte de son côté 3,6 itérations en moyenne pour produire une application sur 118 constructions réelles, contre 7,7 avec Opus 5. Unity affirme que Sonnet 5.5 a terminé 90 % des tâches de son benchmark interne combinant Unity Editor et programmation.
Ces données sont intéressantes parce qu'elles portent sur des workflows plus proches d'un produit que certains benchmarks académiques. Elles restent néanmoins des évaluations privées décrites par les entreprises concernées et relayées dans le matériel de lancement d'Anthropic. Les jeux de données complets et les protocoles ne sont pas tous publics.
Un million de tokens de contexte, mais pas un million de certitudes
Sonnet 5.5 accepte texte et images en entrée et produit du texte. Anthropic indique une fenêtre de contexte pouvant atteindre un million de tokens et une date de coupure fiable des connaissances fixée à juin 2026.
La taille de contexte n'est pas une mesure de précision. Donner davantage de documents au modèle permet de traiter des dossiers beaucoup plus volumineux, mais ne garantit ni que chaque détail sera utilisé correctement ni qu'une réponse sera exempte d'erreurs.
Pour les workflows documentaires, la progression la plus intéressante pourrait donc être moins spectaculaire : moins d'étapes et moins de tokens pour obtenir un résultat comparable. Sur des volumes importants, quelques appels d'outils évités se répètent des milliers de fois.
Sonnet reçoit désormais les garde-fous cyber des modèles les plus capables
Anthropic estime que les capacités de cybersécurité de Sonnet 5.5 se sont suffisamment rapprochées de celles d'Opus 5 pour lui appliquer des protections supplémentaires. Les requêtes cyber considérées comme à haut risque peuvent être redirigées vers Sonnet 5, tandis que le développement logiciel ordinaire et la correction de bugs restent accessibles.
Sonnet 5.5 conserve les protections biologiques de Sonnet 5. Anthropic reconnaît que certains travaux légitimes en microbiologie ou virologie peuvent être bloqués par erreur et prévoit des programmes de vérification donnant aux organisations approuvées un accès adapté.
C'est aussi le premier Sonnet qu'Anthropic dit lancer avec des classificateurs destinés à contrer les attaques de distillation industrielle visant à extraire les capacités de raisonnement du modèle à travers de nombreux faux comptes.
Une migration peut demander une modification même sans changer de prix
Le passage de Sonnet 5 à Sonnet 5.5 n'est pas totalement transparent pour toutes les intégrations. Anthropic précise que les développeurs utilisant Sonnet avec le thinking désactivé doivent adopter le nouveau réglage between_tools avant la migration afin de conserver l'absence de raisonnement initial.
Ce détail résume assez bien cette version. Le tarif facial reste stable, mais le comportement du modèle, son utilisation des outils, sa vitesse et ses garde-fous évoluent suffisamment pour que le coût réel et les résultats d'une application puissent changer.
À 2 dollars l'entrée et 10 dollars la sortie, Sonnet 5.5 coûte deux fois moins par token qu'Opus 5.5 à 4 et 20 dollars. La question pratique n'est donc pas de savoir si les deux modèles obtiennent parfois des scores voisins. Elle est de mesurer combien de tâches d'une application nécessitent réellement le jugement supplémentaire pour lequel Anthropic continue de positionner Opus.