Claude Sonnet 5.5 : ce que valent vraiment les benchmarks et le prix
Anthropic a lancé Claude Sonnet 5.5 le 28 septembre, six jours après Opus 5.5. C'est le deuxième modèle de la famille 5.5, présenté comme plus rapide (+30 %) et jusqu'à 30 % moins cher par tâche que Sonnet 5.
Les prix
| Par million de tokens | Sonnet 5.5 | Opus 5.5 | |---|---|---| | Entrée | 2 $ | 4 $ | | Sortie | 10 $ | 20 $ | | Lecture de cache | 0,20 $ | 0,20 $ |
Le tarif ne baisse pas : il est identique à Sonnet 5. L'économie annoncée vient d'un nombre de tokens moindre par tâche, pas du prix affiché. Contexte de 1 M de tokens, identifiant claude-sonnet-5-5, disponible sur AWS, Google Cloud et Azure.
Les scores annoncés
Selon Anthropic : 70,6 % sur Terminal-Bench 4.0 (contre 10,3 % pour Sonnet 5 et 66,4 % pour Opus 5.5), 1 844 sur GDPval-AA (Opus 5.5 : 1 846) et 80,1 % sur OSWorld 2.1. Sur le papier, Sonnet 5.5 talonne le modèle phare pour moitié prix.
Les nuances à connaître
- Le score vedette est au niveau d'effort maximal. D'après l'analyse de Digital Applied, Terminal-Bench tombe à environ 43 % à l'effort « high », le défaut de l'API, et Opus 5.5 y obtient 64,2 %. L'écart se creuse là où la plupart des intégrations se placent.
- Le coût par tâche dépend du réglage. Artificial Analysis a mesuré que Sonnet 5.5 consomme, au maximum, plus de tokens par tâche que tout autre modèle testé, soit environ 50 % de coût en plus que Sonnet 5 dans ce cas.
- Les gains sont réels aux efforts bas. À effort « low » ou « medium », il dépasse le meilleur score de Sonnet 5 pour environ un dixième du coût par tâche.
- Anthropic précise qu'Opus 5.5 reste nettement plus fort sur le travail complexe demandant un jugement soutenu.
Concrètement
Pour du travail d'agents bien cadré (coding, automatisation), testez Sonnet 5.5 en medium ou high et mesurez le coût par tâche terminée, pas par token. Gardez Opus pour les tâches ouvertes. Si vous coupiez la réflexion avec Sonnet, le nouveau réglage between_tools est requis avant migration.
Sources : Anthropic, Decrypt, VentureBeat, Digital Applied. Scores publiés par Anthropic, non audités par NextOptimus.