Skip to content

Claude Opus 4.5 arrive : écrasant les tests de codage et annonçant l'ère « Superman » de la programmation de l'IA

Le rythme des sorties de grands modèles a été implacable ces derniers temps. Tout comme Gemini 3 Pro était à l'honneur, Anthropic a officiellement lancé Claude Opus 4.5, plaçant une fois de plus la barre plus haut en mettant fortement l'accent sur la programmation et les tâches au niveau système.

Anthropic affirme que l'Opus 4.5 est globalement plus intelligent et plus efficace. Il maintient ses performances de haut niveau dans les « tâches au niveau du système » telles que la programmation, les agents de construction et le contrôle informatique, tout en montrant également des améliorations significatives dans les tâches quotidiennes telles que la recherche, les présentations et l'analyse des feuilles de calcul. À partir d'aujourd'hui, Opus 4.5 est largement disponible via l'application Claude, l'API et les principales plates-formes cloud que les développeurs peuvent utiliser via l'appel API « claude-opus-4-5-20251101 ».

L'Opus 4.5 occupe le devant de la scène dans une saison de débuts en matière d'IA

Selon les annonces officielles et les retours des testeurs, Claude Opus 4.5 comprend nettement mieux les requêtes ambiguës et est plus stable dans l'identification autonome des bugs complexes. Il est devenu le premier modèle à obtenir un score supérieur à 80 % au test de référence réel en matière d'ingénierie logicielle, SWE-Bench Verified.

La qualité du code du modèle a fait l’objet d’une mise à niveau complète. Lors du test multilingue SWE-bench, qui couvre huit langages de programmation, Opus 4.5 a obtenu le meilleur score dans sept d'entre eux. Dans un exemple convaincant, l'équipe Anthropic a soumis à Opus 4.5 un test très difficile utilisé pour recruter des ingénieurs de performance. Dans le délai de deux heures, le modèle a surclassé tous les candidats humains. Au-delà du génie logiciel, Claude Opus 4.5 démontre des améliorations globales en vision, en raisonnement et en mathématiques. Les capacités du modèle commencent même à dépasser les normes d'évaluation existantes. Dans un benchmark agent, le modèle a conçu une solution de contournement intelligente à un problème qui était conforme aux règles mais en dehors des réponses attendues du test, démontrant ainsi ses capacités créatives de résolution de problèmes.

Claude Everywhere : intégré à votre bureau, votre navigateur et Excel

Aux côtés de l'Opus 4.5, c'est tout l'écosystème Claude qui a été amélioré. Claude Code a reçu deux mises à jour majeures : le « Mode Plan » pour des plans d'exécution plus précis et une nouvelle application de bureau pour exécuter plusieurs sessions agentiques simultanément. Pour les utilisateurs de l'application, la fonctionnalité très demandée « conversations sans fin » est désormais disponible, permettant aux dialogues de se poursuivre indéfiniment en résumant automatiquement le contexte initial. De plus, l'extension Claude pour Chrome est ouverte à tous les utilisateurs Max, et la version bêta de Claude pour Excel a été étendue aux utilisateurs Max, Team et Enterprise.

Plus intelligent et plus économique : une mise à niveau sous-jacente majeure pour Opus 4.5

À mesure que les modèles deviennent plus intelligents, ils résolvent les problèmes plus efficacement. Claude Opus 4.5 utilise beaucoup moins de jetons que ses prédécesseurs pour obtenir des résultats similaires ou meilleurs. Un nouveau paramètre « effort » dans l'API permet aux développeurs de choisir entre donner la priorité à la vitesse et au coût ou maximiser la capacité du modèle. À un niveau d'effort moyen, Opus 4.5 égale les meilleures performances de Sonnet 4.5 sur SWE-bench Verified mais avec 76 % de jetons de sortie en moins. Anthropic a également introduit trois nouvelles fonctionnalités pour résoudre le défi de la gestion de nombreux outils dans des flux de travail agents : « Outil de recherche d'outils », « Appel d'outils programmatiques » et « Exemples d'utilisation d'outils », qui ont considérablement amélioré la précision des tests multi-outils complexes en réduisant l'utilisation de jetons et en améliorant la sélection d'outils.

Cette version met en évidence une tendance émergente : différents modèles d'IA développent des « personnalités » distinctes. La gamme Opus excelle dans la programmation, le raisonnement structuré et les opérations système, tandis que des modèles comme Sonnet peuvent être plus rentables pour l'écriture créative. Le lancement de l'Opus 4.5 confirme cette spécialisation. À l’avenir, la sélection d’un modèle d’IA dépendra moins des scores du classement que de la recherche d’un « collègue » dont le style de travail correspond à vos besoins.

_{area}

_{region}
_{language}