Claude Opus 5 : deux fois plus fort, deux fois moins cher

C'est l'annonce de la semaine. Anthropic a lancé Claude Opus 5 le 24 juillet, et pour une fois le pitch marketing colle à peu près à la réalité. Le modèle affiche des performances doublées par rapport à Opus 4.8 sur Frontier-Bench v0.1, à moitié prix. On n'avait pas vu un tel saut prix/perf sur le haut de gamme depuis un moment.

Concrètement, Opus 5 excelle sur le code et la recherche scientifique, et surpasse les autres modèles sur plusieurs benchmarks clés selon Anthropic. Il devient le modèle par défaut sur Claude Max et le plus puissant disponible sur Claude Pro. Détail intéressant côté produit : il génère aussi de meilleures sorties visuelles, ce qui laisse penser qu'Anthropic pousse doucement vers le multimodal enrichi.

Côté API, ça bouge aussi sérieusement. La fenêtre de contexte passe à 1 million de tokens en entrée, avec jusqu'à 128k tokens en sortie. Le comportement thinking est désormais activé par défaut, ce qui veut dire que vos appels vont naturellement passer par une phase de raisonnement explicite avant de répondre. Si vous aviez un pipeline optimisé pour la latence brute, prévoyez de vérifier vos max_tokens et vos timeouts.

Autre nouveauté en beta : le changement d'outils en cours de conversation. Vous pouvez maintenant modifier la liste des tools exposés à Claude au fil d'une session, sans repartir de zéro. Utile pour les agents qui découvrent des capacités au fur et à mesure. Les SDK Python (v0.120.0) et TypeScript (sdk-v0.115.0) sont à jour, et claude-code a aussi été aligné. Détails complets sur le blog Anthropic et dans les release notes API.

Managed Agents : un cran d'effort, des webhooks partout

Toujours chez Anthropic, les Managed Agents gagnent un paramètre effort à la création. C'est un curseur qui permet de dire à l'agent combien il doit se creuser la tête sur une tâche. Vous voulez un agent rapide et pas cher pour trier des tickets ? Effort bas. Vous voulez qu'il débogue un truc tordu ? Effort haut. C'est le même principe que le reasoning_effort côté OpenAI, mais appliqué à l'ensemble du cycle de vie de l'agent.

En parallèle, l'API expose enfin des webhooks sur le cycle de vie de l'environnement et du stockage mémoire. Concrètement, vous pouvez brancher votre backend pour être notifié quand un agent démarre, sauvegarde de la mémoire, ou termine sa session. Et vous pouvez semer des événements initiaux à la création d'une session, pratique pour injecter du contexte métier sans polluer le prompt système. Voir l'annonce dédiée.

Petite feature bonus : le connecteur Anthropic Economic Index est dispo dans claude.ai. Vous demandez "quelles professions utilisent le plus l'IA" et Claude va chercher dans les données réelles d'Anthropic. Sympa pour ceux qui font de la veille marché, moins critique pour votre stack de prod.

Google : Gemini 3.6 Flash arrive, generate_images s'en va

Chez Google, deux modèles Gemini passent en GA le 21 juillet : Gemini 3.6 Flash et Gemini 3.5 Flash-Lite. Le 3.6 Flash améliore l'efficacité tokens et la planification pour les agents et le code, avec un prix inférieur à la version 3.5 Flash. C'est la stratégie habituelle de Google sur les Flash : à chaque itération, plus rapide, moins cher, un peu plus malin.

Le 3.5 Flash-Lite vise l'automatisation à faible latence, typiquement les workflows où vous avez besoin de classifier ou d'extraire à la chaîne sans exploser votre budget. À noter, un changement d'API qui va faire râler certains : les paramètres temperature, top_p et top_k sont désormais dépréciés. Google mise sur des defaults calibrés par modèle. Si vous aviez des temperature=0.2 partout pour rendre vos sorties déterministes, il va falloir tester le comportement par défaut. Détails dans le changelog Gemini.

Côté SDK Python, la version 2.14.0 de google-genai passe des avertissements de dépréciation sur generate_images, edit_images et generate_videos. Ces méthodes disparaîtront à la prochaine major. Si vous utilisez ces endpoints en prod, jetez un œil au release note pour anticiper la migration. Google n'a pas encore clairement communiqué sur les remplaçants unifiés, mais ça sent le regroupement autour de Gemini Omni évoqué la semaine dernière.

OpenAI : silence radio, sauf pour les PME

Semaine très calme chez OpenAI. Seule annonce notable : le lancement d'un programme ChatGPT pour les petites entreprises, dans la lignée de ChatGPT Work évoqué la semaine 28. L'idée est d'accompagner les patrons de PME sur les usages IA de base et l'automatisation. C'est du go-to-market, pas de la tech. Rien à mettre dans votre backlog technique cette semaine côté OpenAI, si vous cherchez des détails c'est par ici.

Ce qu'on retient

La bataille du haut de gamme se joue clairement sur le ratio prix/perf, et Anthropic vient de marquer un point. Diviser le prix d'Opus par deux tout en doublant les perfs, ça met la pression sur GPT-5.6 et Gemini Ultra. Pendant ce temps, Google continue son travail de fond sur les Flash et enterre gentiment les vieilles APIs image et vidéo.

Si vous devez faire une seule chose cette semaine : tester claude-opus-5 sur vos benchmarks internes, surtout si vous êtes encore sur Opus 4.8. À ce prix, le calcul est vite fait.