OpenAI : GPT-5.6 s'affine et devient plus abordable
La semaine dernière on parlait déjà du lancement de GPT-5.6. Cette semaine, OpenAI enfonce le clou avec trois annonces qui vont dans le même sens : rendre le modèle plus efficace pour chaque dollar dépensé. C'est un axe assumé, et pour une fois ce n'est pas du vent.
Premier point, une mise à jour officielle vante l'amélioration des flux agentiques. On reste sur du discours corporate, mais elle est corroborée par les deux annonces qui suivent, donc on la prend au sérieux.
Deuxième point, plus concret : deux paramètres de l'API auraient permis de tripler les scores de GPT-5.6 sur ARC-AGI-3. Le tout en préservant le raisonnement et en autorisant la compaction du contexte. Si vous faites tourner des agents longs, jetez un œil au billet, ils détaillent quels flags activer.
Troisième point, et là on parle vrai ROI : une baisse de prix sur les variantes Luna et Terra de GPT-5.6. Pas de chiffres précis dans nos données, mais l'annonce cible clairement les gros déploiements entreprise. Si vous êtes en prod avec un budget qui explose, c'est le moment de re-benchmarker.
Note d'entretien technique au passage : le SDK openai-node passe en v7.0.0 et exige désormais Node.js 22. Rien de dramatique, mais votre pipeline CI risque de tousser si vous êtes encore sur du Node 20. Prévoyez une PR de maintenance avant de mettre à jour aveuglément.
DeepSeek-V4-Flash débarque en beta publique
DeepSeek continue son offensive silencieuse avec le lancement de l'API DeepSeek-V4-Flash en beta publique. La méthode d'appel ne change pas, il suffit de passer deepseek-v4-flash comme nom de modèle dans vos requêtes existantes.
Ce qui retient l'attention, c'est le score annoncé sur Terminal Bench 2.1 : 82.7. Pour un modèle Flash, positionné sur le créneau rapide et pas cher, c'est très correct. On est dans la zone des modèles frontier sur un benchmark d'exécution agentique en terminal, ce qui n'est pas rien pour du code et du tooling.
Concrètement, si vous avez déjà une intégration DeepSeek, le test coûte cinq minutes : vous changez le nom du modèle, vous relancez votre suite d'évals, vous comparez. C'est exactement le genre de rotation à faire de temps en temps sur ses agents, surtout quand un provider low-cost passe la barre des 80 sur un bench sérieux.
Google pousse Gemini vers la robotique et muscle ses agents
Chez Google, deux annonces qui montrent bien où va Gemini en ce moment : les agents gérés et le monde physique.
D'abord, l'API Gemini Robotics ER 2 passe en preview publique. Deux nouveaux endpoints : gemini-robotics-er-2-preview pour du raisonnement spatial avancé, et gemini-robotics-er-2-streaming-preview pour du temps réel. Les modèles avalent texte, images, vidéos et audio, avec appel de fonction et orchestration d'outils multi-étapes.
Le mot-clé ici c'est raisonnement incarné (embodied reasoning). Autrement dit : un modèle qui comprend l'espace, les objets, les séquences d'actions physiques. Si vous êtes sur de la robotique, du contrôle de drones, ou même juste de la vision assistée pour des workflows industriels, ça mérite un POC. Le streaming en temps réel change la donne pour tout ce qui a besoin de boucles de contrôle rapprochées.
Ensuite, Google élargit ses agents gérés dans l'API Gemini avec un système de hooks. L'idée : brancher votre code à des points précis du cycle de vie d'un agent (avant un appel d'outil, après une réponse, sur une erreur) sans réécrire toute l'orchestration. C'est le genre de primitive qui manquait à pas mal de frameworks agent maison. Si vous avez bricolé votre propre couche de callbacks au-dessus de Gemini, il est peut-être temps de la jeter.
Petit rappel de ménage côté Google : la version 2.14.0 du SDK js-genai déprécie plusieurs méthodes Imagen, notamment generate_images, edit_images et generate_videos. Elles seront supprimées à la prochaine major. Les args prompt, text et image déclenchent aussi des warnings. Voir la release GitHub pour la migration.
Ce qu'on retient
La tendance de fond de la semaine, c'est l'efficacité. Personne ne sort de nouveau modèle frontier révolutionnaire, mais tout le monde optimise : OpenAI baisse les prix et affine les paramètres, DeepSeek pousse un Flash qui benche haut, Google industrialise les agents avec des hooks propres.
Pour vos projets, la question n'est plus "quel est le meilleur modèle" mais "lequel me donne le meilleur ratio perf/coût sur mon use case précis". La bonne nouvelle : avec la concurrence qui se durcit, changer de provider est devenu un simple flag à modifier. Profitez-en pour re-benchmarker, vraiment.