OpenAI passe la sixième avec Ultrafast et GPT-5.6-Cyber

Grosse semaine chez OpenAI, avec trois annonces qui touchent directement notre quotidien. La plus spectaculaire, c'est Ultrafast : un nouveau tier d'API qui fait tourner GPT-5.6 Sol jusqu'à 14 fois plus vite que la normale. On parle de 750 tokens de sortie par seconde, propulsés par du silicium Cerebras derrière les rideaux.

Concrètement, si vous faites du streaming de réponses longues ou des chaînes d'agents où chaque étape attend la précédente, ça change la donne. Un plan à 30 étapes qui prenait 40 secondes en tombe à 3. Le prix n'est pas encore public dans l'annonce, mais le service est en preview via l'API standard. Détails sur la page Ultrafast.

Deuxième sortie, plus verticale : GPT-5.6-Cyber, un modèle spécialisé cybersécurité accessible via Daybreak Red. Le use case affiché est clair : recherche de vulnérabilités, validation d'exploits, tests de sécurité offensive. C'est le premier modèle OpenAI aussi explicitement positionné offensive security, et ça ouvre des questions intéressantes sur l'accès (spoiler : ce ne sera pas ouvert à tout le monde). Plus d'infos dans l'annonce Daybreak.

Troisième point, plus discret mais utile : le guide builder pour la Responses API de GPT-5.6. Deux choses à retenir. D'abord, la sélection de modèle est maintenant plus fine côté serveur : vous laissez le routeur choisir entre les variantes selon la difficulté du prompt, et vous ne payez que ce que vous consommez. Ensuite, la construction d'agents multi-étapes se fait avec moins de code de plomberie. À lire dans le guide officiel.

Gemini 3.7 Flash, la réponse Google pour le code

De son côté, Google pousse Gemini 3.7 Flash en disponibilité générale, présenté comme leur modèle le plus intelligent pour le développement logiciel et les workflows agents. Après la 3.6 Flash qui cassait les prix la semaine du 27 juillet, Google enchaîne vite. Trop vite ? On verra ce que donnent les benchmarks indépendants.

Les points concrets : améliorations substantielles en ingénierie logicielle et en développement web, ce qui se traduit en général par de meilleurs scores sur SWE-bench et LiveCodeBench. Et surtout, un prix d'introduction valable jusqu'au 31 décembre 2026. Traduction : Google veut que vous testiez maintenant, avant qu'Anthropic ou OpenAI ne sortent leur prochain coup.

Si vous êtes déjà sur l'API Gemini, la bascule est triviale : changez le nom du modèle dans vos appels et regardez si vos évals tiennent. Le changelog est ici. À noter que ça vient s'inscrire dans la même course au code que la Responses API de GPT-5.6 et le modèle DeepSeek dont on parle juste en dessous. Personne ne veut lâcher le terrain du codage agentique.

DeepSeek V4 Pro passe en GA avec un mode Codex

Chez DeepSeek, la V4-Flash était en beta il y a deux semaines. Cette fois, c'est le grand frère qui arrive : DeepSeek-V4-Pro est disponible en GA sur l'app, le web et l'API, sous le nom deepseek-v4-pro. Le pitch : capacités d'agent nettement améliorées, optimisées pour la prod.

Deux détails qui méritent qu'on s'arrête. D'abord, DeepSeek supporte nativement le format OpenAI Responses API, avec un mode adapté pour Codex. Ça veut dire que si vous avez déjà du code qui appelle la Responses API d'OpenAI, vous pouvez pointer vers DeepSeek en changeant l'URL de base et la clé. Portage minimal, comparaison directe. Malin.

Ensuite, trois niveaux d'effort de réflexion sont exposés : low, high, max. Vous choisissez à l'appel combien de "pensée" vous voulez, ce qui vous permet d'arbitrer coût contre qualité par requête. Utile pour des pipelines où certaines étapes sont triviales et d'autres critiques. Les détails sont dans les release notes DeepSeek.

Petit tas de dépréciations chez OpenAI

La version 3.1.0 du SDK Python OpenAI est sortie, et elle embarque une dépréciation qui va faire râler : les API vidéo Sora sont sur la sellette. Si vous avez du code en prod qui appelle les endpoints Sora, c'est le moment de regarder ce que ça implique pour votre roadmap.

Le release ajoute aussi des WebSocket stream IDs et un événement de jeton d'accès pour l'identité de charge de travail, ce qui est plutôt bienvenu côté observabilité et sécu. Les notes complètes sont sur le repo GitHub.

Ce qu'on retient

La tendance de la semaine, c'est la latence qui devient un axe de différenciation à part entière. Ultrafast à 750 tokens/s n'est pas juste un chiffre marketing : à ce niveau-là, on peut construire des UI qui répondent en temps réel et des agents multi-étapes fluides.

Deuxième tendance : DeepSeek qui adopte le format Responses API d'OpenAI, ça sent la convergence des standards d'agents. Bonne nouvelle pour ceux qui veulent tester plusieurs providers sans réécrire leur stack. Et pour Sora vidéo, on saura la semaine prochaine si c'est une refonte ou un enterrement pur.