Google enchaîne : Gemini 3.5 Transcribe et Omni Flash en GA

C'est la grosse actualité de la semaine. Google passe deux modèles en disponibilité générale à 24h d'intervalle, et les deux méritent le détour. D'abord Gemini 3.5 Transcribe, un modèle de transcription audio qui gère 85+ langues avec détection automatique par énoncé. Utile quand vous avez un fichier qui switch entre français et anglais toutes les deux phrases, ce que Whisper gère toujours moyennement.

La déclinaison Gemini 3.5 Transcribe Live fait la même chose en streaming via WebSockets, avec événements intermédiaires et finalisés. Concrètement, vous ouvrez une socket, vous poussez du PCM, et vous recevez au fil de l'eau les segments partiels puis consolidés. La diarisation des locuteurs et les timestamps au niveau du mot sont inclus, ce qui évite de rebrancher un modèle de segmentation derrière. Pour tout ce qui est meeting bots, sous-titres live ou call center, c'est un vrai concurrent à Deepgram et compagnie. Détails dans le changelog Gemini API.

Le lendemain, Google enchaîne avec Gemini Omni Flash en GA, cette fois côté génération et édition vidéo. Deux features en particulier valent le coup d'œil :

  • La tâche extend qui prolonge une vidéo existante. Vous filez un clip, un prompt, et le modèle rallonge la séquence en respectant le style et la continuité. Utile pour boucher un trou de 3 secondes sans reshoot.
  • L'image_to_video avec interpolation entre deux images. Vous donnez frame de départ et frame d'arrivée, le modèle génère la transition. Ça ressemble beaucoup à ce que Runway proposait, mais dans un endpoint standard.
  • Le contrôle de résolution jusqu'à 4K en sortie, ce qui change la donne pour l'usage broadcast ou pub.

À noter, l'endpoint preview gemini-omni-flash-preview sera déprécié le 30 septembre 2026. Si vous êtes dessus, migrez sur la GA maintenant. Le changelog donne le détail des paramètres.

Claude apprend à se souvenir, et à oublier ce qu'il faut

Anthropic déploie une vraie fonctionnalité de mémoire sur Claude, dans le chat et dans Cowork. Rien de révolutionnaire côté concept, ChatGPT fait ça depuis un moment, mais l'implémentation est intéressante. La mémoire est activée par défaut sur les plans Free, Pro et Max, et vous gérez les sujets retenus depuis Paramètres > Mémoire. Chaque sujet est éditable individuellement, ce qui évite le classique tout-ou-rien.

Le point qui sort du lot : l'option d'inclure des sujets sensibles comme la santé ou les croyances. Par défaut, ces catégories sont exclues, et il faut activement opt-in pour que Claude les retienne. C'est un design plutôt propre côté vie privée, à voir comment ça vieillit en prod. Les détails sont dans les release notes.

Côté API, Anthropic a aussi poussé la version 2.1.247 de Claude Code avec deux ajouts pratiques. La commande /claude-api cost-optimize profile vos dépenses API et suggère des optimisations, typiquement où passer sur un modèle plus petit ou couper du contexte redondant. Et une fonction SendFeedback pour remonter des rapports directement depuis l'outil. L'API Admin gagne aussi quelques endpoints, changelog complet ici.

OpenAI coupe les vivres à Cursor

C'est la brève politique de la semaine. OpenAI met fin à son contrat de fourniture de modèles avec Cursor, suite à l'acquisition de l'éditeur par SpaceX. Officiellement, décision commerciale. Officieusement, on devine que servir des modèles à une boîte du groupe Musk après l'épisode xAI n'était plus tenable.

Pour les devs sur Cursor, ça veut dire que GPT-5.6 et suivants ne seront plus dispo dans l'IDE. Anthropic et Google restent branchés a priori, donc Claude et Gemini continueront de tourner. Mais si votre workflow dépendait spécifiquement des modèles OpenAI, il va falloir switcher ou dégainer une clé API en direct. Le communiqué reste très diplomate.

À côté de ça, OpenAI a aussi rendu GPT-5.6 disponible dans Kiro, avec l'argument classique du meilleur ratio prix/perf pour planifier, coder, reviewer et tester. Rien de renversant, c'est surtout une extension de disponibilité, mais si vous êtes utilisateur Kiro c'est bon à savoir. Annonce ici.

Ce qu'on retient

Google continue d'aligner les modèles multimodaux avec une régularité qui commence à peser. Transcribe et Omni Flash sur la même semaine, ça montre que l'écosystème Gemini est en train de couvrir méthodiquement chaque niche que les concurrents spécialisés occupaient.

Côté Anthropic, la mémoire arrive tard mais avec un design qui respire le sérieux sur la partie sensible. Et la brouille OpenAI-Cursor rappelle que dans cette industrie, les alliances valent ce que valent les actionnaires. À la semaine prochaine.