DeepSeek V4 Vision : la multimodale qui vise Opus
C'est probablement l'annonce la plus intéressante de la semaine. DeepSeek a publié deepseek-v4-flash-vision-exp, une version multimodale expérimentale de son modèle Flash sorti la semaine dernière. Et les chiffres sont sérieux.
Sur Terminal Bench 2.1, le modèle affiche 83.9. Sur Chartography, 64.3. On est dans le territoire d'Opus 4.8, mais côté DeepSeek, ce qui veut dire un tarif qui n'a rien à voir. Le pitch : des agents multimodaux qui comprennent une capture d'écran, un graphique, un PDF scanné, sans qu'on soit obligé de passer par un pipeline OCR.
Pour tester, c'est direct via l'API classique en changeant le nom du modèle : model="deepseek-v4-flash-vision-exp". Le suffixe -exp rappelle que c'est expérimental, donc pas de SLA de prod, mais pour du prototypage d'agent qui doit lire des interfaces, ça vaut le coup de brancher un notebook cet après-midi. Détails sur la doc officielle.
À noter, DeepSeek continue sa stratégie de release rapide : la V4-Flash est sortie en beta il y a trois semaines, la V4 Pro en GA la semaine dernière, et maintenant la variante Vision. Le rythme commence à ressembler à celui d'OpenAI en 2024.
Anthropic passe Files et Skills en GA
La version 0.124.0 du SDK Python (et la 0.119.0 côté TypeScript) sort les APIs Files et Skills de leur statut beta. Ça semble anodin, mais c'est ce qui manquait pour construire des agents Claude sérieux en prod.
Files permet d'uploader des documents une fois et de les référencer par ID dans plusieurs conversations, sans re-payer les tokens d'input à chaque appel. Fini le hack où on collait 40 pages de PDF dans chaque prompt. Vous uploadez, vous récupérez un file_id, vous le passez dans le message. Point.
Skills, c'est plus intéressant : ce sont des capacités réutilisables que vous définissez côté serveur Anthropic et que Claude peut invoquer. Vous décrivez un skill une fois (nom, description, comportement attendu), et vos agents peuvent l'utiliser sans que vous ayez à re-injecter la définition dans chaque system prompt.
Bonus dans la même release : les toolsets computer use et browser use sont désormais accessibles proprement via le SDK. Plus besoin de bidouiller les schémas JSON à la main, il y a des helpers dédiés. Pour ceux qui construisent des agents qui pilotent un navigateur, c'est un net gain de temps.
Replit + GPT-5.6 Luna : le Free Mode débarque
Replit et OpenAI lancent un Free Mode propulsé par gpt-5.6-luna. L'idée : générer des applis complètes sans se soucier de la consommation de tokens. Zéro friction sur la facturation, on décrit ce qu'on veut, on obtient du code qui tourne.
Sur le papier, c'est du no-code pour non-devs, mais ça mérite qu'on y jette un œil quand même. Luna semble être une variante de GPT-5.6 optimisée pour la génération d'apps courtes et cohérentes, avec un contexte projet géré côté Replit. Les annonces sont là : openai.com/index/replit.
La vraie question, c'est le business model. Replit finance forcément l'inférence quelque part, soit via des limites strictes en usage, soit via des upsells sur le hosting. On verra à l'usage. Mais pour prototyper une idée un dimanche soir, c'est probablement l'outil le plus rapide du marché en ce moment.
OpenAI SDK 7.5.0 : Sora vidéo s'en va, Bedrock arrive
La v7.5.0 du SDK Node confirme ce qu'on avait vu la semaine dernière : les APIs vidéo Sora sont officiellement dépréciées. Si vous aviez des scripts qui appellent client.videos.create, il est temps de planifier la migration. OpenAI n'a pas encore communiqué sur un remplaçant clair.
La release ajoute aussi deux nouveaux identifiants de modèle : daybreak et gpt-5.6-cyber (ce dernier était attendu, on en parlait la semaine dernière côté cybersec). Et un support de l'endpoint Bedrock Runtime, ce qui veut dire que le SDK OpenAI officiel peut désormais taper les modèles hébergés sur AWS Bedrock sans passer par le SDK Bedrock. Pratique pour les boîtes qui ont déjà standardisé leur code sur le client OpenAI.
Pas de quoi sauter au plafond, mais c'est le genre de nettoyage qui compte quand on maintient une base de code depuis 18 mois.
Ce qu'on retient
La tendance de fond, c'est la multimodalité qui devient standard même chez les acteurs low-cost. DeepSeek sort une variante vision trois semaines après le modèle texte, et les benchmarks tiennent la route face aux modèles premium. Le gap entre frontier labs et challengers continue de se resserrer.
Côté outillage, Anthropic joue la carte de la maturité pendant qu'OpenAI et Replit poussent l'accessibilité. Deux stratégies, deux publics. Et nous, on peut piocher dans les deux.