DeepSeek vient de lancer V4-Flash-0731 le 31 juillet 2025, et si tu travailles avec des agents IA en production, t’as pas le droit d’ignorer ça. Un modèle agentique frontier, des poids en MIT, un prix d’API qui fait mal aux concurrents. Ce que tu vas apprendre :

  • Ce que V4-Flash-0731 apporte concrètement par rapport à la version précédente
  • Ce que « capacités agentiques » veut dire en pratique pour ton workflow
  • Les vrais prix de l’API et ce que ça change face à OpenAI et Anthropic
  • Ce que la licence MIT implique si tu veux auto-héberger
  • Pour qui ce modèle a du sens aujourd’hui, et pour qui il n’est pas encore prêt

Ce que DeepSeek V4-Flash-0731 apporte concrètement

DeepSeek n’est pas une startup venue de nulle part. C’est une société chinoise fondée en 2023, spin-off du fonds quantitatif High-Flyer, qui publie ses modèles en open-weight sur Hugging Face depuis ses débuts. Son 14e launch sur Product Hunt a récolté une note de 4,9 sur 5 avec 49 reviews et attiré plus de 3 000 followers. Le pattern est établi : la communauté watch close. V4-Flash-0731 est le successeur direct d’une version qui performait déjà bien sur les benchmarks de raisonnement. Sauf que là, le saut est brutal.

Le Terminal-Bench 2.1 mesure la capacité d’un modèle à exécuter des tâches dans un environnement terminal réel : scripts, commandes, séquences d’opérations. Passer de 61,8 à 82,7 en une version, c’est pas une optimisation marginale. C’est un modèle qui a appris à faire quelque chose de fondamentalement différent.

DeepSWE mesure les performances en ingénierie logicielle autonome : résolution de bugs, implémentation de features à partir de specs, navigation dans une codebase. Un score de 7,3 à 54,4, c’est pas une amélioration incrémentale. C’est un changement de catégorie.

Capacités agentiques : ce que le modèle sait faire

Le mot « agentique » est surutilisé dans l’industrie, alors soyons précis. Un modèle agentique, c’est un modèle capable de planifier une séquence d’actions, d’utiliser des outils externes (API, terminal, navigateur), d’observer les résultats et d’ajuster son plan en cours de route. C’est pas juste « écrire du code », c’est exécuter un objectif de façon autonome sur plusieurs étapes. Les scores de V4-Flash-0731 sur Terminal-Bench et DeepSWE indiquent précisément ces capacités : navigation de fichiers, exécution de commandes, résolution de problèmes d’ingénierie sans supervision constante. C’est ce dont t’as besoin pour construire un pipeline autonome qui fait quelque chose d’utile sans que tu tiennes la main à chaque étape.

Ce que ça change en pratique : tu peux envoyer une tâche complexe de plusieurs étapes et récupérer un résultat, sans orchestrer manuellement chaque appel. Le modèle gère l’enchaînement lui-même. Le raisonnement multi-étapes était déjà présent dans DeepSeek-R1, sorti plus tôt en 2025, le modèle de raisonnement open-weight qui avait marqué l’industrie par son ratio performance/coût. V4-Flash-0731 pousse ça plus loin, avec un focus sur l’exécution réelle plutôt que sur le raisonnement pur.

Diagramme comparant deux workflows agentiques : à gauche, un humain orchestre plusieurs appels séquentiels vers un modèle classique ; à droite, V4-Flash-0731 prend un objectif en entrée et retourne un résultat, en gérant les étapes intermédiaires en interne.
Workflow classique vs V4-Flash-0731 : l'orchestration migre du client vers le modèle — moins de glue code, un seul point d'entrée, un état qui n'a plus besoin d'être recousu à chaque tour.

Tarification et accès API : les chiffres réels

Soyons directs avec les chiffres, parce que c’est là que ça devient intéressant.

Plan Prix input Prix output
Chat (gratuit) 0 $ 0 $
API à l'usage 0,14 $ / million de tokens 0,28 $ / million de tokens

Pour l’API : 0,14 $ / million de tokens en entrée et 0,28 $ / million de tokens en sortie. Compare ça aux modèles frontier d’Anthropic et d’OpenAI, qui facturent souvent plusieurs dollars par million de tokens pour des capacités comparables. La différence est substantielle.

La vraie affaire : à ces prix, tu peux faire tourner des pipelines agentiques à volume sans que l’addition tue ton projet avant qu’il génère quoi que ce soit. Le plan Chat reste gratuit. Le plan API facture à l’usage, sans abonnement mensuel. Pour un opérateur qui teste un pipeline ou qui scale progressivement, ce modèle de tarification est beaucoup plus friendly que les abonnements fixes.

Maquette au trait d'une interface API DeepSeek affichant une grille tarifaire avec deux lignes distinctes : prix des tokens d'entrée et prix des tokens de sortie.
Maquette schématique de la page pricing de l'API DeepSeek : deux lignes tarifaires distinctes séparent explicitement le coût des tokens d'entrée (input) et de sortie (output), logique standard des APIs LLM.

Open source ou pas : ce que ça change pour toi

Les poids de V4-Flash-0731 sont publiés sous licence MIT. MIT, ça veut dire usage commercial autorisé, modification autorisée, redistribution autorisée, sans conditions restrictives. C’est la licence la plus permissive qui existe en logiciel. Ce que ça implique concrètement : tu peux télécharger les poids depuis Hugging Face, les faire tourner sur ton propre infra, les fine-tuner sur tes données, les embarquer dans ton produit. Tu n’es pas captif de l’API DeepSeek si tu veux pas l’être. Le hic, c’est que faire tourner un modèle frontier en local demande du matériel sérieux. Si t’as pas accès à plusieurs GPU de haute gamme, tu vas passer par l’API de toute façon. L’open source donne la liberté théorique, mais l’accès pratique reste via l’API pour la plupart des équipes. DeepSeek publie ses modèles sur Hugging Face depuis le début, incluant les familles V2, V3 et DeepSeek-Coder. V4-Flash-0731 s’inscrit dans cette continuité. Si tu veux auditer les poids, les héberger dans une infrastructure privée pour des raisons de conformité ou de souveraineté des données, c’est possible. C’est pas rien.

Schéma comparatif montrant les deux chemins d'accès à DeepSeek V4-Flash-0731 : API à gauche (aucune infra, coût variable) et auto-hébergement MIT à droite (infrastructure GPU, contrôle total, coût fixe).
Deux voies mènent au même modèle. À gauche, l'API DeepSeek : mise en route immédiate, facturation au token, données hors site. À droite, l'auto-hébergement sous licence MIT : contrôle total des poids et de la donnée, en échange d'un cluster GPU et d'une équipe ops. Le curseur se choisit selon l'échelle et la souveraineté visées.

Comparaison rapide avec les modèles concurrents

Mettons les choses en perspective sans inventer de scores que je n’ai pas vérifiés.

Modèle Capacités agentiques Prix approximatif input Poids ouverts
DeepSeek V4-Flash-0731 Frontier (Terminal-Bench + DeepSWE élevés) 0,14 USD / MTok Oui, MIT
GPT-5 (OpenAI) Frontier Plusieurs USD / MTok (à vérifier doc) Non
Claude Sonnet 4.5 (Anthropic) Élevées Plusieurs USD / MTok (à vérifier doc) Non
Llama 4 Scout (Meta) Intermédiaires Gratuit sur API partenaires Oui, licence Meta

Sur les benchmarks agentiques publiés par DeepSeek, V4-Flash-0731 se mesure aux modèles frontier des grands labs. Je ne vais pas t’inventer des pourcentages de comparaison directe que je n’ai pas dans mes données vérifiées. Ce que je peux dire : pour les tâches de terminal et d’ingénierie logicielle, les scores publiés le positionnent dans la même catégorie que les meilleurs modèles disponibles, à une fraction du prix d’accès API. Le vrai avantage concurrentiel de DeepSeek n’a jamais été de battre tout le monde sur tous les benchmarks. C’est de livrer des performances frontier à un coût qui rend les projets économiquement viables. V4-Flash-0731 continue cette logique.

Soyons honnêtes : les benchmarks de DeepSeek sont publiés par DeepSeek. Les évaluations indépendantes à grande échelle prennent quelques semaines à sortir. Les scores terminal et SWE sont prometteurs, mais le vrai test, c’est ton cas d’usage spécifique.


Pour qui ce modèle a du sens

Builders de pipelines agentiques en production. Si tu construis un agent qui doit naviguer des fichiers, exécuter des commandes, résoudre des bugs ou interagir avec des APIs externes, les scores Terminal-Bench et DeepSWE de V4-Flash-0731 le positionnent comme un candidat sérieux. Le prix permet de faire des volumes que tu ne pourrais pas faire avec les alternatives. Équipes avec contraintes de souveraineté des données. La licence MIT permet l’auto-hébergement complet. Si ton infrastructure juridique exige que les données ne sortent pas de ton périmètre, c’est une option réelle. Ça demande du GPU, mais l’option existe. Développeurs indépendants et petites équipes. Le modèle de tarification à l’usage sans abonnement minimum, combiné à un plan gratuit pour le chat, permet d’expérimenter sans risque financier. Tu peux valider un concept avant de committer sur l’infra. Ce modèle n’est probablement pas pour toi si :

  • Tes tâches agentiques sont principalement en français québécois ou dans des langues moins représentées. Les modèles entraînés avec une dominance anglophone et chinoise ont souvent des angles morts sur des dialectes régionaux.
  • Tu as des exigences de support enterprise (SLA, contrats, escalades) : DeepSeek est une jeune société et son offre enterprise n’est pas au niveau d’Anthropic ou d’OpenAI pour l’instant.
  • Ton organisation a des politiques qui bloquent les modèles d’origine chinoise pour des raisons de sécurité. C’est une réalité dans certains secteurs régulés.
Maquette au trait d'une page de documentation d'API montrant un endpoint agentique et ses paramètres de configuration (tools, tool_choice, max_steps, temperature, stream) avec un exemple d'appel.
Maquette éditoriale d'une page de référence API : navigation à gauche listant les endpoints agentiques, panneau central détaillant les paramètres d'un appel avec outils et un exemple de requête. Placeholders volontairement génériques.

Verdict

DeepSeek V4-Flash-0731 n’est pas un modèle « bon marché qui fait ce qu’il peut ». C’est un modèle frontier sur les tâches agentiques, publié en open source sous MIT, avec un prix d’API qui change le calcul économique pour quiconque construit des pipelines à volume. Le saut de performance entre la version précédente et celle-ci est marquant sur les deux benchmarks les plus pertinents pour des agents en production. À 0,14 $ / million de tokens en entrée et 0,28 $ / million de tokens en sortie, le rapport performance/coût est difficile à battre dans la catégorie agentique. Les réserves sont réelles : évaluations indépendantes encore limitées au moment du lancement, questions légitimes sur la souveraineté des données, support enterprise embryonnaire. Ces éléments méritent ta diligence selon ton contexte. Next step : si tu construis quelque chose avec des agents, installe le SDK DeepSeek, replie un pipeline de test sur V4-Flash-0731, et compare les résultats sur tes vraies tâches. Les benchmarks laboratoire racontent une partie de l’histoire. Ton workflow raconte le reste.

On continue à la Taverne ?

Un courriel par semaine. Pas de fluff.

En t'abonnant, tu reçois Le Tour de Table chaque semaine. Tu peux te désabonner en un clic. Voir notre politique de confidentialité.

Texte par David Cyr