05 août 2026

DeepSeek V4 Flash expliqué : ce que fait le modèle à un million de tokens et où partent vos prompts

Ce qu’est DeepSeek V4 Flash, l’attention hybride derrière son contexte d’un million de tokens et où partent réellement vos prompts depuis l’Europe.

DeepSeek V4 Flash est le modèle efficient de la génération V4 de DeepSeek : un modèle de langage mixture-of-experts de 284 milliards de paramètres au total, dont 13 milliards actifs par token, avec une fenêtre de contexte d'un million de tokens et des poids ouverts sous licence MIT. DeepSeek l'a publié en préversion le 24 avril 2026 et a livré la version officielle le 31 juillet 2026. Dans ilisai, c'est l'un des modèles sélectionnables du chat, facturé au token en crédits.

Ce guide couvre ce que la génération V4 a changé, l'architecture qui rend abordable une fenêtre d'un million de tokens, ce que le modèle sait et ne sait pas faire, sa place dans ilisai et — le laboratoire derrière le modèle étant chinois et nos utilisateurs largement européens — où partent réellement vos prompts.

Qu'est-ce que DeepSeek V4 Flash ?

DeepSeek V4 Flash (identifiant deepseek-v4-flash) est le plus petit des deux modèles que DeepSeek a annoncés le 24 avril 2026, aux côtés du vaisseau amiral V4-Pro. Les deux sont des poids ouverts sous MIT. Pro embarque 1 600 milliards de paramètres au total, dont 49 milliards actifs ; Flash se contente de 284 milliards au total et 13 milliards actifs, et c'est de là que viennent sa vitesse et son prix. Sur l'API de DeepSeek, Flash coûte 0,12 € par million de tokens d'entrée et 0,24 € par million en sortie — environ un tiers du tarif de sortie de Pro, à 0,75 €.

La chronologie :

  • 24 avril 2026 — DeepSeek publie la génération V4 en préversion : V4-Pro et V4-Flash, poids ouverts, avec le contexte d'un million de tokens par défaut sur l'ensemble de ses services officiels.
  • 26 avril 2026 — le rapport technique paraît sur arXiv et décrit l'architecture d'attention hybride détaillée plus bas.
  • 31 juillet 2026 — DeepSeek livre DeepSeek-V4-Flash-0731, la version officielle qui clôt la phase de préversion de Flash (rapporté par Caixin Global) ; l'endpoint deepseek-v4-flash de l'API pointe désormais vers cette version.

Une note pour qui utilise l'API de DeepSeek en direct : sa documentation tarifaire annonce l'adoption prochaine d'une tarification heures pleines / heures creuses — le double pendant les heures de pointe de Pékin —, la date d'entrée en vigueur n'étant pas encore fixée. Les prix dans ilisai n'en dépendent pas.

Comment un million de tokens devient abordable

Le contexte long a toujours coûté cher à cause de l'attention : dans un transformer classique, chaque nouveau token regarde tous les précédents, si bien que le calcul croît avec le carré de la séquence et le cache KV, avec sa longueur. Le rapport technique de V4 (arXiv:2606.19348) s'y attaque avec deux mécanismes d'attention qui alternent selon les couches :

  • CSA (Compressed Sparse Attention) compresse des groupes d'entrées clé-valeur en blocs, puis laisse chaque requête ne consulter que les blocs les plus pertinents — sélectionnés par un indexeur léger, le « lightning indexer » — plus une fenêtre glissante de tokens récents pour le détail local.
  • HCA (Heavily Compressed Attention) compresse bien plus fort et renonce à la sélection : chaque requête consulte densément l'ensemble du flux compressé, ce qui conserve à bas coût une vue globale du contexte.

Une troisième brique, mHC (manifold-constrained hyper-connections), retravaille les connexions résiduelles entre les couches pour stabiliser la propagation du signal à cette échelle. Le gain se mesure : d'après le rapport technique, V4-Pro avec un contexte d'un million de tokens ne demande que 27 % du calcul d'inférence par token et 10 % de la mémoire de cache KV qu'exigeait DeepSeek V3.2 — et Flash est la déclinaison plus petite et moins chère de ce même design. En pratique, vous pouvez lui confier un livre entier, l'export d'un dépôt de code ou un dossier de rapports sans que cela sorte de l'ordinaire.

Ce que sait faire le modèle

DeepSeek V4 Flash lit jusqu'à un million de tokens de contexte, raisonne par défaut, appelle des outils, met automatiquement en cache le contexte répété et n'accepte que du texte. Le détail, selon la documentation de DeepSeek, la page du modèle chez Fireworks et l'intégration d'ilisai elle-même :

CapacitéDeepSeek V4 Flash
Fenêtre de contexteUn million de tokens
Sortie maximale32 768 tokens par réponse dans ilisai — le plafond de sortie du chat pour tout le produit ; l'endpoint de Fireworks accepte jusqu'à 131 072
EntréesTexte uniquement — ni images ni fichiers
RaisonnementMode de raisonnement activé par défaut, avec niveaux d'effort
OutilsAppels de fonctions, avec plusieurs tours de raisonnement et d'outils
CacheCache de contexte activé par défaut, sans modification de code
LicenceMIT, poids ouverts

Mode de raisonnement. Le modèle raisonne avant de répondre, et sur l'API de DeepSeek c'est le comportement par défaut (effort par défaut : élevé). V4 Flash accepte trois niveaux d'effort — faible, élevé et maximal. Une particularité à connaître : en mode raisonnement, l'API ignore complètement temperature, top_p et les paramètres de pénalité ; le prompt est donc le seul levier (guide du thinking mode de DeepSeek).

Outils. Le modèle peut enchaîner plusieurs tours de raisonnement et d'appels d'outils avant d'arrêter sa réponse (même guide). Avec le contexte long, c'est le profil d'un modèle taillé pour les charges de travail d'agents, pas seulement pour la conversation.

Cache implicite. DeepSeek active le cache de contexte sur toutes les requêtes sans modification de code : les préfixes de prompt répétés sont récupérés depuis le cache et facturés à une fraction du tarif d'entrée normal (documentation du cache de contexte de DeepSeek). Fireworks applique la même idée sur sa plateforme : l'entrée en cache est facturée 0,024 € par million de tokens, contre 0,12 € pour une entrée neuve.

Texte uniquement. Le modèle n'accepte ni image ni fichier en entrée — la page du modèle chez Fireworks indique que l'entrée image n'est pas prise en charge. Dans ilisai, le bouton de pièces jointes se désactive quand DeepSeek V4 Flash est sélectionné, pour que vous le sachiez avant de bâtir un flux de travail dessus, pas après. Collez le texte directement — avec un million de tokens d'espace, coller est rarement le facteur limitant.

DeepSeek V4 Flash dans ilisai

DeepSeek V4 Flash est disponible dans le chat d'ilisai : connectez-vous, ouvrez le sélecteur de modèles, choisissez-le et écrivez. Pas de compte DeepSeek, pas de clé d'API, pas de facture supplémentaire : les crédits inclus dans votre formule se dépensent sur ce modèle exactement comme sur n'importe quel autre du catalogue.

Sur les très longs documents, c'est un modèle particulièrement à l'aise : dans ilisai, une conversation admet environ 770 000 tokens d'entrée, une fois déduite la réserve qu'ilisai garde pour la réponse — un contexte où tiennent toujours plusieurs romans. L'alternative développeur est l'API de Fireworks, où le même modèle coûte 0,12 € en entrée et 0,24 € en sortie par million de tokens, avec sa propre clé d'API et une facture séparée. Dans ilisai, rien de tout cela n'est nécessaire : chaque formule, Gratuit comprise, inclut des crédits qui se dépensent sur ce modèle, et ce qui dépasse vos crédits inclus est prélevé sur votre portefeuille.

Pour voir le modèle à l'œuvre avant d'écrire vos propres prompts, notre bibliothèque de prompts DeepSeek rassemble huit prompts à copier-coller, ajustés à ce que ce modèle fait de mieux — le travail sur documents longs compris.

L'utiliser depuis l'Europe : où partent vos prompts

Dans ilisai, les prompts envoyés à DeepSeek V4 Flash vont chez Fireworks AI, un fournisseur d'inférence américain qui ne conserve aucune donnée par défaut — jamais chez DeepSeek. La question est légitime pour le modèle d'un laboratoire chinois, alors reprenons point par point :

  • Vos prompts vont chez Fireworks, pas chez DeepSeek. ilisai exécute le modèle à poids ouverts via une intégration directe et figée avec Fireworks AI, un fournisseur d'inférence américain, sur sa plateforme serverless. Les requêtes ne transitent jamais par l'API de DeepSeek ni par aucun fournisseur chinois — c'est la licence MIT qui le permet : n'importe qui peut héberger les poids, et ilisai a choisi qui le fait.
  • Fireworks ne conserve aucune donnée par défaut. D'après la documentation de Fireworks sur le traitement des données, les prompts et les réponses des modèles serverless n'existent qu'en mémoire volatile le temps de la requête et ne sont consignés dans aucun stockage persistant ; quand le cache de prompts est actif, les préfixes en cache peuvent rester en mémoire volatile quelques minutes.
  • La région d'inférence relève de Fireworks. Fireworks propose DeepSeek V4 Flash sur sa plateforme serverless mondiale, sans engagement de région pour ce modèle. Les comptes, les conversations et la facturation d'ilisai relèvent du RGPD, ilisai étant une entreprise européenne ; l'inférence de ce modèle suit les conditions de Fireworks liées ci-dessus.

ilisai réunit des modèles de pointe et des modèles efficients de plusieurs fournisseurs sous un seul compte, avec des prix en euros, et ces informations sont données modèle par modèle avant que vous ne confiiez un flux de travail à l'un d'eux. Notre comparatif des options d'IA européennes élargit le tableau de la souveraineté numérique.

Commencez à utiliser l'IA aujourd'hui

Créez votre compte gratuit et accédez à plusieurs modèles d'IA depuis une seule interface.

Créer un compte gratuit

Foire aux questions

Qu'est-ce que DeepSeek V4 Flash ?

Le modèle efficient de la génération V4 de DeepSeek : un mixture-of-experts de 284 milliards de paramètres dont 13 milliards actifs, une fenêtre de contexte d'un million de tokens, un mode de raisonnement et l'usage d'outils, publié en poids ouverts sous MIT. La préversion est sortie le 24 avril 2026 ; la version officielle, le 31 juillet 2026.

Mes prompts partent-ils en Chine ?

Non. ilisai exécute le modèle à poids ouverts chez Fireworks AI, un fournisseur d'inférence américain, et les requêtes ne touchent jamais l'API de DeepSeek ni aucun fournisseur chinois. Fireworks ne conserve aucune donnée par défaut sur sa plateforme serverless, mondiale et sans garantie de région précise.

Puis-je joindre des images ou des fichiers ?

Pas avec ce modèle : DeepSeek V4 Flash est texte uniquement, et ilisai désactive le bouton de pièces jointes quand il est sélectionné. Collez votre texte directement dans le chat : la fenêtre d'un million de tokens laisse toute la place nécessaire. Pour un travail exigeant des images en entrée, choisissez un autre modèle du catalogue.

Quelle quantité de texte tient dans la fenêtre de contexte ?

Un million de tokens sur la fiche du modèle : l'équivalent de plusieurs longs romans, ou la documentation d'un grand projet. Dans ilisai, une conversation admet environ 770 000 tokens d'entrée après la réserve gardée pour la réponse, et chaque réponse est plafonnée à 32 768 tokens — la limite de chat de tout le produit. Le modèle accepte jusqu'à 131 072 tokens en sortie quand vous appelez Fireworks directement.

Puis-je l'utiliser sur la formule Gratuit ?

Oui. La formule Gratuit inclut 400 crédits par mois, utilisables jusqu'à 150 par jour, sur n'importe quel modèle du catalogue, DeepSeek V4 Flash compris ; les tâches plus lourdes peuvent passer par votre portefeuille sur toutes les formules.

Et DeepSeek V4 Pro ?

V4-Pro est le vaisseau amiral de la même génération, avec 1 600 milliards de paramètres, lui aussi en poids ouverts sous MIT. ilisai ne le propose pas ; l'entrée DeepSeek du catalogue est Flash, choisi pour son rapport prix-capacités.

Vicente Pomares
Fondateur
Dédié à rendre l'IA générative accessible à tous.

Nous utilisons des cookies nécessaires au fonctionnement d'Ilisai. Avec votre accord, nous utilisons aussi des cookies d'analyse pour comprendre comment Ilisai est utilisé et l'améliorer.

DeepSeek V4 Flash expliqué : ce que fait le modèle à un million de tokens et où partent vos prompts | Ilisai