IA : DeepSeek lance V4.1 Flash, son nouveau modèle multimodal
La start-up chinoise DeepSeek a lancé jeudi 10 septembre 2026 DeepSeek-V4.1-Flash, son nouveau modèle d’intelligence artificielle multimodal accessible via son API. L’entreprise présente cette version comme le plus petit modèle de sa nouvelle famille d’architecture, conçue pour accélérer l’inférence, augmenter le débit et réduire les besoins en mémoire.

Selon la documentation officielle de DeepSeek, V4.1-Flash est un modèle à mélange d’experts (MoE) de 552 milliards de paramètres. Sa nouvelle architecture Causal Encoder–Decoder n’active que 8 milliards de paramètres pour l’entrée et 16 milliards pour la sortie, afin de limiter la charge de calcul à chaque requête.
Le modèle prend en charge nativement l’analyse d’images et conserve une fenêtre de contexte d’un million de tokens, avec une sortie maximale annoncée de 384 000 tokens. DeepSeek indique que les anciennes versions V4-Flash et V4-Flash-Vision-Exp sont retirées, leurs noms d’API étant temporairement redirigés vers V4.1-Flash.
La société prévoit également de retirer progressivement V4-Pro. À partir du 14 septembre à 04H00 UTC, les requêtes envoyées vers deepseek-v4-pro seront routées vers V4.1-Flash, jusqu’au lancement ultérieur de V4.1-Pro.
DeepSeek accompagne ce lancement d’une baisse de prix de son API. Le tarif hors pointe de V4.1-Flash est fixé à 0,003 dollar par million de tokens d’entrée lorsque le cache est utilisé, 0,15 dollar sans cache et 0,60 dollar par million de tokens générés. Les tarifs de pointe sont deux fois plus élevés.
Une architecture conçue pour réduire les coûts
DeepSeek affirme que le cache KV de V4.1-Flash nécessite quatre fois moins de mémoire HBM et huit fois moins de stockage SSD que la génération précédente. L’entreprise présente cette réduction comme l’un des leviers permettant d’abaisser le coût d’utilisation du modèle, en particulier pour les applications d’agents qui réutilisent de longs contextes.
Le modèle est désormais accessible sous le nom deepseek-flash dans l’API de DeepSeek. La société a également publié le modèle et un rapport technique sur Hugging Face et indique vouloir travailler avec la communauté open source sur la prise en charge de l’inférence et d’autres modes de déploiement.
Articles liés
Incendies : Eutelsat et OroraTech préparent jusqu’à 96 capteurs infrarouges en orbite
Paiements par IA : Visa, Mastercard et Ant lancent un cadre commun de confiance
Nvidia vise jusqu’à 2 GW d’infrastructures d’IA en Australie d’ici 2027
Semi-conducteurs : Analog Devices rachète Alif pour 1,35 milliard de dollars
Commentaires
Les commentaires se chargent lorsque vous arrivez ici.