180 milliards de paramètres, un post enthousiaste : le vrai poids de Qwen3.8-Flash-Next
D'après Qwen3.8-Flash-Next - fiche officielle du modèle (Hugging Face), relayé par X (@jaita)
Image : générée (Gemini)
Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.
À retenir
- James Aita affirme avoir rédigé un prompt de deux lignes, puis obtenu une application « écrite et servie » en deux heures avec Qwen3.8-Flash-Next, avant d'aller se coucher - un témoignage individuel, non reproduit publiquement à ce jour.
- Le modèle totalise 179 999 981 459 paramètres (mesuré via l'API Hugging Face le 27 août 2026), soit environ 354 Go en précision native BF16 (un format de nombre à virgule flottante) - bien au-delà de la mémoire d'un ordinateur personnel.
- Même la quantification (une compression des poids) la plus poussée publiée par la communauté (Unsloth, 1 bit, 26 août 2026) pèse encore 72,5 Go - aucune version connue ne tient sur une carte graphique grand public.
- Qwen présente ce modèle comme multimodal (modèle de langage à encodeur de vision, pipeline image-texte), pas comme un modèle spécialisé en code - malgré la démonstration de codage citée dans le billet.
- La licence Qwen Community 1.0 (pas la licence Apache 2.0, plus permissive) exige une entente commerciale séparée pour tout assistant de codage IA ou service d'inférence hébergé (une API qui fait tourner le modèle pour des tiers) bâti sur ce modèle.
Pourquoi ça compte
Le contraste entre un témoignage individuel enthousiaste et la réalité matérielle du modèle illustre un piège courant : une démonstration réussie sur l'infrastructure de son auteur (souvent louée, rarement un simple ordinateur personnel) ne prouve rien sur ce qu'un lecteur pourra reproduire « chez lui ». La veille avait déjà mesuré, le 26 août 2026, ce que coûte l'exécution de ce modèle sur une seule carte grand public ; cette fiche ajoute la licence et la nature multimodale du modèle, absentes de cette première mesure.
Chiffre-clé
72,5 Go : la taille du plus petit poids public connu de Qwen3.8-Flash-Next (quantification extrême à 1 bit publiée par Unsloth, 26 août 2026) - loin de la mémoire graphique d'un ordinateur grand public.
Citation
« This is frontier quality on your local box. » James Aita (@jaita)
Action concrète
Avant d'adopter ce modèle pour un usage commercial (assistant de codage, service hébergé), vérifier séparément deux choses : la taille réelle du fichier de poids sur Hugging Face, et les clauses de la licence Qwen Community 1.0, qui exige une entente distincte pour ce genre d'usage.
Repères datés
- 24 août 2026 - Alibaba publie Qwen3.8-Flash-Next sur Hugging Face, présenté comme un aperçu de l'architecture qui portera Qwen4.
- 26 août 2026 - La veille mesurait déjà le vrai coût mémoire de ce modèle pour un contexte long sur une seule carte grand public.
- 27 août 2026 - James Aita publie son témoignage sur X, qualifiant le modèle de « qualité de pointe sur votre poste local ».
« Qwen 3.8 Flash Next isn't just a little bit better, it's insanely better. This is one shot - wrote it and served it in 2 hrs - I sent the prompt, literally two lines, and went to bed. This is frontier quality on your local box. This blows Deepseek 4 out of the water. »
Fondée sur la source originale
Sources
- Qwen3.8-Flash-Next - fiche officielle du modèle (Hugging Face)
- Licence Qwen Community 1.0 (Hugging Face)
- Qwen3.8-Flash-Next-GGUF - quantifications, Unsloth (Hugging Face)
- Qwen3.8-Flash-Next - évaluation indépendante, Artificial Analysis
- Billet X - James Aita (@jaita), 27 août 2026
- Relais média : X (@jaita) →
🔧 Outils mentionnés