Qwen3.8-Flash-Next : le vrai prix pour tourner sur 24 Go
D'après Qwen3.8-Flash-Next - fiche officielle du modèle (Hugging Face), relayé par The Decoder
Photo : Jimmy Chan, Pexels
Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.
À retenir
- Qwen3.8-Flash-Next compte 125 milliards de paramètres, mais n'en active que 6 milliards par jeton (MoE, mélange d'experts). Il ajoute 51 milliards dans une couche de « plongement par n-grammes », conçue pour rester en mémoire vive plutôt que sur la carte graphique.
- Le modèle gère nativement une fenêtre de contexte de 262 144 jetons, extensible jusqu'à 1 million de jetons (source : the-decoder, 26 août 2026, d'après l'annonce de Qwen).
- @analogalok (X, 26 août 2026) affirme avoir fait tourner Qwen3.8-Flash-Next avec un contexte de 250 000 jetons sur une seule RTX 4090 de 24 Go, à 21 jetons/s, sans compression du cache KV (la mémoire tampon du contexte en génération) - sans dire à quel point les poids étaient compressés.
- @Oluwaphilemon1 (X, 26 août 2026) montre Qwen3.8-27B (modèle distinct, plus petit, entièrement actif) tourner sur un Colab gratuit à 16 Go, via un GGUF (format de poids compressé) à 3,7 bits par poids (environ 12,5 Go), en protégeant les couches Gated-DeltaNet - et le dit ouvertement.
- Même au format le plus compressé publié pour Qwen3.8-Flash-Next au 26 août 2026, les fichiers de poids totalisent plus de 67 Go : le faire tenir sur une carte de 24 Go suppose de garder l'essentiel des poids hors de la carte graphique, en mémoire vive.
Pourquoi ça compte
Le sujet réel n'est pas un score de performance, mais une leçon plus large : on peut désormais faire tourner de gros modèles d'intelligence artificielle sur du matériel ordinaire (carte grand public, Colab gratuit), et le prix à payer s'appelle la compression - qu'elle vienne de poids réduits en bits ou de calculs déplacés vers la mémoire vive plutôt que la carte graphique. Un billet enthousiaste peut être vrai et taire ce prix en même temps.
Chiffre-clé
Le quantifieur Empero a publié, le 15 août 2026, un GGUF de Qwen3.8-27B à 3,69 bits par poids : 11,73 Gio (12,59 Go), contre 50,89 Gio pour la version non compressée du même modèle (source : fiche du modèle, Hugging Face).
Citation
« This setup runs a 3.7 bpw Ridge GGUF of Qwen3.8-27B on a 16GB T4, while keeping the model's sensitive Gated-DeltaNet layers protected. » @Oluwaphilemon1 (X, 26 août 2026)
Action concrète
Avant de croire qu'un modèle « tourne » sur une carte de 24 Go, chercher son niveau réel de compression (bits par poids, format GGUF) : la fiche du modèle sur Hugging Face donne la taille exacte du fichier de poids, un chiffre qui ne ment pas.
Fondée sur la source originale
Sources
- Qwen3.8-Flash-Next - fiche officielle du modèle (Hugging Face)
- Qwen3.8-27B - fiche officielle du modèle (Hugging Face)
- Qwen3.8-27B-Ridge-GGUF - fiche de quantification, Empero (Hugging Face)
- Billet X - @analogalok, 26 août 2026
- Billet X - @Oluwaphilemon1, 26 août 2026
- Relais média : The Decoder → · Lire en français
🔧 Outils mentionnés