Exécuter Qwen 3.8 Flash Next (125B) sur PC gamer : 100 tokens/s en quantization 2-bit
Sommaire
En bref
- Strata, un outil open source, permet de faire tourner le modèle 125B Qwen3.8-Flash-Next sur un PC gamer équipé d'une RTX 4090 ou RX 9070 XT.
- La vitesse affichée varie de 53 à 94 tokens/s en écriture selon la quantization (IQ3_S à Q2_0).
- Le code et les images restent locaux, zéro telémétrie ni appel serveur.
- La quantization très agressives (2 à 3-bit) fait le trade-off classique rapidité contre qualité.
Ce que dit la source
Strata affirme qu'il est désormais possible d'exécuter localement un modèle de 125 milliards de paramètres sur du matériel grand public (GPU de 12 GB minimum, 32 GB RAM). L'outil compresse le modèle via quantization et un moteur optimisé pour NVIDIA/AMD, permettant vitesse d'inférence (53 à 94 tokens/s en écriture) et latence de lecture très élevée (1600 à 2650 tokens/s en mode contexte). Le projet positionne ceci comme une alternative à l'accès API cloud, avec confidentialité locale.
- Strata est un installateur graphique et un runtime spécialisé, non une simple ré-implémentation de llama.cpp : il géère l'allocation mémoire, le prefill/decode optimisé, et le chargement dynamique des experts MoE
- Qwen3.8-Flash-Next demande 70 GB à télécharger ; en fonction de la RAM disponible (32/48/64 GB+), le projet propose des variantes (Coder, IQ2_XS, IQ3_S, UD-IQ4_XS) avec trade-off qualité-vitesse
- Les mesures rapportées par l'équipe : RTX 5070 (12 GB) → 60 tok/s write, RTX 3090 (24 GB) → 100-140 tok/s write (projection) ; IQ3_S (meilleure qualité 3-bit) → 53 tok/s, Q2_0 (plus rapide, moins de qualité) → 94 tok/s
- Pré-remplissage très rapide (prefill) : 1600-2650 tok/s selon la config, pertinent pour documents longs ou chat history ; décodage (write) beaucoup plus lent
Dans les commentaires
Débat partagé : enthousiasme sur la commodité et la vitesse brute, mais scepticisme sérieux sur la qualité et les limitations pratiques.
- Un commentateur rapporte une dégradation massive de la précision en vision sur Strata : erreur médiane de 154.8 pixels vs 46.5 sur llama.cpp avec les mêmes poids, écart comparable à celui entre un modèle 9B et 35B, au quantization identique, problème reproductible, pas aléatoire.
- Pas de parallélisation concurrent requests : Strata bloque ou permute les contextes entre requêtes simultanées et charge différentes parties du MoE expert en mémoire, rendant inefficace l'usage multi-utilisateur. Un développeur signale que l'échange récent contexte RAM/VRAM aggrave ceci.
- Le modèle Coder, version allégée pour 32 GB (91% de SWE-bench des auteurs vs la version complète), montre une faiblesse notable en CJK et hors code.
- Plusieurs contestent le titre sensationnaliste 100 tok/s : ce chiffre est en préfill (lecture), pas en décodage (écriture/réponse) où la vitesse réelle est 2 à 3× inférieure. Le headline omet la quantization 2-bit, critique pour juger la qualité.
- Autre outil concurrence : ds4 (Dwarfstar) et llama.cpp offrent déjà des quantizations Q4 avec qualité supérieure sur ces modèles.
Alternatives citées : llama.cpp (avec Q4 quant), ds4/Dwarfstar (MLX q4 quant optimisé), Unsloth UD-IQ4_XS (4-bit alternatif intégré dans Strata)
Notre lecture
Strata baisse le friction d'installation et de setup comparé à construire soi-même une stack llama.cpp/MLX, c'est réel. Mais on achète cette praticité au prix de (1) très agressives quantizations 2-3 bit avec perte mesurable de qualité, surtout en vision, (2) pas de parallélisation, (3) un titre trompeur sur la vitesse (100 tok/s en prefill, 50-60 en décodage). Pour usage solo, local, avec tolérance à la qualité dégradée (debugging, brouillon, tâches simples), c'est une option. Pour la production ou des tâches exigeantes (précision, multimodal), les retours terrain suggèrent de préférer Q4 sur llama.cpp ou louer un RTX Pro 6000. À tester sur son propre hardware avant de conclure, mais sans illusions sur les compromis.