Aller au contenu
La Lettre IT
Retour aux synthèses
3 min de lecture
Développement & outils

ShapeLearn : quantification optimisée de Qwen 3.8 27B, 13.1 GB VRAM

En bref

  • ByteShape a publié des versions quantifiées (GGUF) de Qwen 3.8 27B optimisées avec sa méthode ShapeLearn, offrant un meilleur compromis vitesse-qualité que les versions « Lite » publiées quatre jours après le lancement du modèle.
  • La version GPU-5 (3.84 BPW, 13.1 GB) atteint 99,63% de la qualité BF16 à ~90 tok/s sur GPU haute mémoire.
  • La version GPU-4 (3.23 BPW, 11 GB) est plus rapide mais légèrement moins précise.
  • L'équipe propose deux stratégies de décodage spéculatif : MTP (embarqué, supporte les images) ou DFlash2 (plus rapide, texte uniquement).

Ce que dit la source

ByteShape présente ces quantifications comme une amélioration mesurable sur la « frontière » qualité-vitesse : les cinq modèles ShapeLearn resteraient sur cette frontière dans six comparaisons GPU différentes. L'entreprise affirme que GPU-5 atteint le meilleur score agrégé parmi les quants testés, tandis que GPU-4 offre un meilleur rapport taille-performance si la mémoire est limitée. Les variantes Lite, publiées précipitamment quatre jours après la sortie du modèle original, se sont avérées « solides » a posteriori, trois de leurs six modèles restant sur la frontière.

  • GPU-5 (IQ4_XS, 3.84 BPW) : 90,4 tok/s, 99,63% de qualité BF16, 13,1 GB VRAM (recommandation par défaut)
  • GPU-4 (IQ3_S, 3.23 BPW) : 101,1 tok/s, 98,72% de qualité, 11 GB VRAM (meilleur compromis si mémoire limitée)
  • Décodage spéculatif MTP (embarqué) vs DFlash2 (externe) : DFlash2 plus rapide mais consomme plus de mémoire et ne supporte pas les images
  • Les quants Prism-ML Ternary Bonsai 2 sont plus petits (1,77-2,14 BPW) et plus rapides mais requièrent une compilation personnalisée de llama.cpp, avec une qualité inférieure (91,4-91,7% BF16)
  • Comparaisons sur six GPU (du RTX Pro 6000 au RTX 5090), avec benchmarks face à Unsloth, Bartowski, ISTA-DASLab et AtomicChat

Dans les commentaires

Débat restreint et partagé : certains testeurs rapportent des écarts significatifs avec les chiffres annoncés (notamment sur Vulkan/AMD), tandis que d'autres confirment les performances indiquées. Deux rapports incompatibles suggèrent des variations réelles selon la plateforme ou la méthode de test.

  • Un testeur sur AMD GC (Vulkan) affirme que le modèle n'est pas plus rapide que Unsloth, contredisant les graphiques présentés.
  • Un autre sur RTX 7900XTX rapporte 30 tok/s avec le draft model et 60 tok/s en MTP, ce dernier étant plus correct (test avec MikroTik CRS312 : la source obtient une réponse juste avec MTP, fausse avec le draft).
  • Un utilisateur sur Strix Halo rapporte 600 tokens/s en préfill et 30 en génération avec MTP, mais trouve DFlash2 anormalement lent (<10 tok/s).
  • Un commentaire pointe que l'article « a mal vieilli », avec lien vers un autre fil HN sans contexte fourni.
  • Peu de débat substantiel au-delà de ces rapports de performance terrain : aucune critique des méthodologie de benchmark, pas d'objection méthodologique générale.

Alternatives citées : Unsloth (Dynamic v3), Bartowski, ISTA-DASLab (GSQ-RCO), Prism-ML Ternary Bonsai 2, AtomicChat

Notre lecture

Les quantifications ShapeLearn semblent techniquement solides sur papier et le site de ByteShape offre une ressource transparente : benchmarks détaillés sur six GPU, comparaisons multiples, recommandations claires. Cependant, les divergences observées dans les commentaires (notamment sur Vulkan/AMD, et un problème d'exactitude du draft model) suggèrent que les résultats réels dépendent fortement de la plateforme et du contexte. Pour une équipe d'inférence locale, l'intérêt réside dans la clarté des mesures et la disponibilité des modèles (GPU-4 comme point d'entrée léger reste pertinent), mais valider les chiffres sur son propre matériel avant un déploiement en production est indispensable. Pas de blocage identifié, mais pas de garantie non plus.

Le brief, dans votre boîte mail

Recevez chaque jour la sélection et l'analyse La Lettre IT, sans avoir à repasser sur le site.

  • Un email par jour, synthèse de ce qui compte réellement sur Hacker News
  • Le débat technique décrypté, pas juste résumé, et ce que La Lettre IT en pense
  • Zéro spam, désabonnement en un clic sur chaque email
Ajouter à mes sources préférées Google