Aller au contenu
La Lettre IT
Retour aux synthèses
3 min de lecture
IA & modèles

Qwen 3.8 Omni Flash : performances comparables à Gemini avec un coût divisé par 10

En bref

  • Alibaba publie Qwen 3.8 Omni Flash, un modèle multimodal (texte, audio, vidéo) aux performances audio et visuelles proches ou supérieures à Gemini 3.8 Flash.
  • Le tarif est drastiquement inférieur : 0,15-0,47 dollar par million de tokens contre 1,5-9 dollars pour Gemini.
  • Le modèle n'est disponible que via Alibaba Cloud, sans version de poids publics communiquée.

Ce que dit la source

Alibaba affirme que Qwen 3.8 Omni Flash atteint des performances audio-visuelles comparables ou supérieures à celles de Gemini 3.8 Flash, tout en proposant un prix environ 10 fois inférieur selon les estimations partagées dans le fil. L'entreprise positionne ce modèle comme une alternative économique aux solutions multimodales de Google, particulièrement attractif pour les tâches nécessitant audio, vidéo et texte.

  • Le modèle supporte l'audio et la vidéo en entrée directe, avec une capacité multilingue revendiquée
  • Tarification Qwen : 0,15 dollar par million de tokens en entrée, 0,47 en sortie, contre 1,5-9 dollars pour Gemini selon les estimations du fil
  • Disponibilité limitée à Alibaba Cloud avec des plans de tokens jugés "restrictifs" par les commentateurs
  • Les performances audio dépasseraient Gemini 3.8 Flash selon Alibaba, mais sans benchmark indépendant fourni
  • Un dépôt GitHub pour le harness d'évaluation a apparemment été supprimé peu après l'annonce

Dans les commentaires

Débat mitigé : intérêt pour le rapport coût-performance (point récurrent), mais fortes réserves sur la disponibilité limitée, l'absence de poids publics, et la difficulté à vérifier les prétentions de performance. La présentation web elle-même cristallise la frustration (site lent, figures illisibles, vidéos peu informatives).

  • Plusieurs commentateurs soulignent l'absence de poids publics : le modèle ne peut être utilisé que via l'API Alibaba Cloud, contrairement aux modèles ouverts de la concurrence.
  • Le site d'annonce pose problème (ralentissements, téléchargements automatiques de gros fichiers vidéo non consentis, figures trop petites), ce qui entache la crédibilité de la communication technique.
  • L'absence de benchmarks indépendants laisse les prétentions d'égalité/supériorité audio-visuelles invérifiées : c'est du marketing sans preuve tierce.
  • Un commentateur note que le dépôt d'évaluation a été supprimé rapidement, ce qui renforce la méfiance.
  • Nomenclature confuse des variantes (Flash, Pro, Ultra, Max) sans schéma de versioning clair, frustrant pour les utilisateurs cherchant à faire un choix.

Alternatives citées : Claude (Anthropic), Gemini (Google), modèles open-source via Hugging Face, alternatives d'inférence multimodales à bas coût non précisées dans les commentaires.

Notre lecture

Le coût-performance est réellement attractif pour des use cases bien définis (traitement audio/vidéo, langues autres que l'anglais, budgets limités). Mais cette annonce reste un coup marketing sans substance vérifiable : pas de poids publics, pas de benchmarks externes, et une disponibilité verrouillée. Utile à tester si vous avez déjà un contrat Alibaba Cloud et besoin spécifique en multimodal ; sinon, attendre des validations tierces ou des alternatives plus ouvertes (Claude, Gemini, ou modèles open-source) reste prudent. Le cadrage géopolitique sous-jacent (modèles fermés chinois vs. écosystème US) mérite attention, mais ne change pas le jugement technique immédiat.

Le brief, dans votre boîte mail

Recevez chaque jour la sélection et l'analyse La Lettre IT, sans avoir à repasser sur le site.

  • Un email par jour, synthèse de ce qui compte réellement sur Hacker News
  • Le débat technique décrypté, pas juste résumé, et ce que La Lettre IT en pense
  • Zéro spam, désabonnement en un clic sur chaque email
Ajouter à mes sources préférées Google