Xiaomi Mimo 2.6 : un dashboard de formation IA en direct, contre l'opacité des géants
En bref
- Xiaomi expose en direct le processus d'entraînement de son modèle Mimo 2.6 via un dashboard public montrant les coûts, la progression et les benchmarks en temps réel.
- Le modèle précédent (Mimo 2.5) offrait un bon rapport coût/performance selon les utilisateurs, approchant la qualité des modèles Anthropic pour une fraction du prix.
- Cette transparence contraste radicalement avec l'opacité des géants américains comme OpenAI et Anthropic, ce qui relève des questions sur les stratégies commerciales et la confiance.
- Le score DeepSWE 1.1 (19%) situe Mimo 2.6 derrière les meilleurs modèles de codage actuels (Fable 70%, Astra 74%), mais bien au-delà des versions antérieures.
Ce que dit la source
Xiaomi déploie un dashboard public de formation en direct pour Mimo 2.6, affichant les coûts d'entraînement cumulés (~1,2 M$ selon les commentaires), la vitesse de progression, et les résultats de benchmarks mis à jour en temps réel. L'entreprise présente cette approche comme une forme de transparence radicale face à l'opacité des géants technologiques américains.
- Mimo 2.5, la version précédente, s'est imposée chez certains développeurs comme une alternative attrayante : très bas coût d'inférence, qualité comparative aux modèles Anthropic mid-2024, avec le principal reproche d'être parfois trop conservateur et peu doué pour les tâches multi-étapes complexes.
- Le nouveau modèle (Mimo 2.6) montre une progression nette sur le multi-tasking et la conception, générant des solutions moins minimalistes et mieux avisées sur les étapes suivantes d'un projet, toujours à faible coût selon un utilisateur qui teste.
- Mimo 2.6 obtient 19% sur DeepSWE 1.1, bien derrière Fable (70%), Astra (74%), Kimi K3 (69%), ce qui le classe en-dessous de la frontière actuelle des meilleurs agents de codage, malgré une progression par rapport aux versions antérieures.
- Le coût d'entraînement cumulé s'élève à environ 1,2 M$ selon les commentaires, avec une vitesse rapportée à 5 $/seconde, permettant un entraînement très accéléré par rapport aux standards de l'industrie (un développeur note que le timeline de formation semble anormalement court).
- Les données d'entraînement contiendraient environ deux tiers de code source, un ratio inusitement haut pour un modèle généraliste.
- Le dashboard expose le date/heure de démarrage (2026-09-15 10:32 UTC selon un commentaire), suggérant une formation lancée récemment avec une visibilité en direct sur la progression.
Dans les commentaires
Débat partagé, centré sur la transparence plutôt que la performance : les commentaires saluent l'audace d'afficher en public l'entraînement d'un modèle frontier, contrastant avec le secret des labs américains, mais reconnaissent aussi que Mimo 2.6 reste en-dessous de la frontière actuelle en termes de coding benchmarks. Peu de débat substantiel sur la viabilité technique ou commerciale de cette approche.
- Plusieurs commentateurs relèvent que Mimo 2.6 score 19% sur DeepSWE, loin derrière les meilleurs (70%+ pour Fable et Astra), ce qui tempère l'enthousiasme malgré la transparence affichée.
- Une objection sur la contamination des benchmarks : exécuter des tests publics pendant la formation pourrait biaiser les résultats de benchmarking et violer l'intégrité des évaluations de modèles.
- Doutes sur la durée réelle d'entraînement rapportée par le dashboard : un développeur note que la timeline (quelques semaines seulement d'après la progression visible) semble anormalement courte par rapport aux standards du training de modèles frontier.
- L'absence de détails sur les ressources matérielles utilisées (types de GPU/TPU, MFU metrics) limite la capacité à évaluer si le coût rapporté est réellement compétitif ou s'il masque des optimisations non reproducibles.
- La question inverse : pourquoi d'autres acteurs (IBM pour Granite, Google pour Gemini) ne font-ils pas la même transparence, alors que cela pourrait être un argument commercial fort ? Suggère que soit ce n'est pas viable, soit cela révèle des informations sensibles.
Notre lecture
L'initiative est intéressante pour deux raisons distinctes : d'abord, elle remet en question le modèle commercial fermé dominant (le secret offrait un avantage, mais Xiaomi le sacrifie pour gagner la confiance des utilisateurs de modèles) ; ensuite, elle expose un modèle qui, malgré sa transparence, reste techniquement en-dessous des meilleurs agents de codage actuels. Pour les équipes cherchant des modèles de codage performants, Mimo 2.6 n'est pas une frontière. Pour celles évaluant des alternatives coûteuses, la version 2.5 a déjà prouvé son utilité en production à bas coût, et 2.6 pourrait l'être aussi. La vraie question n'est pas technique : c'est si cette transparence devient un standard (et force les autres à faire pareil) ou si elle reste une anomalie marketing. À surveiller pour l'effet qu'elle aura sur les pratiques de la concurrence.