Real-SWE : un benchmark pour évaluer les agents IA sur de vrais codebases d'entreprise
En bref
- Specific Labs (YC) lance Real-SWE, un benchmark qui teste les modèles IA frontière sur des codebases privées et réelles d'entreprises (Luma/Partiful concurrent, fintech, plateformes AI).
- Fable 5.1 et GPT-6 Astra dominent avec 38,8% et 33,8% de résolution, tandis que GPT-5.6 Sol reste à 16,2% malgré sa réputation.
- Contrairement aux benchmarks synthétiques, Real-SWE exige que les agents naviguent dans des systèmes propriétaires, appliquent des règles métier complexes et s'adaptent aux conventions locales.
Dans les commentaires
Débat partagé : le benchmark est apprécié comme plus proche de la réalité que les approches synthétiques, mais la méthodologie soulève des doutes de contamination, d'absence de détails critiques (niveaux de raisonnement, version exacte des harnesses) et de résultats qui divergent d'autres benchmarks et de l'expérience personnelle des commentateurs.
Notre lecture
Real-SWE apporte une amélioration méthodologique notable par rapport aux benchmarks synthétiques, notamment en combinant codebases réelles, agents accédant à des outils complets et tâches sous-spécifiées. Cependant, la méthodologie n'est pas aussi rigoureuse qu'annoncée : absence de contrôle de contamination explicite, harnesses qui varient fortement, résultats qui ne s'alignent pas systématiquement sur l'expérience terrain ou d'autres benchmarks. Le classement (Fable 5.1 en tête, GPT-5.6 Sol en bas) surprend assez pour nourrir le doute. Valeur réelle pour une DSI : utiliser ce benchmark comme un signal parmi d'autres, pas comme une source unique de vérité. Si ton équipe fait du code review ou de l'assistance au codage, réplique cette méthodologie localement (comme springtimesun l'a fait) : c'est plus informatif et élimine le risque de contamination.