Aller au contenu
La Lettre IT
Retour aux synthèses
3 min de lecture

Les modèles IA saturent déjà les benchmarks de physique, révèle une re-correction d'experts

En bref

  • Une étude menée par des physiciens de Yale réexamine six benchmarks de physique largement utilisés en découvrant que la plupart des erreurs attribuées aux modèles proviennent en réalité de graders défaillants, de solutions de référence incorrectes ou de questions mal posées.
  • Après re-correction par des experts, GPT-5.6-Sol passe de 47,3 % à 78,7 % sur HLE-Physics et de 61,0 % à 87,2 % sur CMT-Benchmark.
  • Ces corrections révèlent que les modèles de frontière ont quasiment saturé ces évaluations fermées, soulevant la question de l'inadéquation des benchmarks actuels à évaluer les capacités réelles.

Ce que dit la source

L'article conteste l'impression dominante selon laquelle les modèles de frontière échouent sur la physique avancée. Les auteurs affirment que les scores bas rapportés dans les benchmarks majeurs ne reflètent pas les expériences des experts utilisant ces modèles en pratique. En réexaminant les évaluations avec le concours de physiciens et de chercheurs spécialisés, l'équipe constate que la majorité des réponses marquées comme incorrectes souffrent de défauts d'évaluation (erreurs du grader, solutions de référence erronées, énoncés ambigus) plutôt que de failles dans le raisonnement physique du modèle.

  • GPT-5.6-Sol atteint 94,4 % de pass@4 sur les 54 challenges CritPt conservés après correction, contre des scores bruts bien plus faibles
  • L'étude couvre six benchmarks : HLE-Physics, CMT-Benchmark, UGPhysics, PRISM-Physics, PHYBench et CritPt
  • Les experts ont distingué les véritables erreurs du modèle des problèmes d'évaluation en examinant les énoncés, les solutions de référence et les réponses du modèle
  • La correction des solutions de référence et l'exclusion des questions imprécises ou mal posées ont produit des augmentations drastiques de performance mesurée
  • L'étude pointe la quasi-saturation des tâches fermées actuelles, suggérant un besoin urgent d'évaluations plus exigeantes et validées par des experts

Dans les commentaires

Débat partagé : reconnaissances que l'étude soulève des questions légitimes sur la fiabilité des benchmarks, mais scepticisme substantiel sur ce que cela signifie réellement pour la compréhension physique des modèles.

  • Un physicien formé conteste l'exemple central du papier (tension dans une corde autour de sphères), relevant que l'énoncé est sous-spécifié et que la réponse de référence est probablement physiquement inexacte ou repose sur des hypothèses implicites non défendables (absence de friction sélective, configuration géométrique jamais clarifiée). Il conclut que l'amélioration des scores pourrait simplement refléter un meilleur apprentissage du benchmark plutôt qu'une meilleure compréhension physique.
  • Plusieurs commentateurs émettent l'hypothèse qu'une re-correction par des experts pourrait mesurer surtout la capacité des modèles à reproduire ce qui figure dans les énoncés et solutions d'entraînement, sans refléter une compréhension physique véritable : objection du « Chinese Room ».
  • Un commentaire signale que même des systèmes agentic (censés résoudre des conjectures mathématiques ouvertes) n'ont pas résolu un seul problème ouvert en physique théorique, suggérant une limite structurelle au-delà de problèmes fermés et bien définis.
  • Peu de débat sur les implications pratiques ou les étapes suivantes : aucun consensus sur ce que ces scores corrigés impliquent pour l'usage réel des modèles en physique.

Notre lecture

L'étude soulève un point valide : de nombreux benchmarks d'IA souffrent d'erreurs d'annotation, ce qui brouille la mesure des progrès réels. Cependant, la question centrale reste ouverte : une meilleure performance sur des énoncés mal posés mais une fois « nettoyés » témoigne-t-elle d'une compréhension physique, ou d'une meilleure mémorisation de patterns textuels ? Le commentaire du physicien sur la corde et les sphères illustre bien ce risque : corriger une question mal posée ne la rend pas physiquement saine pour autant. Le constat de quasi-saturation sur les tâches fermées est important pour la recherche en LLM (cela justifie des benchmarks plus exigeants), mais la conclusion sur la « vraie » capacité physique des modèles dépend de ce qu'on définit comme compréhension. À surveiller : les prochains benchmarks que l'équipe proposera pour dépasser ce plafond.

Le brief, dans votre boîte mail

Recevez chaque jour la sélection et l'analyse La Lettre IT, sans avoir à repasser sur le site.

  • Un email par jour, synthèse de ce qui compte réellement sur Hacker News
  • Le débat technique décrypté, pas juste résumé, et ce que La Lettre IT en pense
  • Zéro spam, désabonnement en un clic sur chaque email