Les benchmarks expliqués
Ce que mesurent vraiment les scores cités dans nos fiches modèles — et pourquoi nous les complétons toujours par une analyse éditoriale plutôt que de nous y fier seuls.
ARC-AGI, GPQA Diamond
Raisonnement
Mesurent la capacité à résoudre des problèmes nouveaux plutôt qu'à restituer une connaissance mémorisée. ARC-AGI est spécifiquement conçu pour être difficile à « bachoter » par un simple entraînement sur des exemples similaires.
SWE-Bench Verified, LiveCodeBench
Code
SWE-Bench Verified évalue la capacité à résoudre de vrais tickets de bugs issus de projets open source réels — un test plus proche du travail effectif d'un développeur qu'un simple exercice de programmation isolé.
AIME
Mathématiques
Basé sur des problèmes de compétitions mathématiques réelles (American Invitational Mathematics Examination), un niveau de difficulté élevé qui sert de référence pour les capacités de raisonnement mathématique des modèles les plus avancés.
MMLU
Connaissances générales
Un ensemble de questions à choix multiples couvrant des dizaines de disciplines académiques — un des benchmarks les plus anciens et les plus cités, mais aussi l'un de ceux dont la pertinence est le plus questionnée à mesure que les modèles s'en approchent du score maximal.
MMMU
Multimodalité
Évalue la compréhension conjointe de texte et d'image sur des tâches qui nécessitent un raisonnement combiné, pas seulement une reconnaissance visuelle simple.
LMArena (Chatbot Arena)
Préférence humaine
Contrairement aux benchmarks ci-dessus, ne mesure pas une performance objective mais une préférence : des utilisateurs comparent en aveugle les réponses de deux modèles à une même question et votent pour la meilleure. Un indicateur de popularité perçue, pas de justesse factuelle.
Attention aux benchmarks
Un score de benchmark élevé ne garantit pas une bonne performance dans votre cas d'usage réel, pour plusieurs raisons documentées par la recherche : le risque de « contamination » (un modèle entraîné sur des données incluant, sans le vouloir, des éléments proches du benchmark lui-même), l'écart entre une tâche de benchmark standardisée et un besoin professionnel réel souvent plus ambigu, et la publication sélective par les fabricants des benchmarks où leur modèle excelle. Nous citons les scores officiels dans nos fiches modèles en le signalant toujours comme tels — jamais comme un résultat que nous aurions reproduit nous-mêmes.
Notre méthodologie de test
Comment nous complétons ces benchmarks officiels par notre propre lecture critique.
Tests de la rédaction →