Tests de la rédaction
Notre méthodologie pour comparer les modèles sur des tâches identiques — et un point de transparence sur l'état d'avancement réel de ces tests.
Le protocole que nous comptons appliquer
Un problème identique
Le même énoncé mathématique, le même texte à résumer, le même extrait de code à corriger, la même image à analyser, soumis à chaque modèle dans des conditions aussi comparables que possible (même formulation, même température par défaut).
Une grille de lecture explicite
Des critères annoncés à l'avance plutôt que déduits après coup — exactitude, complétude, clarté, respect des contraintes de l'énoncé — pour limiter le biais de confirmation dans l'évaluation.
Une distinction stricte avec les benchmarks officiels
Nos résultats, quand ils existent, sont présentés comme des observations éditoriales sur un nombre volontairement limité de cas, pas comme une évaluation statistique représentative au sens des benchmarks académiques (voir notre page dédiée).
Une transparence sur les résultats bruts
Lorsqu'un test de rédaction est publié, les réponses complètes des modèles testés seraient présentées, pas seulement notre conclusion — pour permettre au lecteur de se faire son propre avis, en accord avec la distinction entre fait et opinion développée sur notre page Avis et opinions.
Comprendre notre signature éditoriale
Comment nous distinguons le fait, l'analyse et l'opinion sur l'ensemble du site.
Avis et opinions →