L’IA de Google aussi a passé sa thèse l’année dernière. Lors de la présentation de Gemini 3, en novembre 2025, le public pouvait lire dans un communiqué que le modèle « fait preuve d’un raisonnement de niveau doctorat « . Et, là encore, les prouesses de l’IA dans diverses épreuves servent d’arguments pour appuyer cette déclaration.
Ces tests, plus communément appelés « benchmarks », mesurent les capacités d’un LLM dans un domaine ou une tâche spécifique comme la résolution de problèmes logiques, l’extraction d’information ou l’ingénierie logicielle. Aussi variées soient-elles, ces évaluations expriment, pour la plupart, un résultat sous la forme d’un score, idéal pour dresser le classement des meilleures IA. Les entreprises développant des modèles de langage ont ainsi la possibilité de démontrer la supériorité de leur système sur la concurrence auprès du public et des investisseurs.
Lire aussiRetrait d’une étude phare sur les bienfaits de ChatGPT dans l’enseignement
Le score devient un objectif en soi
Sur son blog, le chercheur Sebastian Raschka définit le mot de l’année 2025, qu’il a choisi pour qualifier la trajectoire prise par le développement des LLM : le « benchmaxxing ». C’est-à-dire « un fort accent sur l’amélioration des chiffres du classement, parfois au point où le score devient un objectif en soi « . En faisant d’un nombre la finalité, les laboratoires d’IA « ne se soucient pas des mécanismes sous-jacents à son origine », analyse Melanie Mitchell, chercheuse à l’Institut de Santa Fe (États-Unis). Et ces rouages dissimulent bien des biais.
Certains paramètres de l’IA lors de l’exécution d’un benchmark, par exemple, peuvent affecter les résultats de manière considérable selon Zerui Cheng, doctorant à l’université de Princeton (États-Unis) et chercheur en intelligence artificielle. « La formulation du prompt, le degré de ‘créativité’ autorisé au modèle, ses instructions système ou la conception du code qui extrait sa réponse », énumère-t-il. Mais, pour lui, l’IA peut être optimisée pour mieux réussir ces tests.
Plus précisément, la littérature scientifique évoque souvent le « surapprentissage », soit lorsqu’un LLM donne une réponse juste grâce à ses données d’entraînement, mais que ces données ne lui permettent pas d’appliquer ses connaissances à un problème aux paramètres différents. « Si un modèle est entraîné à partir de photos de chiens à poil blanc, il pourrait en déduire que le ‘poil blanc’ définit ce qu’est un chien. Si on lui présente ensuite une photo, absente des données d’entraînement, d’un chien à poil noir, il dira que ce n’est pas un chien », illustre Melanie Mitchell.
Dans les cas plus graves, le modèle mémorise la formulation exacte des questions posées par un benchmark et de leur réponse respective. « Si vous posez une question qui sort du cadre mais qui vise à évaluer la même compétence, le système ne sera pas en mesure d’y répondre, car il ne l’a pas mémorisée », explique la chercheuse. Ce problème est en lien direct avec un autre phénomène documenté, la contamination.
En février 2026, OpenAI annonçait cesser d’utiliser SWE-bench Verified, un test qui jauge les capacités d’un LLM à analyser et modifier du code informatique. L’entreprise observe que GPT5.2 a incorporé les solutions aux exercices soumis par SWE-bench Verified dans son corpus d’entraînement, celles-ci étant en accès libre. L’évaluation perd alors tout intérêt, mais encore faut-il se rendre compte de cette « contamination » pour le savoir ! Or, c’est un problème « largement répandu » parmi les benchmarks, selon Zerui Cheng, et c’est une des raisons pour lesquelles « les tests qui prétendent mesurer le ‘raisonnement’ ou l »intelligence générale’ mesurent en réalité la mémorisation de données ». Dans une étude « pré-print » (non relue par les pairs) de septembre 2025, à laquelle il a grandement contribué, le chercheur présente une plateforme collaborative, PeerBench, afin de remédier à ces problèmes avec des épreuves conçues et renouvelées régulièrement par ses utilisateurs.
Pour se prémunir des nombreux autres biais, il faut, en revanche, revoir la conception et l’approche même derrière les benchmarks. Melanie Mitchell s’attardait sur le sujet dans une présentation donnée à la conférence internationale NeurIPS 2025. Elle y mentionnait notamment un préprint d’octobre dernier sur le test ARC-AGI 1, lequel mesure la capacité d’un LLM à mobiliser des concepts abstraits comme la position d’un objet dans l’espace ou la symétrie. L’épreuve consiste à soumettre une grille remplie de carrés colorés à l’IA, pour qu’elle la transforme selon une règle qu’elle peut déduire à partir d’exemples d’autres grilles. Après la résolution de plusieurs puzzles, le système se voit attribuer un pourcentage de réussite en fonction du nombre de bonnes réponses.
Lire aussiElon Musk perd son procès contre Sam Altman et OpenAI, créatrice de ChatGPT
La capacité de l’IA à raisonner est surrestimée
Melanie Mitchell et son groupe de recherche ont soumis à plusieurs modèles une version simplifiée de ce benchmark avec une exigence supplémentaire : formuler la règle sous-jacente qui permet de résoudre le puzzle. Or, lorsque l’IA fournit une grille correcte, elle échoue à cet exercice dans 30 % des cas. Soit parce qu’elle énonce une règle fausse, soit parce qu’elle décrit la logique à suivre sans faire référence aux concepts abstraits que le bench-mark doit mesurer. L’étude conclut ainsi que l’épreuve et son score de précision surestiment la capacité de l’IA à raisonner. Mais cela peut aussi conduire à une sous-estimation, car ce seul indicateur occulte des contraintes externes qui peuvent atténuer les performances des LLM.
Il se trouve que pour ARC-AGI, les modèles s’en sortent bien mieux s’ils traitent le puzzle non pas sous la forme d’une image, mais d’un tableau avec des chiffres, correspondant chacun à une couleur. La chercheuse note que, si ces systèmes échouent souvent à générer la bonne grille quand on leur impose l’analyse visuelle, ils parviennent parfois à formuler correctement la règle sous-jacente. Soit une preuve de raisonnement qu’ARC-AGI 1 ne mesure pas, puisqu’il se concentre sur la per formance seule. Ce biais, comme la contamination, affecte la justesse avec laquelle ces tests mesurent le phénomène général qu’ils prétendent évaluer.
Un préprint de novembre 2025 considère que sur 445 benchmarks passés au crible, 53 % sont discutables de ce point de vue. Ce travail, réalisé par 42 chercheurs de plusieurs universités, notamment celle d’Oxford, constate des problèmes cruciaux. Seuls 16 % prévoient des méthodes statistiques pour comparer les performances mesurées. « Cela signifie que les différences observées entre les systèmes pourraient être dues au hasard plutôt qu’à une réelle amélioration », selon l’Oxford Internet Institute, qui présente l’étude.
Pour Melanie Mitchell, l’évaluation de l’intelligence des LLM ferait bien d’adopter des réflexes communs dans la recherche consacrée à d’autres disciplines, comme la psychologie. « Il faut imaginer quelles stratégies l’IA pourrait employer pour résoudre les tâches du benchmark sans disposer de la capacité qu’il mesure, c’est-à-dire créer des expériences de contrôle pour remettre en question son hypothèse. Car c’est ça, la science », assène la chercheuse. « En psychologie, la conception de ce genre d’études contrôlées requiert une grande créativité. Je ne pense pas que ce soit suffisamment le cas dans le domaine de l’IA. Les gens se contentent d’accepter les scores comme preuves de capacités générales », ajoute-t-elle. Difficile toutefois de motiver les principaux acteurs du secteur, engagés dans une intense compétition, à remettre en question publiquement les performances de leurs modèles.
Une épreuve encore difficile pour l’IA
Considéré comme l’un des benchmarks les plus retors pour mesurer les progrès des grands modèles de langage, ARC-AGI franchit un cap avec sa troisième version, dévoilée le 27 mars. Ce test, conçu par le chercheur français François Chollet, soumet des énigmes visuelles uniques à l’IA pour évaluer ses capacités de raisonnement logique.
Cette nouvelle mouture d’ARC-AGI va plus loin. Les puzzles statiques laissent place à des mini-jeux interactifs sur une grille de pixels colorés. Étape par étape, l’IA doit explorer, manipuler des éléments, anticiper les effets d’une action et, plus largement, s’adapter à une situation nouvelle sans instructions ni connaissances préalables. Bien des modèles se sont heurtés à ARC-AGI 2 après son lancement en mars 2025.
GPT-5, par exemple, atteignait au mieux 10 % de bonnes réponses à sa sortie. La difficulté monte encore d’un cran avec ARC-AGI 3. Les premières tentatives de Google, d’OpenAI et d’Anthropic plafonnent à moins de 1 % de réussite, malgré une importante puissance de calcul. Un paramètre que le benchmark prend en compte afin de mesurer le rapport entre la performance d’un modèle et le coût de celle-ci. Ainsi, Anthropic a dépensé près de 9000 dollars pour un score de 0,5 % sur ARC-AGI 3.
Les tests ARC-AGI mesurent la capacité des modèles de langage à mobiliser des concepts abstraits. Dans la version 2 (ci-dessus) lancée en mars 2025, on voit que leurs résultats, très mauvais au départ, progressent de façon fulgurante en quelques mois. Crédit : BRUNO BOURGEOIS / SOURCE : CENTER FOR AI SAFETY
Source:
www.sciencesetavenir.fr


