AccueilScienceLes IA peuvent...

Les IA peuvent être stables… et pourtant se tromper

L’exercice est bien rodé. A chaque fois qu’OpenAI, Google ou Anthropic lancent une nouvelle version de GPT, Gemini ou Claude, l’annonce est accompagnée de résultats de performances obtenus lors de tests standardisés (SuperGlue, MMLU, SWE-Bench, ARC-AGI…). Plus connus sous le nom de « benchmarks », ces tests mesurent les capacités des modèles de langues (LLM) à résoudre des problèmes, à raisonner ou à coder, leur maîtrise d’une langue, leurs réponses à des QCM multidisciplinaires, etc. Pour des résultats régulièrement époustouflants.

Pourtant, les limites de ces mesures ne manquent pas, sans compter que certains modèles sont soupçonnés d’avoir être optimisés spécialement pour passer les tests et diffèrent de la version livrée au public (OpenAI et Meta ont été pointés du doigt). Ces tests ont aussi l’inconvénient de n’évaluer que ce qui sort des modèles à un moment donné.


Source:

www.sciencesetavenir.fr

Articles similaires

Annonce publicitairespot_img