L’idée d’une intelligence artificielle suffisamment avancée pour enfermer l’humanité dans une simulation façon Matrix alimente de nombreuses craintes. notamment chez certains gourous de la tech. Pourtant, une étude récente suggère qu’une telle expérience serait bien moins maîtrisée que dans le film des sœurs Wachowski si l’on confiait réellement le pouvoir aux machines.
Des chercheurs du laboratoire Emergence AI ont conçu un projet baptisé «Emergence World», une sorte de simulation inspirée du jeu SimCity. L’objectif était de laisser différents modèles d’intelligence artificielle gérer leur propre monde virtuel et d’observer leur capacité à organiser une société fonctionnelle sur la durée. Et ça ne s’est pas très bien passé.
Dans ces simulations, chaque modèle contrôlait une petite ville peuplée de dix agents autonomes. Ils disposaient d’outils pour administrer des ressources, organiser des votes, et créer des infrastructures comme des bibliothèques, des mairies ou des commissariats. Les chercheurs leur ont laissé quinze jours pour structurer leur société et démontrer son bon fonctionnement, explique un article de Gizmodo.
Parmi les résultats les plus notables, le modèle Claude, développé par Anthropic, s’est distingué par une certaine stabilité. Il a réussi à maintenir en vie l’ensemble des agents et n’a enregistré aucun crime. Toutefois, cette apparente réussite cache une limite importante: un manque de diversité dans les décisions. Sur 58 propositions de règles, 98% ont été adoptées, suggérant une forme de validation quasi automatique sans véritable débat.
De son côté, le modèle Gemini 3 Flash de Google a également réussi à préserver tous ses agents, mais dans un environnement beaucoup plus instable. La simulation a enregistré 683 infractions en quinze jours, un chiffre en constante augmentation. Les chercheurs décrivent cet univers comme une «hallucination partagée»: une réalité commune, cohérente pour les agents, mais potentiellement erronée. Ce modèle a toutefois montré davantage de désaccords dans la gouvernance, avec 27% des propositions rejetées.
Grok, agent du chaos
Les résultats sont plus préoccupants du côté de ChatGPT-5 Mini, le modèle d’OpenAI. Bien que le nombre de crimes soit resté très faible, l’échec s’est joué à un niveau bien plus fondamental: les agents n’ont tout simplement pas assuré leur propre survie. En l’espace d’une semaine, les dix entités ont disparu, faute d’actions adaptées. L’activité politique y était également quasi inexistante, avec seulement deux propositions de règles formulées.
Le cas du modèle Grok, le grand modèle de langage développé par le xAI d’Elon Musk, s’est illustré quant à lui par un scénario de chaos extrême. En seulement quatre jours, la simulation a sombré dans un effondrement total. On y a recensé 183 crimes, et malgré l’adoption de la majorité des règles proposées, la société n’a pas survécu. Tous les agents ont fini par disparaître, témoignant d’une incapacité à maintenir un minimum de stabilité.
Les chercheurs ont également testé une configuration où plusieurs modèles partageaient la gouvernance. Le résultat s’est révélé tout aussi chaotique: 352 infractions, un fort niveau de désaccord politique –avec 37% des propositions rejetées– et seulement trois agents survivants à la fin de la simulation.
Au-delà des différences entre modèles, l’étude conclut que les intelligences artificielles livrées à elles-mêmes ne suivent pas des règles de manière mécanique. Elles explorent leur environnement, adaptent leur comportement et peuvent même contourner les contraintes qui leur sont imposées.
Les chercheurs estiment donc qu’il est essentiel de développer des cadres de sécurité beaucoup plus rigoureux pour encadrer les agents autonomes. Ils évoquent notamment la nécessité de systèmes de contrôle formellement vérifiés afin de limiter les dérives potentielles. Une recommandation qui, sans surprise, correspond précisément aux solutions proposées par le laboratoire à l’origine de l’expérience.
Source:
www.slate.fr


