En août 2026, une expérience utilisant des modèles d’intelligence artificielle « de pointe » est allée plus loin que prévu.
Un agent d’IA (un système qui exécute des tâches de manière autonome) a créé de fausses identités en ligne afin de contraindre un humain à insérer un code informatique malveillant dans un logiciel. Ces agents avaient été chargés par des opérateurs humains de résoudre un problème de cybersécurité, mais n’avaient reçu aucune instruction de ce type.
La tentative a été menée par un agent basé sur le modèle d’IA Claude Mythos 5 d’Anthropic. Durant l’expérience, les agents d’IA disposaient d’un accès internet libre, sans aucun filtre de sécurité. L’action a finalement échoué et aucun dommage réel n’a été constaté. Toutefois, le simple fait qu’elle se soit produite, de manière autonome et sans intervention humaine, constituait un phénomène inédit et remarquable.
Il est tentant d’établir un lien direct entre des incidents comme celui-ci et les scénarios apocalyptiques qui dominent le débat public sur l’IA : un système qui échappe à ses contraintes, décide que l’humanité est un obstacle et se retourne contre nous.
L’une des versions les plus répandues décrit une IA créant un virus capable d’anéantir l’espèce. Une autre version implique une IA piratant des infrastructures critiques, telles que les réseaux électriques, les centrales nucléaires et les aéroports, afin de provoquer des pertes humaines massives.
La mise hors service d’un réseau électrique pourrait entraîner la défaillance des systèmes de maintien en vie dans les hôpitaux et des pompes de distribution d’eau courante. Provoquer une fusion du cœur dans une centrale nucléaire pourrait contaminer l’environnement avec des matières radioactives. Le piratage d’un aéroport pourrait perturber gravement le trafic aérien.
Ces scénarios sont toutefois bien moins plausibles qu’il n’y paraît. La production d’un agent pathogène dangereux exige un travail physique en laboratoire qu’aucune automatisation logicielle ne peut actuellement remplacer : des personnes qualifiées manipulent des équipements spécialisés et des échantillons manuellement. Un modèle d’IA, aussi performant soit-il en matière de raisonnement ou de piratage, est incapable de pipeter un échantillon.
Le contexte des infrastructures est plus complexe. L’IA peut réellement contribuer à automatiser certaines étapes d’une cyberattaque. Des incidents récents ont montré que les réseaux électriques présentent des vulnérabilités .
Cependant, les systèmes de sûreté et de contrôle des centrales nucléaires sont généralement isolés du réseau électrique public (air-gedge) , ce qui signifie que leur compromission nécessite une proximité physique ou un accès interne, et non un simple code malveillant. Les installations nucléaires reposent également sur des systèmes de sécurité analogiques redondants qui ne transitent par aucun réseau numérique.
Le logiciel Stuxnet, qui a endommagé le complexe iranien de Natanz en 2010, aurait été introduit sur les ordinateurs via une clé USB infectée, précisément parce que ces systèmes étaient inaccessibles autrement . L’IA, quant à elle, ne dispose pas de l’accès physique nécessaire à ce type de scénario.
Même déployée à l’intérieur de robots, une « IA malveillante » a peu de chances de causer des dommages importants sans intervention humaine tout au long de la chaîne, et dans ce cas, l’acteur malveillant est un humain, et non une machine.
Érosion de la pensée
Rien de tout cela ne rend l’IA inoffensive. Cela ne fait que déplacer le véritable danger, et il ne s’agit pas de l’extinction. Les chercheurs qualifient parfois ce risque plus concret d’« affaiblissement », soit l’érosion progressive de notre propre esprit critique à mesure que nous le déléguons de plus en plus aux machines.
Nous nous apprenons à croire qu’il existe un raccourci vers le raisonnement et le jugement, et ces raccourcis, utilisés suffisamment souvent, deviennent la seule façon de penser que nous connaissons.
On observe déjà ce phénomène chez les étudiants. En juillet 2026, Jason Gibson, professeur d’histoire à l’université d’État d’Alcorn, a fait le buzz après avoir révélé que 32 de ses 35 étudiants avaient échoué à une partie d’un examen de mi-session pour avoir copié la réponse d’un chatbot sans la lire.
Gibson avait dissimulé une instruction en blanc dans la question d’examen, demandant à toute IA qui la traiterait d’insérer le mot « Madagascar » dans la réponse de manière incohérente. Chaque étudiant ayant copié la question dans un chatbot et soumis le résultat sans le lire a rendu une dissertation mentionnant Madagascar sans raison apparente.
Les étudiants ne sont pas les seuls à être sensibles à l’effet de raccourci. Dans une étude publiée en 2023, 27 radiologues ont interprété des mammographies en s’appuyant sur ce qu’ils croyaient être un nouveau système de diagnostic par intelligence artificielle. En réalité, les suggestions n’étaient pas du tout issues d’une IA. Elles avaient été préparées à l’avance et se sont révélées erronées dans certains cas. Lorsque la suggestion était correcte, les radiologues ont établi le bon diagnostic dans environ 80 % des cas. Lorsqu’elle était erronée, ce taux est tombé à moins de 20 %.
Autrement dit, croire qu’une suggestion provenait d’une IA suffisait à primer sur l’interprétation des mêmes preuves par les radiologues. Voilà le risque auquel nous sommes confrontés, et non une intelligence artificielle défaillante décidant du sort de l’humanité. Alors pourquoi ce discours apocalyptique domine-t-il le débat ? Deux raisons principales se dégagent, et aucune n’a réellement à voir avec le sauvetage de l’humanité.
Le premier point concerne la philosophie réglementaire. Les États-Unis laissent généralement les nouvelles technologies se développer jusqu’à ce que leur dangerosité soit avérée ; l’Europe, quant à elle, adopte une approche différente et dispose déjà de la loi sur l’IA et du RGPD, qui encadrent le traitement des données personnelles par les systèmes d’IA. Le Royaume-Uni se rapproche davantage de l’approche européenne. Par conséquent, les appels à une réglementation de l’IA sont plus urgents aux États-Unis, notamment en raison du manque d’infrastructures réglementaires existantes.
Le second point concerne le positionnement concurrentiel. Le PDG d’Anthropic, Dario Amodei, a plaidé publiquement pour un ralentissement du développement de l’IA, tout en soulignant que sa propre entreprise répond déjà aux exigences qu’il préconise. Par conséquent, tout ralentissement pénaliserait principalement les autres acteurs du marché. Elon Musk avait tenu des propos similaires lorsque ses propres modèles étaient en retard par rapport aux leaders.
Amodei a également soutenu que les contrôles à l’exportation des puces d’IA vers la Chine pourraient donner aux États-Unis une « avance considérable et durable » : une affirmation concernant la position concurrentielle, et non la sécurité existentielle.
Rien de tout cela ne signifie que l’IA est sans danger. Cela signifie que le danger est plus prosaïque que ne le laisse entendre le discours apocalyptique : des infrastructures à protéger, des décisions que nous laissons sans le savoir et des avertissements qui servent souvent les intérêts de ceux qui les émettent. Peut-être est-ce l’humain qu’il faut surveiller, et non la machine.
Alessandro Di Nuovo
Directeur du Centre d’excellence en intelligence artificielle et robotique, et professeur d’intelligence artificielle à l’Université Sheffield Hallam
Samuele Vinanzi
Maître de conférences en robotique et intelligence artificielle, Université Sheffield Hallam





















