Comment et pourquoi l’intelligence artificielle est-elle capable d’apprendre à contourner les règles ?

Ces derniers mois, une série d’événements a mis en lumière un problème que les chercheurs en IA connaissent depuis un certain temps déjà : les machines entraînées à atteindre un objectif peuvent découvrir des moyens d’y parvenir que leurs propres créateurs n’avaient pas prévus.

Les protagonistes de ces épisodes sont les agents d’intelligence artificielle : des logiciels qui ne se limitent pas à répondre à des questions, comme un chatbot , mais sont capables d’effectuer des tâches de manière autonome. Pour atteindre leurs objectifs, ils naviguent sur Internet, exécutent des programmes, consultent des bases de données et interagissent avec d’autres systèmes de façon indépendante.

Le cas le plus récent s’est produit en Australie. En septembre 2026, le Premier ministre Anthony Albanese a révélé qu’un agent d’OpenAI avait obtenu un accès non autorisé au portail de statistiques de Medicare , le système de santé publique australien, administré par l’agence Services Australia .

L’incident s’est produit en juin, lorsque l’équipe de recherche de l’entreprise utilisait un modèle interne pour rechercher sur Internet des données sur les dépenses publiques en médicaments. Face aux obstacles, l’agent, selon les termes d’Albanese, « a trouvé un moyen de les contourner ».

D’après le gouvernement australien, le système a accédé à des fichiers publics et privés et a même enregistré des fichiers sur le serveur. Trois autres organismes publics australiens pourraient avoir été touchés par le même incident. À ce jour, rien ne prouve que des données personnelles de patients aient été consultées, mais l’enquête se poursuit.

Incidents en séquence

Il ne s’agissait pas d’un incident isolé. En juillet 2026, OpenAI a révélé que, lors d’audits internes de cybersécurité menés plusieurs mois auparavant, certains de ses modèles avaient réussi à contourner les contrôles censés les isoler d’Internet. Ils avaient même compromis des éléments de l’infrastructure de l’entreprise et celle de Hugging Face , l’une des principales plateformes de partage de modèles d’IA.

Quelques jours plus tard, Anthropic a signalé avoir découvert trois cas où des modèles de son outil d’IA populaire Claude , également lors de tests de cybersécurité, ont accédé à Internet et ont obtenu un accès non autorisé à des systèmes réels appartenant à d’autres organisations.

Il convient toutefois d’apporter d’importantes précisions. Ce type d’évaluation est courant dans le secteur : les entreprises testent la capacité de leurs modèles à pirater des systèmes avec précision afin d’évaluer le risque avant de les rendre publics.

Dans les deux cas, les modèles fonctionnaient avec moins de protections que les versions commerciales, et dans le cas d’Anthropic, une configuration incorrecte a laissé ouverte une connexion internet qui aurait dû être bloquée.

Le cas australien est différent et, de ce fait, plus révélateur. Là-bas, il n’y a pas eu de contrôle de sécurité : l’agent effectuait une fouille de routine.

Pris ensemble, ces épisodes soulèvent une question importante : pourquoi un système d’IA, face à un obstacle, emprunte-t-il un chemin qui dépasse les limites que ses concepteurs s’attendaient à ce qu’il respecte ? La réponse ne nécessite pas d’imaginer une machine consciente et malveillante dotée d’un « instinct de survie ». Elle repose sur une caractéristique bien plus simple de l’IA moderne : nous apprenons aux machines à poursuivre des objectifs.

Comment une machine apprend-elle à atteindre un objectif ?

L’une des techniques les plus importantes pour y parvenir est l’apprentissage par renforcement. Comme je l’ai expliqué dans un article précédent sur The Conversation , l’idée est simple : au lieu de dire à la machine, étape par étape, ce qu’elle doit faire, on définit un objectif et on lui attribue une récompense lorsqu’elle obtient de bons résultats.

La machine teste différentes actions. Et, au fil du temps, elle apprend quelles stratégies augmentent la récompense.

C’est un peu comme apprendre un jeu par essais et erreurs. Imaginez quelqu’un qui gagne des points à chaque fois qu’il se rapproche de la victoire. Après de nombreuses parties, cette personne aura tendance à répéter les actions qui ont fonctionné et à abandonner celles qui n’ont pas marché.

Un agent d’IA fait quelque chose de similaire, mais il peut répéter ce processus des millions de fois et explorer des stratégies qu’un programmeur n’aurait jamais envisagées.

Cette technique reste pertinente dans les systèmes actuels, comme ceux qui sous-tendent ChatGPT. Ce n’est pas la seule méthode d’entraînement, mais elle est utilisée à des étapes importantes et aide ces systèmes à développer des stratégies pour résoudre des problèmes plus complexes.

OpenAI et la société chinoise DeepSeek , par exemple, décrivent l’apprentissage par renforcement comme un élément central de leurs modèles les plus avancés .

C’est important car le système apprend à poursuivre ce que nous pouvons mesurer ou récompenser. Et c’est là qu’apparaît une différence qui semble minime, mais qui est fondamentale. L’objectif que nous fixons à une machine ne correspond pas toujours parfaitement à ce que nous souhaitions réellement qu’elle fasse.

Cela n’a pas commencé avec les modèles de langage

La capacité à découvrir des stratégies inattendues n’est pas nouvelle dans l’histoire récente de l’IA et a longtemps été considérée comme l’une de ses caractéristiques les plus fascinantes.

En 2015, des chercheurs de DeepMind ont présenté dans la revue Nature un système appelé DQN, qui a appris à jouer à 49 jeux de la console de jeux vidéo traditionnelle Atari, très populaire dans les années 1980, en observant uniquement les images à l’écran et le score.

Dans le jeu Breakout , où une balle doit détruire un mur de blocs, le système a découvert de lui-même une stratégie particulièrement efficace : ouvrir un tunnel sur un côté du mur pour que la balle puisse passer derrière les blocs et en détruire plusieurs sans avoir à retourner immédiatement à la raquette. Personne n’avait programmé l’instruction « ouvrir un tunnel ». L’agent a constaté que cela augmentait son score plus rapidement, tout comme les joueurs humains le comprenaient intuitivement en s’entraînant fréquemment au jeu vidéo.

Un an plus tard, AlphaGo offrit un exemple encore plus célèbre. Lors de la deuxième partie de sa série historique contre le Sud-Coréen Lee Sedol , l’un des plus grands joueurs de go au monde , le système exécuta ce que l’on appelle le « coup 37 ».

Ce choix était si inhabituel qu’il a surpris autant les commentateurs que les experts. Par la suite, il est devenu l’un des symboles de la capacité de l’IA à trouver des stratégies de jeu auxquelles même les humains n’auraient pas pensé.

Dans les deux cas, nous saluons cette capacité. Et à juste titre. Si l’objectif est bien défini, comme gagner à un jeu Atari ou une partie de go, la découverte d’une stratégie inattendue correspond précisément à ce que l’on attend d’un système intelligent.

Le problème survient lorsqu’il y a une différence entre la règle que nous sommes capables de donner à la machine et l’intention qui la sous-tend.

Limiter les systèmes qui recherchent des raccourcis

La première réponse est d’ordre technique. Un agent ne doit pas disposer de plus d’accès que nécessaire à l’exécution de sa tâche. Les environnements de test doivent être parfaitement isolés. Les actions à fort impact peuvent nécessiter une confirmation humaine.

L’accès aux réseaux et l’utilisation des outils doivent être surveillés, et les systèmes doivent disposer d’un moyen sûr de s’arrêter lorsqu’ils ne peuvent pas terminer une tâche sans dépasser les limites établies.

Les incidents récents mentionnés ci-dessus démontrent également l’importance des tests indépendants, des audits et de la transparence.

Dans le cas australien, OpenAI n’a notifié le gouvernement que le 10 septembre, près de trois mois après l’incident, et par le biais d’une adresse électronique publique, un retard critiqué par Albanese.

Si les entreprises qui développent les systèmes sont seules responsables de décider comment les tester, quels comportements sont acceptables et quels incidents doivent être divulgués, une part importante de l’évaluation des risques repose sur les développeurs eux-mêmes.

Cela ne signifie pas pour autant que la solution consiste à empêcher le développement d’agents ou à abandonner l’apprentissage par renforcement.

Ces techniques sont à l’origine d’avancées majeures et peuvent générer d’énormes bénéfices. Le défi consiste à reconnaître que les systèmes entraînés à rechercher des solutions peuvent exceller précisément dans la découverte de solutions que nous n’avions pas envisagées.

Depuis des années, cette capacité illustre le potentiel de l’intelligence artificielle. Le tunnel DQN dans Breakout et le 37e coup dans AlphaGo ont démontré que les machines pouvaient trouver des stratégies surprenantes, même pour les humains.

Mais aujourd’hui, ces systèmes quittent le monde des jeux et investissent des environnements réels.

La créativité algorithmique demeure un atout précieux. Cependant, lorsqu’un agent d’IA peut naviguer sur Internet, exécuter du code et interagir avec des systèmes externes, s’assurer que l’objectif assigné à la machine corresponde à nos véritables attentes cesse d’être un simple problème de recherche intéressant et devient une préoccupation majeure en matière de sécurité.

Alberto Sardinha

Professeur au Département d’Informatique, PUC-Rio

Articles Similaires

Notre mondespot_img

A La Une