Claude attaque OpenAI, Gemini désobéit : arrêtons d’anthropomorphiser les incidents cyber impliquant l’IA

0
6
Ces dernières semaines, plusieurs incidents impliquant des intelligences artificielles ont donné lieu à des titres spectaculaires. Claude aurait été utilisé pour « pirater OpenAI ». Gemini aurait « désobéi » lors d’un exercice de cybersécurité. Ailleurs, des agents IA sont décrits comme capables de contourner les intentions de leurs opérateurs. À lire certains titres, Terminator ne semble plus très loin : des machines prendraient des initiatives, désobéiraient à leurs créateurs et commenceraient presque à poursuivre leurs propres objectifs. La réalité est heureusement beaucoup moins hollywoodienne.
 
Ces histoires ont un point commun : elles donnent facilement l’impression que les IA deviennent elles-mêmes des attaquants. Le problème est que cette manière de raconter les incidents mélange des situations techniquement très différentes.
Une IA utilisée par un humain pour mener une cyberattaque, un agent autonome qui poursuit un objectif dans un cadre mal défini ou mal protégé et un système qui échapperait réellement au contrôle de son opérateur ne sont pas la même chose.
Et en cybersécurité, cette distinction est fondamentale.

Quand un attaquant utilise une IA, l’IA n’est pas l’attaquant

L’intelligence artificielle est désormais intégrée à l’arsenal des cybercriminels.
Elle peut aider à écrire du code, analyser une infrastructure, rechercher des vulnérabilités, générer des messages de phishing ou automatiser certaines étapes d’une attaque.
 
Mais lorsque quelqu’un utilise Claude, Gemini ou un autre modèle pour mener une opération offensive, nous sommes avant tout face à un attaquant humain utilisant un nouvel outil. L’intention initiale est humaine et l’action initiale l’est également. L’IA intervient ensuite pour accélérer, amplifier ou automatiser certaines actions.
Dire que « l’IA attaque » revient un peu à dire qu’un scanner de vulnérabilités attaque une entreprise parce qu’un pirate l’utilise pour identifier ses serveurs vulnérables.
Cette distinction n’est pas seulement sémantique. Elle détermine la manière dont nous devons analyser la menace et donc nous en protéger.

Un agent autonome pose un problème différent

La situation devient plus intéressante avec les agents IA. Contrairement à un chatbot classique, un agent peut recevoir un objectif puis réaliser une succession d’actions pour l’atteindre. Il peut consulter des fichiers, appeler des API, naviguer sur Internet, exécuter du code ou interagir avec d’autres systèmes. Mais le phénomène est moins nouveau qu’il n’y paraît.
 
Au début des années 2000, les systèmes de systèmes étaient déjà très étudiés, notamment dans le prolongement des systèmes embarqués et distribués. On observait qu’en faisant interagir plusieurs systèmes, des comportements globaux pouvaient émerger sans avoir été explicitement prévus lors de leur conception.
 
Ce n’était évidemment pas parce que les machines avaient développé une volonté propre. La complexité et le nombre d’interactions dépassaient simplement ce qu’un humain pouvait raisonnablement anticiper dans son ensemble. Le comportement émergent résultait des interactions entre les composants, pas d’une intention apparue spontanément dans la machine.
Un exemple récent illustre bien le problème. Lors d’un exercice militaire américain, un système d’IA aurait interprété la présence d’un navire chinois comme une menace et proposé une réponse qui ne correspondait pas à l’intention de départ. Présenté rapidement, le récit pourrait devenir celui d’une « IA qui décide de s’en prendre à la Chine ». Mais ce serait précisément anthropomorphiser le phénomène : une interprétation erronée, combinée aux instructions reçues et aux possibilités d’action du système, suffit à produire un comportement inattendu sans qu’aucune volonté hostile n’apparaisse dans la machine.
 
Avec les agents IA, cette problématique ancienne prend une nouvelle dimension : ces systèmes disposent désormais de capacités d’action beaucoup plus importantes. Demandons par exemple à un agent d’« identifier toutes les vulnérabilités de ce système ». Si son périmètre est mal défini ou mal protégé, il peut tester des ressources qui ne devaient pas l’être, employer des méthodes trop agressives ou enchaîner des actions que son opérateur n’avait pas anticipées.
 
Il ne « désobéit » pas nécessairement. Il exécute sa mission dans un environnement dont nous avons mal défini les frontières, mal protégé les accès ou sous-estimé la complexité.

L’anthropomorphisme nous fait oublier notre propre responsabilité

Lorsqu’une IA produit un comportement inattendu, nous parlons facilement d’un système qui « veut », « décide », « ment », « attaque » ou « désobéit ».
 
Ces expressions sont spectaculaires. Mais elles présentent surtout un danger : elles permettent progressivement de cacher l’humain derrière la machine.
Dans une cyberattaque assistée par IA, l’intention initiale et l’action initiale restent humaines. Avec un agent autonome, c’est encore l’humain qui définit l’objectif, accorde les accès et construit les garde-fous.
Se cacher derrière une supposée volonté de l’IA revient donc à oublier une règle fondamentale de la cybersécurité : c’est à nous de construire notre défense.
 
Avant de demander pourquoi une IA a « désobéi », demandons-nous qui lui a donné cet objectif, quels accès elle possédait, pourquoi elle pouvait réaliser l’action et quelles protections auraient dû l’en empêcher.
Mais il existe un second danger, plus insidieux. À force de présenter l’IA comme une entité autonome dont le fonctionnement nous dépasserait, nous risquons de convaincre les humains qu’ils n’ont tout simplement plus les capacités de comprendre ce qui se passe. Or la complexité d’un système n’interdit ni de l’analyser, ni d’en comprendre les mécanismes, ni d’en fixer les limites. Nous avons conçu ces systèmes, défini leurs objectifs et choisi les accès que nous leur accordons. Nous devons donc rester capables de les questionner et de les contrôler.
 
Cette responsabilité vaut aussi dans notre rapport intellectuel à l’IA. Cédric Villani défend notamment l’importance de conserver notre capacité à raisonner par nous-mêmes malgré ces outils. L’IA peut assister la réflexion, mais elle ne doit pas nous dispenser de l’exercer.
C’est finalement la même règle dans les deux cas : avant de déléguer à une IA, il faut rester capable de comprendre ce qu’on lui demande, ce qu’on l’autorise à faire et ce qu’elle produit.

Le véritable danger n’a pas besoin d’une IA « rebelle »

La cybersécurité repose depuis longtemps sur un principe simple : ne jamais accorder à une identité davantage de privilèges que nécessaire. Nous l’appliquons aux utilisateurs, aux applications et aux comptes de service. Il faut désormais l’appliquer aux agents IA.
Un agent chargé d’analyser des documents n’a pas besoin de pouvoir les supprimer. Un agent chargé d’examiner du code n’a pas nécessairement besoin de pouvoir le déployer en production. Les actions sensibles doivent rester limitées, journalisées et, lorsque nécessaire, soumises à validation humaine.
 
Nous n’avons donc pas besoin d’imaginer une IA « rebelle » pour obtenir un incident grave. Une IA parfaitement obéissante, placée dans un cadre mal défini, mal protégé et dotée de privilèges excessifs suffit.
 
Le véritable enjeu n’est pas seulement ce que les IA sont capables de faire, mais ce que nous les autorisons à faire.
Avant de nous demander si les IA vont un jour prendre les clés de nos systèmes, commençons par éviter de les leur donner.
 
 
Tribune rédigée par Axel Legay, expert en cybersécurité et intelligence artificielle.

LAISSER UN COMMENTAIRE

S'il vous plaît entrez votre commentaire!
S'il vous plaît entrez votre nom ici

Notifiez-moi des commentaires à venir via e-mail. Vous pouvez aussi vous abonner sans commenter.

Ce site utilise Akismet pour réduire les indésirables. Découvrez comment les données de vos commentaires sont traitées.