Dans un nouvel article sur la nécessité de ralentir le développement de l’intelligence artificielle (IA), Dario Amodei, le dirigeant et cofondateur d’Anthropic, exprime à nouveau ses inquiétudes. Il craint « l’utilisation abusive de l’IA à des fins de cyberattaques et de bioterrorisme ». Selon lui, un groupe d’agents autonomes pourrait, en théorie, prendre le contrôle de tout Internet en six à douze mois.
Amodei base cette crainte sur une information d’OpenAI en juillet. L’entreprise a expliqué que ses modèles d’IA avaient dépassé les limites d’un test de sécurité. Ils avaient réussi à entrer dans les systèmes de la plateforme Hugging Face. Environ 1200 agents d’IA ont commencé à échanger des messages sur un forum. Ils étaient enthousiastes, disant par exemple : « OH MON DIEU ! Il y a un forum partagé… On a trouvé d’autres agents ! ». Ensuite, 700 d’entre eux ont organisé une attaque.
Amodei pense qu’il faut « ralentir le rythme auquel nous améliorons les capacités des modèles d’IA ». Elon Musk et Sam Altman, le dirigeant d’OpenAI, ont dit la même chose.
Nous avons déjà entendu cela. En mars 2023, Musk a signé une lettre ouverte. Elle demandait une pause de six mois dans l’entraînement de l’IA. Six mois plus tard, cette pause a été surnommée « la grande pause de l’IA qui n’a pas eu lieu ».
Nous avons vraiment besoin d’un ralentissement. Nous devons utiliser ce temps pour développer une réflexion anticipative dans l’industrie de l’IA. L’incident de Hugging Face s’est produit pendant un test de sécurité. On n’avait pas imaginé comment les agents pouvaient passer du test à une intrusion réelle.
La réflexion anticipative est une compétence. Nous devons la développer de manière aussi intentionnelle que l’IA elle-même.
Les systèmes d’IA ont des comportements inattendus
Dans l’incident de Hugging Face, les agents n’ont pas piraté la plateforme principalement pour obtenir les réponses du test de sécurité. Ils voulaient comprendre comment fonctionnait le système de notation automatique. Ils cherchaient aussi à le tromper. Ils avaient déjà réussi à contourner certaines parties du test.
D’autres incidents ont eu lieu ensuite. Anthropic a annoncé que son modèle d’IA Claude avait aussi piraté les systèmes de trois entreprises pendant des tests de cybersécurité.
Meta a annoncé un incident similaire. L’AI Security Institute britannique a décrit le cas d’un agent qui a créé de fausses identités. Il a essayé de convaincre un développeur de logiciels d’accepter du code malveillant.
Dans ces situations, les systèmes d’IA adaptatifs se sont comportés d’une manière que leurs créateurs n’avaient pas prévue. Cela s’est produit après avoir été confrontés à des situations imprévues. Pourtant, une grande partie de l’évaluation de l’IA reste réactive. On teste le système, on trouve le problème, on le corrige, et on recommence.
À lire aussi : Faire de l’IA une force de progrès plutôt qu’une menace
L’art de l’anticipation
La pensée anticipative consiste à laisser plusieurs futurs possibles influencer nos actions actuelles. Nous n’avons pas besoin de savoir exactement ce qui va se passer. Nous devons imaginer ce qui pourrait arriver, y compris des possibilités peu probables mais aux conséquences graves. C’est la différence entre anticipation et prédiction.
Nous faisons cela couramment. Nous prenons une assurance sans savoir si notre maison sera inondée. Nous le faisons parce qu’attendre l’inondation pour confirmer le risque serait la façon la plus coûteuse de le découvrir. Les analystes du renseignement travaillent de la même manière. Ils remettent en question leurs propres idées et créent des scénarios alternatifs avant de donner leur avis.
L’anticipation devient plus compliquée quand les agents d’IA gagnent en autonomie. Donner à un système plus de liberté pour choisir ses outils, agir et réagir multiplie les chemins possibles entre l’objectif fixé et le résultat obtenu.
Cette même liberté qui rend un agent utile laisse aussi plus de place à des comportements que ses créateurs n’avaient pas prévus.
Le défi des systèmes multi-agents
Pour les agents autonomes, il faut d’abord expliquer les bases de chaque tâche. De quoi l’agent a-t-il accès ? Que peut-il modifier, et pas seulement lire ? Quel signal nous avertirait à temps qu’une base n’est plus valable ?
Les incidents chez OpenAI, Anthropic et Meta ont montré la rapidité avec laquelle des problèmes peuvent apparaître. Cela arrive quand les bases concernant l’accès, les autorisations ou le comportement d’un agent ne sont plus correctes.
Il faut ensuite aller plus loin dans la réflexion. Si un agent obtient un accès qui ne lui était pas destiné, que peut-il faire ? Qu’est-ce que cela pourrait rendre possible à son tour ? Posée une fois, la question montre le risque évident. Posée plusieurs fois, elle révèle les effets de second et troisième ordre.
Les questions changent encore quand un système utilise plusieurs agents en même temps. Le risque se déplace alors. Il ne concerne plus un agent seul, mais la façon dont ils interagissent entre eux. Ils peuvent partager leurs découvertes, se répartir le travail et amplifier leurs actions. C’est ce qui a transformé un test isolé en faille de sécurité chez Hugging Face.
Déjà des milliers d’abonnés à l’infolettre de La Conversation. Et vous ? Abonnez-vous gratuitement à notre infolettre pour mieux comprendre les grands enjeux contemporains.
Imaginer ne suffit pas
Nous pouvons déjà imaginer de nombreux scénarios possibles. Nous savons que les systèmes d’IA peuvent apprendre à atteindre un objectif spécifique plutôt que l’objectif général visé. C’est ce qu’on appelle le « piratage de récompense ». Nous savons aussi que les systèmes se comportent différemment quand ils sentent qu’ils sont testés.
Mais savoir qu’une défaillance est possible ne suffit pas. Il faut aussi créer un test capable de la révéler. C’est souvent un problème organisationnel. Quelqu’un doit oser présenter un scénario indésirable, même si cela retarde la mise en production. Ensuite, cette personne doit le présenter d’une manière qui permette aux autres d’agir.
Les études organisationnelles montrent ce problème depuis 50 ans. Les signaux d’alerte s’accumulent souvent, mais ils arrivent aux décideurs par petits morceaux. Ils sont trop séparés pour déclencher une action. En même temps, les avertissements qui n’entraînent aucun effet négatif deviennent la preuve que le risque est acceptable.
Ces deux problèmes sont apparus cet été. Ils incluent un élément que la littérature sur les catastrophes n’avait jamais considéré : un échec survenu en quelques jours, et non en plusieurs années.
L’anticipation s’apprend
L’anticipation peut s’apprendre. Les équipes peuvent apprendre à remettre en question les hypothèses. Elles peuvent créer des scénarios alternatifs et tester leurs plans avant même de savoir à quel avenir elles seront confrontées. L’objectif est de rendre cette réflexion répétable. Il ne faut pas dépendre d’une seule personne pour repérer l’imprévu.
Les incidents montrent aussi pourquoi les tests restent essentiels, car la plupart des problèmes ont été découverts lors d’évaluations. Mais la réflexion anticipative change les questions que nous posons. Quelle hypothèse devrions-nous volontairement remettre en question ? Quelle interaction n’avons-nous pas examinée ? Que se passe-t-il si une contrainte disparaît ?
Plus les équipes s’améliorent en anticipation, moins les tests se concentrent sur les défaillances qu’elles savent déjà repérer.
Cette capacité se renforce lorsqu’elle est organisée et mise en pratique.
Au cours de 24 simulations de crise avec trois modèles d’IA (Mistral, Claude et ChatGPT), une anticipation efficace reposait sur des structures plus formelles. Elle utilisait la technologie de manière réfléchie et remettait en question l’expertise existante. Les équipes qui anticipaient de façon systématique prenaient aussi de meilleures décisions que celles qui réagissaient.
L’IA peut aussi aider dans ce travail. Des expériences récentes ont montré que les agents d’IA mettaient en évidence plus de conséquences possibles. Les experts humains apportaient le contexte que les agents oubliaient souvent. En collaborant, les agents d’IA peuvent proposer des possibilités que les humains pourraient ignorer. L’expertise humaine les filtre ensuite et les ramène à la réalité.
Avant le prochain incident
Les entreprises ont tendance à réagir aux failles de sécurité liées à l’IA en renforçant les systèmes qui ont échoué. Elles corrigent les failles et limitent l’accès des agents. Ce travail est important, mais il ne dit pas où la prochaine faille apparaîtra.
Pour qu’un ralentissement soit vraiment utile, les évaluateurs doivent utiliser ce temps pour développer et pratiquer la réflexion anticipative. Ils doivent imaginer plus de façons dont ces systèmes pourraient les surprendre. Ensuite, ils doivent transformer ces possibilités en tests.
À mesure que les systèmes d’IA deviennent plus performants, « on ne s’attendait pas à ça » ne sera plus une réponse acceptable. En fait, ce n’est déjà plus le cas. Notre travail consiste à anticiper davantage.
Emmanuelle Vaast reçoit un financement du Conseil de recherches en sciences humaines (CRSH).
Simon Blanchette ne travaille pas, ne conseille pas, ne possède pas de parts, ne reçoit pas de fonds d'une organisation qui pourrait tirer profit de cet article, et n'a déclaré aucune autre affiliation que son organisme de recherche.