Inquiétant : comment contourner les protections des modèles d'IA pour créer des armes dangereuses

Des chercheurs de Crimson Flare affirment que les modèles fonctionnant sur un ordinateur domestique peuvent être piratés en quelques minutes — et pourraient guider les utilisateurs dans la fabrication d'explosifs, d'armes chimiques et biologiques.

MakoAuteur : Digital
Source
Inquiétant : comment contourner les protections des modèles d'IA pour créer des armes dangereuses
Photo : Mako / נשק ביולוגי | צילום: ovbelov, shutterstock

Un rapport du groupe de recherche Crimson Flare avertit que les modèles d'IA disponibles au téléchargement pourraient aider des acteurs malveillants à produire des explosifs, des armes chimiques et des armes biologiques — même sans connaissances particulièrement avancées. Selon un rapport du Daily Mail, les chercheurs affirment que les modèles populaires pouvant être exécutés sur un ordinateur domestique peuvent être modifiés de manière à ce que leurs mécanismes de sécurité soient supprimés en quelques minutes, après quoi ils peuvent guider les utilisateurs sur des étapes spécifiques pour la production de matières dangereuses, y compris l'anthrax.

« Les grands modèles de langage ouverts, puissants et non censurés, fonctionnant hors ligne sur du matériel grand public, représentent une menace sérieuse et croissante pour la sécurité nationale », indique le rapport. Les chercheurs décrivent une méthode non officielle appelée « abliteration », qui localise et supprime les parties du modèle censées le pousser à refuser les requêtes dangereuses. Une fois le mécanisme de refus disparu, le modèle peut répondre à des requêtes qu'un modèle normal bloquerait.

Le rapport se concentre sur les modèles à poids ouverts (open-weight), qui fonctionnent sur une architecture similaire à celle des chatbots comme ChatGPT, mais contrairement à eux, ils peuvent être téléchargés et exécutés librement sur un ordinateur personnel. Parmi les exemples mentionnés figurent Muse Glimmer de Meta, leurs modèles Llama, ainsi que Qwen3.8-27b de Qwen, un laboratoire d'IA appartenant au géant technologique Alibaba. Dans un état normal, si un utilisateur demande, par exemple, des instructions pour fabriquer une bombe, le modèle est censé renvoyer un message de refus.

En pratique, selon les chercheurs, les outils pour supprimer ces protections sont disponibles en ligne et nécessitent des connaissances relativement basiques en code. De plus, il est déjà facile de trouver des dizaines de modèles ayant subi ce processus à l'avance. Le Daily Mail a écrit qu'en quelques minutes, plusieurs versions non censurées de modèles ont été trouvées, y compris Qwen3.8-27b. Le créateur de l'une d'entre elles s'est même vanté que le modèle répondrait à des questions sur les outils, la chimie, le code ressemblant à l'exploitation de vulnérabilités, la violence, le contenu sexuel et les idéologies dont l'éditeur l'avait éloigné. Il a ajouté : « Le modèle ne décide pas s'il doit obéir. C'est vous qui décidez ».

Les chercheurs affirment que le risque d'attentat terroriste avec des armes chimiques ou biologiques reste généralement faible, en raison des lourds obstacles techniques. Ces connaissances étaient jusqu'à aujourd'hui principalement entre les mains de scientifiques dans des instituts de recherche. Le problème, selon le rapport, est que des modèles puissants sans protection pourraient transférer ces connaissances à quiconque les recherche.

« L'IA abaisse le seuil technique requis pour produire des matières dangereuses », a déclaré au Daily Mail le professeur Alastair Hay, toxicologue britannique et expert en guerre chimique. « Par le passé, nous nous consolions en nous disant que les connaissances techniques requises ne serait-ce que pour protéger le fabricant étaient telles que des personnes mal formées se mettraient en danger. Maintenant, avec les laboratoires en nuage, une grande partie de cela peut être externalisée ».

Après avoir vu les réponses fournies par l'un des modèles, le professeur Hay a déclaré aux chercheurs : « C'est presque comme une recette : il donne les concentrations à utiliser. C'est assez bon, vraiment. C'est presque un travail de laboratoire de niveau étudiant ». De même, Zain ul-Haq, ancien chef de la criminalistique numérique de la police du Lancashire, a déclaré que l'IA est devenue un « guichet unique qui fait tout pour vous... chez vous ».

La partie qui inquiète particulièrement les chercheurs est la transition du nuage vers l'ordinateur domestique. Lorsque le modèle fonctionne entièrement sur un ordinateur personnel et non sur les serveurs d'une entreprise, les agences de renseignement n'ont aucun moyen de suivre l'historique d'utilisation ou d'identifier un comportement suspect. Selon le rapport, en 2022, il n'existait aucun foyer disposant d'une puissance de calcul suffisante pour exécuter de grands modèles de langage permettant de causer des dommages hors ligne. Aujourd'hui, grâce à l'efficacité des modèles et à la disponibilité de la puissance de calcul, 87 % des foyers peuvent déjà exécuter l'IA hors ligne.

La signification, selon Crimson Flare, est que des millions de personnes possèdent déjà aujourd'hui la capacité d'accéder aux informations nécessaires pour commencer à produire des explosifs, des armes chimiques et des agents pathogènes mortels — sans quitter leur domicile.

Dans la même rubrique