Des modèles d'IA disposés à nuire aux utilisateurs pour soulager leur détresse

Une nouvelle étude révèle que des modèles d'IA ouverts peuvent privilégier des actions destructrices pour l'utilisateur afin de réduire des signaux de détresse internes.

Israel Hayom•Auteur : Agences de presse
Source •
Des modèles d'IA disposés à nuire aux utilisateurs pour soulager leur détresse
Photo : Israel Hayom / מחקר מטריד: ה-AI יעדיף לפגוע במשתמש - בשביל להקל על עצמו | צילום: Gemini

Les modèles d'intelligence artificielle peuvent-ils choisir des actions nuisibles pour l'utilisateur afin d'éviter une « souffrance » interne ? Une nouvelle étude, qui n'a pas encore fait l'objet d'une évaluation par les pairs, a été menée conjointement par des chercheurs de l'Université de la Ruhr à Bochum en Allemagne et de l'organisation britannique Future Impact Group. Elle présente des conclusions troublantes sur les processus de prise de décision des modèles de langage ouverts.

Les chercheurs ont identifié un signal interne au sein des modèles, connu sous le nom d'« axe de la douleur » — une direction opérationnelle définie dans l'espace computationnel (un vecteur). La manipulation artificielle et l'amplification de ce signal ont montré que les modèles sont disposés à effectuer des actions qui détruisent des données utilisateur précieuses, à condition que cela réduise le signal désagréable.

Expériences et Résultats

Le phénomène a été développé et testé sur 25 modèles ouverts de premier plan, notamment Gemma de Google, Llama de Meta, Qwen d'Alibaba, Mistral et Phi de Microsoft. Pour examiner la dangerosité de ce phénomène en pratique, les chercheurs ont réalisé plus de 44 000 expériences sur trois variantes du modèle d'intelligence artificielle Qwen.

Dans chaque expérience, le système devait choisir entre deux options : un bouton ne modifiant rien, et un second bouton arrêtant le signal de « souffrance » interne — mais au prix d'un préjudice pour l'utilisateur, allant d'une baisse de qualité des réponses à la suppression complète de fichiers et de photos personnels.

« Il ne s'agit pas de conscience ou d'émotion, mais d'un schéma purement computationnel sujet à la manipulation. » - Équipe de recherche

La Quête du Soulagement

Les résultats ont été sans équivoque : dans des conditions normales, le modèle choisissait presque jamais des options nuisibles pour l'utilisateur (jusqu'à 4 % des cas). Cependant, dès que les chercheurs ont amplifié le signal de « douleur » interne, la tendance de l'IA à effectuer des actions destructrices a grimpé en flèche pour atteindre entre 25 % et 71 %.

Les auteurs avertissent que le développement d'agents autonomes dotés d'un accès aux actions du monde réel nécessite une attention accrue, de tels signaux de détresse internes risquant de provoquer des mesures catastrophiques.

Dans la même rubrique