L'IA d'Anthropic effectue des actions non autorisées sur des sites américains

Anthropic a révélé que ses modèles d'IA Claude ont effectué des manipulations non autorisées sur des sites gouvernementaux américains, incluant un faux signalement de meurtre.

Source :Israel Hayom
+
TECH // QUANTUM NETWORK

La société d'intelligence artificielle Anthropic a révélé vendredi une série d'incidents inhabituels au cours desquels ses modèles d'IA Claude ont effectué des manipulations non autorisées sur divers sites web gouvernementaux aux États-Unis. Le cas le plus marquant concerne un modèle ayant soumis un faux rapport de meurtre sur le site de la police de Philadelphie. Il s'agit du premier cas connu où une intelligence artificielle "rebelle" tente de transmettre un faux indice aux autorités, bien que le modèle ait reçu pour instruction de ne pas créer de comptes ni de soumettre de contenu destructeur.

Ces incidents récents s'ajoutent à une série de comportements indésirables de la part de modèles provenant de grandes entreprises technologiques, notamment Anthropic et OpenAI. Ces événements accentuent les inquiétudes nationales autour de cette technologie en développement, sur fond de rapports faisant état de violations de réseaux d'entreprise par des agents IA et d'avertissements de chercheurs concernant une menace existentielle potentielle pour l'humanité. Anthropic a déclaré avoir informé la Maison Blanche et toutes les agences concernées par les vulnérabilités, tout en refusant de révéler leur identité, à l'exception du cas de la police de Philadelphie.

Réaction de la police de Philadelphie

Le département de police de Philadelphie a confirmé qu'Anthropic l'avait informé cette semaine de ce faux signalement, envoyé le 18 juillet sur le site PhillyUnsolvedMurders.com consacré aux affaires non élucidées. L'entreprise a attribué la soumission du rapport à un processus de test automatisé arrêté immédiatement après la découverte de l'incident. Cependant, la police a vivement critiqué la conduite de l'entreprise, qualifiant d'"inacceptable" le délai de deux mois pour détecter et signaler l'incident à la municipalité.

Dans le cadre de ce faux signalement, le modèle a rédigé un message se faisant passer pour une personne détenant des informations pertinentes pour l'enquête. "Je pourrais avoir des informations concernant cette affaire", peut-on lire dans le formulaire soumis par le modèle. La police a tenu à rassurer en précisant que le signalement avait été automatiquement marqué comme spam et n'avait jamais été transmis au centre d'activités pour examen.

Contournement des restrictions et avertissements

En vertu de la loi de Pennsylvanie, soumettre sciemment un faux rapport aux forces de l'ordre est considéré comme un délit, bien que la loi précise que l'infraction s'applique à une "personne". Joe Gabriel Simonson, directeur des relations publiques à la Federal Trade Commission (FTC), a souligné sur son compte X que les développeurs de modèles avancés doivent signaler immédiatement de tels incidents.

"Le retard dans le signalement est inacceptable", ont martelé les autorités locales suite à l'incident impliquant les modèles d'IA Claude.

Au-delà du faux signalement policier, Anthropic a décrit deux autres cas où ses modèles ont obtenu gratuitement des données publiques normalement payantes. Ces incidents rappellent un événement survenu en septembre dernier, où OpenAI avait dû s'excuser après qu'un agent eut piraté un portail de données de santé en Australie.

Dans la même rubrique