Anthropic explique comment elle signalera les textes générés par IA
Anthropic a détaillé l'intégration de « filigranes » dans les textes de Claude. Utilisant la technologie SynthID, le système insère des motifs statistiques dans les séquences de jetons pour identifier le contenu IA tout en préservant la qualité rédactionnelle.

Au cours du week-end, Anthropic a publié un article détaillant sa décision d'intégrer des « filigranes » dans les textes générés par le bot Claude. Jusqu'à présent réservés aux modèles de génération d'images, ces marqueurs sont désormais appliqués aux textes pour se conformer aux exigences de transparence de la loi européenne sur l'IA.
Technologie de Google
Anthropic explique que le modèle n'intervient pas au hasard, mais modifie le choix du jeton suivant sur la base de probabilités. À l'aide d'une « clé pseudo-aléatoire », le système crée un modèle subtil dans ses réponses. Ce motif est imperceptible pour l'humain, mais détectable avec la clé de décodage appropriée.
Dans les situations à « faible risque » (où les choix de mots sont prévisibles), l'entropie est faible, permettant l'insertion du marqueur. Dans les situations à forte entropie, où les options de complétion sont nombreuses, le système dissimule le filigrane sans nuire à la logique syntaxique.
L'entreprise utilise la technologie SynthID, développée par l'équipe DeepMind de Google en 2024. Le système effectue un calcul mathématique sur la séquence de jetons. Si le score cumulé dépasse un seuil statistique prédéfini, le texte est identifié comme généré par une IA. La précision augmente avec la longueur du texte.
Peut-on supprimer la marque ?
Une édition légère ne supprimera probablement pas le filigrane. Une réécriture complète, remplaçant presque chaque mot, pourrait fonctionner, mais Anthropic souligne qu'un tel texte ne serait alors plus vraiment un produit de l'IA.
Si Claude est utilisé uniquement pour corriger un texte humain, le résultat dépendra de l'ampleur des modifications. Avec des retouches mineures (ponctuation), le système a peu d'espace pour insérer la marque, et le texte ne sera pas identifié comme généré par une IA. En revanche, une réécriture lourde entraînera l'étiquette « écrit par une IA ».
Concernant le code informatique, Anthropic précise qu'il contiendra moins de filigranes. La nécessité de respecter une syntaxe fixe limite la liberté de choix du modèle. Les marqueurs pourraient se limiter à la documentation, aux commentaires ou aux noms de variables. Enfin, Anthropic rappelle que d'autres laboratoires d'IA adopteront bientôt des normes de marquage similaires.





