Passer au contenu

Ce détail caché trahira les textes générés par l’IA : l’astuce pour s’en débarrasser existe déjà, mais elle est chronophage

Les textes générés par les prochains modèles de Claude porteront un marqueur invisible qui permettra de les identifier. Anthropic donne plus de détails sur cette technologie et reconnaît qu’il y a un moyen de se débarrasser de ce marqueur.

Vous avez l’habitude d’utiliser du texte généré par l’IA pour répondre à des e-mails, publier sur les réseaux sociaux ou pour générer des rapports au travail ? Vous devez faire attention, car, bientôt, les textes générés par les nouveaux modèles de Claude, le célèbre chatbot d’Anthropic, porteront un filigrane invisible qui permettra à un logiciel de déterminer si ce texte a été généré ou traité par ce produit. Mais alors que cette technologie n’est pas encore activée, Anthropic admet déjà qu’il est facile de se débarrasser de ses filigranes.

Dans un article publié il y a quelques jours, l’entreprise publie de nouveaux détails sur ce mécanisme d’identification. Et, dans la FAQ, l’entreprise admet que quelqu’un peut juste réécrire un texte généré par l’IA pour se débarrasser du filigrane. Mais l’entreprise explique également que les petites modifications ne suffiront pas. “Une simple modification ne suffira probablement pas à supprimer complètement le filigrane ; une réécriture intégrale, avec remplacement de chaque mot, y parviendra”, explique le laboratoire d’intelligence artificielle.

Comment ce marqueur est-il créé ?

Pour marquer les textes, les modèles Claude concernés choisiront des mots spécifiques à la place d’autres, qui n’ont aucun impact sur la qualité ni sur la pertinence du texte généré. Et ces choix créent un schéma qui permet à un algorithme de détecter les textes générés par l’IA. Il ne s’agit donc pas de caractères cachés. Et il est a priori impossible pour un humain de reconnaître le schéma pour retirer les mots qui servent de marqueur.

D’ailleurs, Anthropic explique que si vous utilisez l’IA pour corriger ou éditer un texte qui a été rédigé par un humain, le filigrane ne s’appliquera qu’aux mots qui ont été ajoutés par Claude. De ce fait, dans ce cas précis, il est possible que l’action de Claude ne soit pas détectable. “Selon la longueur du texte et l’ampleur des modifications apportées par Claude, ces changements pourraient ne pas suffire à rendre perceptible l’intervention de Claude. Plus Claude écrit, plus il doit prendre de décisions, et plus il y a de place pour un filigrane”, explique Anthropic.

En revanche, si on utilise un modèle concerné par cette mesure pour traduire du texte, le marqueur sera bien présent, puisque tous les mots ont été générés par l’IA.

Une mesure qui va se généraliser

En tout cas, la mesure annoncée par Anthropic, pour se conformer aux règles de transparence de l’Union européenne, pourrait se généraliser partout. De son côté, Anthropic travaille déjà sur une prise en charge du filigrane invisible par ses modèles d’IA plus anciens.

Mais, en plus de cela, la technologie que celui-ci utilise peut être adoptée par tous les autres laboratoires d’IA. En effet, il s’agit de la technologie SynthID-Text, que Google met à disposition de l’industrie. Par ailleurs, il est à rappeler que les autres sociétés spécialisées dans l’IA sont soumises aux mêmes obligations qu’Anthropic.

  • Anthropic va progressivement adopter un filigrane invisible pour marquer les textes générés par Claude
  • Ce marqueur n’utilise pas de caractères invisibles, mais peut être retiré en réécrivant le texte créé par l’IA
  • La technologie s’appuie sur SynthID de Google et applique un schéma caché en utilisant le choix des mots, mais sans affecter la qualité des réponses

📍 Pour ne manquer aucune actualité de Presse-citron, suivez-nous sur Google Actualités et WhatsApp.

Newsletter 🍋

Abonnez-vous, et recevez chaque matin un résumé de l’actu tech