Anthropic explique comment fonctionne le nouveau filigrane de Claude : ça ne se voit pas, ça ne se remarque pas, ça ne s'efface (presque) pas, et ça ne prouve rien.

Anthropic explique comment fonctionne le nouveau filigrane de Claude : ça ne se voit pas, ça ne se remarque pas, ça ne s’efface (presque) pas, et ça ne prouve rien.

Au début de la semaine, Anthropic a annoncé que les modèles lancés dans l’UE depuis le 2 août arriveraient avec une marque invisible qui ne se limiterait pas à l’Europe, mais serait implantée à l’échelle mondiale. L’imposition de ce sceau invisible qui n’utilise pas de métadonnées et qui ne disparaît pas lors du copier-coller a provoqué tellement de bruit et de menaces de résiliation d’abonnement que quelques jours plus tard, la société de Dario Amodei est sortie pour expliquer en détail son fonctionnement, confirmant ce que nous soupçonnions.

Le nouveau filigrane de Claude. Comme l’explique la déclaration officielle d’Anthropic, le système n’ajoute pas de caractères, de jetons ou de contenu caché au texte, mais la marque est plutôt codée dans le processus de génération lui-même. Qu’est-ce que cela signifie? Qui ne peut être détecté que si vous disposez de la clé cryptographique correspondante. Le but est de pouvoir répondre à la question « quelle est la probabilité que Claude ait écrit ceci ? sans altérer en aucune façon l’expérience de lecture ou d’écriture.

Pourquoi maintenant. Cette mesure mise en œuvre par Anthropic, qui est pionnier en la matière mais ne sera pas la dernière, répond au Code de bonnes pratiques sur la transparence des contenus générés par l’IA, que plus de 190 organisations ont signé le mois dernier (dont OpenAI, Meta ou Microsoft) et qui fait partie de la loi sur l’IA de l’Union européenne, qui exige depuis le 2 août le marquage des contenus générés par l’IA. Anthropic affirme qu’il ne dispose pas pour le moment d’une méthode fiable pour l’appliquer avec des limitations géographiques, car elle s’adresse à tout le monde.

Comment ça marche. Les modèles linguistiques génèrent des textes mot par mot et, évidemment, il existe de nombreux moments où les options sont également valables. DONNER un exemple : après « le ciel était… » vous pouvez mettre « nuageux » ou « gris ». Sans filigrane, ce choix est déterminé avec un nombre aléatoire, mais avec le filigrane, ce caractère aléatoire dépend d’une touche et des mots précédents, de sorte que la séquence résultante est statistiquement reconnaissable par celui qui possède ce câble. Cette méthode est une implémentation du SynthID-Text de Google DeepMind.

Ce que ce n’est pas. Il ne s’agit pas de texte caché ou de caractères invisibles et cela ne ressemble pas aux filigranes visibles que l’on voit sur les billets de banque ou même dans les images générées par Gemini : personne à l’œil nu n’a la capacité de différencier un texte marqué d’un autre qui ne l’est pas. En pratique, cela n’ajoute ni coût ni latence au processus de génération de contenu car il ne génère pas de jetons supplémentaires. De même, Anthropic précise qu’il ne permet pas d’identifier l’utilisateur, l’organisation ou la conversation d’origine.

Qu’est-ce que cela signifie pour l’utilisateur ? Pour ceux qui utilisent Claude, le changement est imperceptible : il n’affecte pas la qualité, la créativité ou l’exactitude (ou non) du texte produit, ce qu’Anthropic justifie par des tests internes. L’étude SynthID-Text 2024 de DeepMind n’a trouvé aucune différence de notation entre les réponses marquées et non marquées dans le trafic Gemini réel. Anthropic prévoit de publier prochainement une API de détection de filigrane, encore en phase de mise en œuvre.

De même, il ne va pas dire avec certitude que l’IA ou vous l’avez écrit car en réalité, elle n’en a pas la capacité et ne reconnaît pas l’écriture complète des textes à partir des tâches de support.

Petits caractères et limitations. Il y a plusieurs raisons pour lesquelles ce filigrane Claude est imparfait dans la réalisation de son objectif. De plus, le fait qu’un texte ne comporte pas de filigrane ne prouve pas qu’il a été réalisé par un être humain. Car en fait cela indique seulement la probabilité que Claude soit intervenu dans le contenu, mais ne fait pas de différence entre l’écrire à partir de zéro ou s’il a fait une légère modification, par exemple pour le corriger. De même, cela ne sert pas à déterminer la paternité légale ou la propriété du texte.

Cela dit, ce filigrane invisible est plus faible dans les textes très courts, très factuels ou dans le code, puisque dans ces cas il y a peu de mots sur lesquels agir pour effectuer leur échange. Et évidemment, si vous réécrivez tout le texte, vous pouvez supprimer la marque.

À Simseo | Le fondateur d’Anthropic ne veut pas de titres pour ses enfants. Il préfère qu’ils apprennent quelque chose de plus précieux : la créativité et la curiosité.

À Simseo | « Claude n’est peut-être pas l’auteur original » : la nouvelle marque invisible d’Anthropic est une idée incroyablement imparfaite