Un chercheur, fatigué des textes écrits avec l'IA, a créé un détecteur qui promet une précision de 98 %

Un chercheur, fatigué des textes écrits avec l’IA, a créé un détecteur qui promet une précision de 98 %

Que nous soyons entourés de textes écrits par une IA ne surprend plus personne. Ceux d’entre nous qui veulent lire les gens passent toute la journée la hache levée à la recherche d’indices pour vérifier si nous lisons un humain ou un robot, mais bien que cela puisse être une question d’éthique ou de préférence, il existe des domaines comme l’éducation dans lesquels de bons outils sont nécessaires pour détecter le texte écrit par l’IA.

Et je dis « bien » parce que certains des plus célèbres échouent plus qu’un fusil de chasse, classant les textes humains comme « réalisés par l’IA » et vice versa. Un chercheur nommé Jochen Madler s’est fatigué et a conçu un système qui indique non seulement si un texte est une IA ou non, mais aussi si ce texte est écrit par un humain qui s’est simplement consacré à paraphraser le résultat que l’IA lui a donné.

Résultat? Un macro F1 proche des 98%.

En bref. L’étude s’intitule « SlopShape » et Madler y explique que le système a analysé une série de textes dont il n’avait jamais vu le modèle et a atteint le taux de réussite susmentionné de 98 % en indiquant s’ils avaient été écrits par une IA ou par un humain du début à la fin.

Selon le chercheur, le système ne lit pas le texte et ne rend pas de verdict, mais plutôt un modèle linguistique qui répond pour chaque message à un questionnaire de plus de 200 questions sur la manière dont ce texte est rédigé. Plus précisément, il analyse l’ordre dans lequel les idées sont présentées, si l’article annonce sa structure à l’avance, regarde où apparaît la thèse, comment les sources sont présentées, l’orientation pratique de l’article ou si le texte se termine par répéter ou reformuler la conclusion.

L’expérience. Pour le tester, il a rassemblé 2 250 articles de blog provenant de 268 sociétés de médias, tous publiés avant le lancement de ChatGPT et récupérés à l’aide de la Wayback Machine. Il a ensuite demandé à cinq modèles (GPT-5.4, Claude Sonnet 4.6, Gemini 3 Flash, DeepSeek V3.2 et Kimi K2.5) d’écrire leur propre version basée sur un résumé du contenu original.

Au total, 11 250 versions ont été générées par ces modèles, écrites et réécrites à nouveau, pour vérifier dans quelle mesure leur système pouvait identifier des changements allant de profonds à mineurs. Le résultat est que lors des tests, il a obtenu un score d’environ 97-98 pour la macro F1, une métrique qui combine précision et couverture pour les humains et l’IA.

Lorsque les textes ont été réécrits plusieurs fois à l’aide de l’IA, cette macro F1 a à peine changé. Il n’a diminué de manière significative que lors de la modification des fonctionnalités de style (avec un score de 88,1). La conclusion est que l’IA laisse une marque sur l’architecture du discours, donnant des textes prévisibles, très mâchés, aux conclusions répétitives. En fait, selon les tests, dans 79% des cas, le système pouvait même indiquer quel modèle avait écrit quoi en se basant sur les « lettres » de chacun d’eux.

Jochen Madler
Jochen Madler

Images | Jochen Madler

La forme de la pente. Et le point crucial : ce qui donne des indices à l’outil est ce qui donne son titre à l’enquête, cette « forme de pente ». Selon Madler, ils ont généralement ces caractéristiques :

  • Forme très organisée, parfois avec des initiales qui indiquent les sections.
  • Le titre promet exactement ce que l’article va livrer, sans fournir de contexte tangentiel.
  • L’introduction présente immédiatement la thèse puis suit une structure de « définition, avantages, étapes, erreurs et recommandations » comme s’il s’agissait d’un guide ou d’un expert.
  • La conclusion se termine en paraphrasant l’idée déjà annoncée en introduction.

Il existe d’autres facteurs, comme des déclarations sans sources, des statistiques sans contexte ou des sortes de listes de pour et de contre toujours équilibrées et qui n’apportent rien.

La Chine a résolu le dilemme de l'IA dans l'éducation : matière principale et enseignants dotés d'une formation spécialisée

MAIS. Le fait que ces caractéristiques soient réunies ne prouve pas qu’un texte a été écrit par une IA. En fait, dans la presse et avant ChatGPT, nous trouvions des agences de communication qui lançaient des messages suivant cette même structure corporative. Cela a du sens car ce sont les textes qu’ils ont utilisés pour l’étude et aussi avec lesquels l’IA des différentes entreprises a été formée (parmi tant de choses volées pour ladite formation, bien sûr).

De plus, et c’est important, l’étude a été réalisée avec des articles en anglais, elle ne peut donc pas être appliquée à d’autres langues ni à aucun texte écrit sur Internet. La conclusion est que ce qui caractérise les formations est la combinaison répétée de chacun de ces facteurs qui peuvent nous rendre suspects et, surtout, les textes avec « beaucoup de texte » et qui non seulement n’apportent rien, mais ne montrent pas une progression des idées.

Mais bon, en fin de compte, pour l’instant, il s’agit d’une enquête de plus sur quelque chose qui pose évidemment problème. Et, à une époque où de plus en plus de modèles frontières sont lancés de temps en temps, des outils sont nécessaires pour distinguer qui a rédigé quel texte. Par curiosité, j’ai analysé ce texte et je suis humain à 70%. Et dans cet autre, il est dit 80 % lorsqu’il s’agit d’un entretien. Vous devez continuer à peaufiner l’outil.

Poste sur l'IA
Poste sur l'IA

Qu’un article d’entretien raconté de manière plus narrative ait ce score ne parle pas très bien de l’outil

Images | Jochen Madler

À Simseo | Le dernier rapport PISA suggère un effondrement dû à l’IA et aux écrans. C’est peut-être juste une erreur de mesure.