{"id":1013,"date":"2026-09-26T09:03:59","date_gmt":"2026-09-26T07:03:59","guid":{"rendered":"https:\/\/alain.goudey.eu\/side\/?p=1013"},"modified":"2026-09-26T09:04:00","modified_gmt":"2026-09-26T07:04:00","slug":"thelyson-orelien-et-lia-peut-on-prouver-quun-texte-est-ecrit-par-une-ia","status":"publish","type":"post","link":"https:\/\/alain.goudey.eu\/side\/2026\/09\/26\/thelyson-orelien-et-lia-peut-on-prouver-quun-texte-est-ecrit-par-une-ia\/","title":{"rendered":"Th\u00e9lyson Or\u00e9lien et l&rsquo;IA : peut-on prouver qu&rsquo;un texte est \u00e9crit par une IA ?"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\"><strong>Aucun outil ne peut prouver qu&rsquo;un texte a \u00e9t\u00e9 \u00e9crit par une intelligence artificielle.<\/strong> Je le dis depuis 2023 : <a href=\"https:\/\/alain.goudey.eu\/side\/2023\/10\/20\/les-detecteurs-ia-ne-sont-pas-bons-pour-leducation\/\" data-type=\"link\" data-id=\"https:\/\/alain.goudey.eu\/side\/2023\/10\/20\/les-detecteurs-ia-ne-sont-pas-bons-pour-leducation\/\">AUCUN outil ne peut PROUVER qu&rsquo;un texte est produit par une IA<\/a>. Cette phrase peut sembler provocatrice au moment o\u00f9 un roman en lice pour le Goncourt est mis en cause sur la foi de captures d&rsquo;\u00e9cran d&rsquo;un d\u00e9tecteur, et o\u00f9 des r\u00e9dactions enti\u00e8res ont r\u00e9pliqu\u00e9 le test. On peut la reformuler en : Th\u00e9lyson Or\u00e9lien et l&rsquo;IA : peut-on prouver qu&rsquo;un texte est \u00e9crit par une IA ? Elle est pourtant la conclusion commune des math\u00e9maticiens qui ont \u00e9tudi\u00e9 la question, des concepteurs des meilleurs d\u00e9tecteurs, et des chercheurs qui les ont \u00e9valu\u00e9s de mani\u00e8re ind\u00e9pendante.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La confusion vient de ce que le mot \u00ab d\u00e9tecteur \u00bb recouvre des objets tr\u00e8s diff\u00e9rents. Certains mesurent la pr\u00e9visibilit\u00e9 d&rsquo;un texte, d&rsquo;autres apprennent \u00e0 distinguer deux corpus, d&rsquo;autres encore cherchent une signature d\u00e9pos\u00e9e par le g\u00e9n\u00e9rateur. Ces objets n&rsquo;ont ni les m\u00eames forces, ni les m\u00eames angles morts, ni le m\u00eame rapport \u00e0 l&rsquo;id\u00e9e de preuve. Ils ont en commun de produire un score, et ce score est presque toujours mal lu.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Cet article explique ce que ces outils calculent r\u00e9ellement, pourquoi leur r\u00e9sultat ne peut pas constituer une preuve, comment lire leurs taux d&rsquo;erreur, et pourquoi le simple choix du passage soumis peut changer le verdict. Il d\u00e9crit ensuite un ph\u00e9nom\u00e8ne plus lent mais plus profond : les tics d&rsquo;\u00e9criture des mod\u00e8les se r\u00e9pandent dans l&rsquo;\u00e9criture humaine, et la suspicion d&rsquo;IA devient le r\u00e9flexe par d\u00e9faut face \u00e0 tout texte un peu lisse. Les sources sont indiqu\u00e9es au fil du texte et rassembl\u00e9es \u00e0 la fin.<\/p>\n\n\n\n<div class=\"wp-block-rank-math-toc-block\" id=\"rank-math-toc\"><h2>Au sommaire<\/h2><nav><ul><li class=\"\"><a href=\"#deux-familles-de-detecteurs-et-une-troisieme-voie\">Deux familles de d\u00e9tecteurs, et une troisi\u00e8me voie<\/a><ul><li class=\"\"><a href=\"#la-mesure-statistique-methodes-dites-zero-shot\">La mesure statistique (m\u00e9thodes dites \u00ab zero-shot \u00bb)<\/a><\/li><li class=\"\"><a href=\"#le-classifieur-entraine\">Le classifieur entra\u00een\u00e9<\/a><\/li><li class=\"\"><a href=\"#la-troisieme-voie-le-tatouage\">La troisi\u00e8me voie : le tatouage<\/a><\/li><\/ul><\/li><li class=\"\"><a href=\"#pourquoi-aucun-detecteur-d-ia-ne-peut-prouver-lorigine-dun-texte\">Pourquoi aucun d\u00e9tecteur d&rsquo;IA ne peut prouver l&rsquo;origine d&rsquo;un texte ?<\/a><\/li><li class=\"\"><a href=\"#pangram-et-le-piege-du-taux-de-faux-positifs\">Pangram et le pi\u00e8ge du taux de faux positifs<\/a><ul><li class=\"\"><a href=\"#ce-que-le-chiffre-mesure-vraiment\">Ce que le chiffre mesure vraiment<\/a><\/li><li class=\"\"><a href=\"#le-taux-de-base\">Le taux de base<\/a><\/li><li class=\"\"><a href=\"#sur-quelle-population-le-taux-a-ete-mesure\">Sur quelle population le taux a \u00e9t\u00e9 mesur\u00e9<\/a><\/li><\/ul><\/li><li class=\"\"><a href=\"#les-faux-positifs\">Les faux positifs<\/a><ul><li class=\"\"><a href=\"#qui-est-touche\">Qui est touch\u00e9<\/a><\/li><li class=\"\"><a href=\"#leffet-dechelle\">L&rsquo;effet d&rsquo;\u00e9chelle<\/a><\/li><li class=\"\"><a href=\"#lasymetrie-des-consequences\">L&rsquo;asym\u00e9trie des cons\u00e9quences<\/a><\/li><\/ul><\/li><li class=\"\"><a href=\"#les-faux-negatifs-qui-ne-prouvent-rien\">Les faux n\u00e9gatifs, qui ne prouvent rien<\/a><\/li><li class=\"\"><a href=\"#le-probleme-de-la-fenetre-de-test\">Le probl\u00e8me de la fen\u00eatre de test<\/a><ul><li class=\"\"><a href=\"#comment-le-texte-est-reellement-lu\">Comment le texte est r\u00e9ellement lu<\/a><\/li><li class=\"\"><a href=\"#lendroit-du-decoupage\">L&rsquo;endroit du d\u00e9coupage<\/a><\/li><li class=\"\"><a href=\"#ce-que-le-texte-a-subi-avant-darriver\">Ce que le texte a subi avant d&rsquo;arriver<\/a><\/li><\/ul><\/li><li class=\"\"><a href=\"#les-tics-de-l-ia-quon-retrouve-partout\">Les tics de l&rsquo;IA qu&rsquo;on retrouve partout<\/a><ul><li class=\"\"><a href=\"#pourquoi-les-modeles-ecrivent-tous-pareil\">Pourquoi les mod\u00e8les \u00e9crivent tous pareil<\/a><\/li><li class=\"\"><a href=\"#ce-quon-observe\">Ce qu&rsquo;on observe<\/a><\/li><li class=\"\"><a href=\"#pourquoi-ce-ne-sont-pas-des-preuves\">Pourquoi ce ne sont pas des preuves<\/a><\/li><\/ul><\/li><li class=\"\"><a href=\"#la-contamination-de-lecriture-humaine\">La contamination de l&rsquo;\u00e9criture humaine<\/a><\/li><li class=\"\"><a href=\"#laffaire-thelyson-orelien-et-la-suspicion-generalisee\">L&rsquo;affaire Th\u00e9lyson Or\u00e9lien et la suspicion g\u00e9n\u00e9ralis\u00e9e<\/a><\/li><li class=\"\"><a href=\"#ce-quil-reste-a-faire\">Ce qu&rsquo;il reste \u00e0 faire<\/a><\/li><li class=\"\"><a href=\"#references\">R\u00e9f\u00e9rences<\/a><ul><li class=\"\"><a href=\"#faq-question-1790405314529\">Le roman de Th\u00e9lyson Or\u00e9lien a-t-il \u00e9t\u00e9 \u00e9crit par une IA ?<\/a><\/li><li class=\"\"><a href=\"#faq-question-1790405326136\">Comment fonctionne le d\u00e9tecteur Pangram ?<\/a><\/li><li class=\"\"><a href=\"#faq-question-1790405336320\">Pangram est-il fiable ? Quel est son taux de faux positifs ?<\/a><\/li><li class=\"\"><a href=\"#faq-question-1790405346880\">Comment reconna\u00eetre un texte \u00e9crit par ChatGPT ou une autre IA ?<\/a><\/li><\/ul><\/li><\/ul><\/nav><\/div>\n\n\n\n<h2 id=\"deux-familles-de-detecteurs-et-une-troisieme-voie\" class=\"wp-block-heading\">Deux familles de d\u00e9tecteurs, et une troisi\u00e8me voie<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Un d\u00e9tecteur par mesure statistique et un d\u00e9tecteur par classifieur ne r\u00e9pondent pas \u00e0 la m\u00eame question. Le premier demande \u00ab ce texte est-il pr\u00e9visible pour un mod\u00e8le de langage ? \u00bb, le second demande \u00ab ce texte ressemble-t-il davantage \u00e0 mon corpus d&rsquo;IA qu&rsquo;\u00e0 mon corpus humain ? \u00bb. La diff\u00e9rence explique l&rsquo;essentiel de leurs comportements respectifs.<\/p>\n\n\n\n<h3 id=\"la-mesure-statistique-methodes-dites-zero-shot\" class=\"wp-block-heading\">La mesure statistique (m\u00e9thodes dites \u00ab zero-shot \u00bb)<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Ces m\u00e9thodes n&rsquo;apprennent rien sur les textes d&rsquo;IA. Elles prennent un mod\u00e8le de langage de r\u00e9f\u00e9rence, lui font lire le texte, et mesurent \u00e0 quel point chaque mot \u00e9tait attendu par ce mod\u00e8le. La grandeur centrale est la perplexit\u00e9 : un texte que le mod\u00e8le pr\u00e9dit facilement a une perplexit\u00e9 basse. Un mod\u00e8le de langage produit, par construction, des suites de mots probables ; un humain choisit plus souvent des mots improbables. La deuxi\u00e8me grandeur est la variation de cette pr\u00e9visibilit\u00e9 d&rsquo;une phrase \u00e0 l&rsquo;autre, popularis\u00e9e sous le nom de <em>burstiness<\/em> par GPTZero \u00e0 ses d\u00e9buts : l&rsquo;\u00e9criture humaine alterne phrases simples et phrases surprenantes, l&rsquo;IA est plus r\u00e9guli\u00e8re.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Des variantes plus sophistiqu\u00e9es existent. DetectGPT (Mitchell et al., 2023) mesure la courbure de la probabilit\u00e9 autour du texte : si de petites reformulations font syst\u00e9matiquement baisser la probabilit\u00e9, le texte est sans doute un maximum local, donc g\u00e9n\u00e9r\u00e9. Binoculars (Hans et al., 2024) compare les perplexit\u00e9s calcul\u00e9es par deux mod\u00e8les proches, ce qui neutralise en partie l&rsquo;effet du sujet.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Les limites sont structurelles. Le r\u00e9sultat d\u00e9pend du mod\u00e8le de r\u00e9f\u00e9rence, qui n&rsquo;est jamais celui qui a \u00e9crit le texte. Un texte humain tr\u00e8s pr\u00e9sent dans les donn\u00e9es d&rsquo;entra\u00eenement, comme la D\u00e9claration d&rsquo;ind\u00e9pendance am\u00e9ricaine, obtient une perplexit\u00e9 minuscule et passe pour de l&rsquo;IA. Une \u00e9criture norm\u00e9e, un r\u00e9sum\u00e9 scolaire appliqu\u00e9, un texte administratif sont naturellement pr\u00e9visibles. Et la pr\u00e9visibilit\u00e9 est une propri\u00e9t\u00e9 fragile : Krishna et al. (2023) ont montr\u00e9 qu&rsquo;une simple paraphrase automatique faisait chuter le taux de d\u00e9tection de DetectGPT de 70,3 % \u00e0 4,6 % \u00e0 1 % de faux positifs. Le rapport technique de Pangram note lui-m\u00eame que les m\u00e9thodes fond\u00e9es sur la perplexit\u00e9 \u00e9chouent sur des documents humains pr\u00e9sents dans les donn\u00e9es d&rsquo;entra\u00eenement des LLM.<\/p>\n\n\n\n<h3 id=\"le-classifieur-entraine\" class=\"wp-block-heading\">Le classifieur entra\u00een\u00e9<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Un classifieur ne mesure pas la pr\u00e9visibilit\u00e9. On lui montre des milliers ou des millions de textes \u00e9tiquet\u00e9s \u00ab humain \u00bb et \u00ab IA \u00bb, et il apprend une fronti\u00e8re entre les deux. Le premier d\u00e9tecteur d&rsquo;OpenAI, en 2023, \u00e9tait un mod\u00e8le RoBERTa entra\u00een\u00e9 de cette fa\u00e7on ; retir\u00e9 en juillet 2023, il ne reconnaissait que 26 % des textes d&rsquo;IA et accusait \u00e0 tort 9 % des textes humains.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Les classifieurs r\u00e9cents sont bien plus performants, et la raison tient \u00e0 la construction des donn\u00e9es. Pangram, aujourd&rsquo;hui le mieux \u00e9valu\u00e9, ne dispose d&rsquo;aucun corpus naturel de textes d&rsquo;IA. Il associe \u00e0 chaque texte humain un \u00ab miroir synth\u00e9tique \u00bb : on demande \u00e0 un LLM le sujet du document, puis on lui demande d&rsquo;\u00e9crire un document sur ce sujet, de m\u00eame longueur (<a href=\"https:\/\/arxiv.org\/abs\/2402.14873\" target=\"_blank\" rel=\"noopener\">Emi et Spero, 2024<\/a>). Le mod\u00e8le apprend ainsi \u00ab comment c&rsquo;est \u00e9crit \u00bb plut\u00f4t que \u00ab de quoi \u00e7a parle \u00bb. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Le second ingr\u00e9dient est la chasse aux faux positifs : les textes humains que le mod\u00e8le classe \u00e0 tort comme IA sont r\u00e9inject\u00e9s dans l&rsquo;entra\u00eenement, mis en miroir, et le mod\u00e8le est r\u00e9entra\u00een\u00e9. Pangram 4 repose sur un mod\u00e8le de langage open-weight de type <em>mixture-of-experts<\/em> auquel sont greff\u00e9es des t\u00eates de classification (<a href=\"https:\/\/arxiv.org\/pdf\/2607.27183v1\" target=\"_blank\" rel=\"noopener\">rapport technique, juillet 2026<\/a>). Un d\u00e9tecteur de ce type est donc lui-m\u00eame une IA, entra\u00een\u00e9e \u00e0 reconna\u00eetre la production d&rsquo;autres IA.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Les limites sont d&rsquo;une autre nature. Un classifieur ne conna\u00eet que ce qu&rsquo;on lui a montr\u00e9 : les g\u00e9n\u00e9rateurs, les consignes, les genres, les langues et l&rsquo;\u00e9poque de son corpus. Ses param\u00e8tres de calibration, qui transforment un score brut en \u00e9tiquette, sont ajust\u00e9s sur des donn\u00e9es r\u00e9serv\u00e9es et changent d&rsquo;une version \u00e0 l&rsquo;autre. Il est ferm\u00e9 : personne ne peut auditer ses poids. Et il partage avec la premi\u00e8re famille une faiblesse de fond que la section suivante formalise : il mesure une ressemblance, pas une origine.<\/p>\n\n\n\n<h3 id=\"la-troisieme-voie-le-tatouage\" class=\"wp-block-heading\">La troisi\u00e8me voie : le tatouage<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Le tatouage (<em>watermarking<\/em>) agit au moment de la g\u00e9n\u00e9ration. Kirchenbauer et al. (2023) ont propos\u00e9 de partager le vocabulaire, \u00e0 chaque mot, en une liste \u00ab verte \u00bb et une liste \u00ab rouge \u00bb au moyen d&rsquo;une cl\u00e9 secr\u00e8te, et de favoriser l\u00e9g\u00e8rement les mots verts. Le lecteur ne voit rien ; le d\u00e9tenteur de la cl\u00e9 peut compter les mots verts et obtenir un test statistique avec une probabilit\u00e9 d&rsquo;erreur calculable. Google DeepMind a d\u00e9ploy\u00e9 ce principe dans Gemini sous le nom de SynthID Text, publi\u00e9 dans <em>Nature<\/em> en octobre 2024. <a href=\"https:\/\/alain.goudey.eu\/side\/2026\/08\/18\/watermarking-texte-ia-une-avancee-technique-serieuse-mais-un-piege-semantique-et-institutionnel\/\" data-type=\"link\" data-id=\"https:\/\/alain.goudey.eu\/side\/2026\/08\/18\/watermarking-texte-ia-une-avancee-technique-serieuse-mais-un-piege-semantique-et-institutionnel\/\">Anthropic a aussi d\u00e9ploy\u00e9 plus r\u00e9cemment le watermarking<\/a>. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">C&rsquo;est la seule approche qui produise quelque chose qui ressemble \u00e0 une preuve. Mais elle suppose la coop\u00e9ration du fournisseur, ne couvre pas les mod\u00e8les ouverts ex\u00e9cut\u00e9s localement, s&rsquo;efface en grande partie \u00e0 la paraphrase ou \u00e0 la traduction, et chaque fournisseur d\u00e9tient sa propre cl\u00e9. Son absence ne prouve rien. Pour tous les textes qui circulent aujourd&rsquo;hui sans tatouage, on en revient aux deux premi\u00e8res familles, et \u00e0 leurs limites. <\/p>\n\n\n\n<h2 id=\"pourquoi-aucun-detecteur-d-ia-ne-peut-prouver-lorigine-dun-texte\" class=\"wp-block-heading\">Pourquoi aucun d\u00e9tecteur d&rsquo;IA ne peut prouver l&rsquo;origine d&rsquo;un texte ?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">La performance maximale de n&rsquo;importe quel d\u00e9tecteur est born\u00e9e par l&rsquo;\u00e9cart entre la distribution des textes humains et celle des textes d&rsquo;IA, et cet \u00e9cart se referme \u00e0 mesure que les mod\u00e8les progressent. C&rsquo;est le r\u00e9sultat de Sadasivan et al. (2023), qui l&rsquo;\u00e9tablissent pour tout d\u00e9tecteur possible, y compris ceux qui n&rsquo;existent pas encore. Si l&rsquo;on note TV la distance en variation totale entre les deux distributions, l&rsquo;aire sous la courbe ROC du meilleur d\u00e9tecteur v\u00e9rifie :<\/p>\n\n\n<div class=\"wp-block-image\">\n<figure class=\"aligncenter size-full\"><img loading=\"lazy\" decoding=\"async\" width=\"460\" height=\"68\" src=\"https:\/\/alain.goudey.eu\/side\/wp-content\/uploads\/2026\/09\/image-7.png\" alt=\"IA et \u00e9criture, la formule\" class=\"wp-image-1019\" srcset=\"https:\/\/alain.goudey.eu\/side\/wp-content\/uploads\/2026\/09\/image-7.png 460w, https:\/\/alain.goudey.eu\/side\/wp-content\/uploads\/2026\/09\/image-7-300x44.png 300w\" sizes=\"auto, (max-width: 460px) 100vw, 460px\" \/><\/figure>\n<\/div>\n\n\n<p class=\"wp-block-paragraph\">Quand TV tend vers z\u00e9ro, la borne tend vers 0,5, c&rsquo;est-\u00e0-dire vers le tirage \u00e0 pile ou face. Le corollaire est brutal : un mod\u00e8le de langage est entra\u00een\u00e9 pr\u00e9cis\u00e9ment \u00e0 imiter la distribution humaine, donc chaque progr\u00e8s des g\u00e9n\u00e9rateurs d\u00e9truit une partie du signal sur lequel repose tout d\u00e9tecteur. Ce n&rsquo;est pas une question d&rsquo;algorithme \u00e0 trouver, c&rsquo;est une propri\u00e9t\u00e9 du probl\u00e8me.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Ce r\u00e9sultat a une nuance importante, apport\u00e9e par Chakraborty et al. (2023). Tant qu&rsquo;il subsiste un \u00e9cart, aussi petit soit-il, la d\u00e9tection redevient possible si l&rsquo;on dispose d&rsquo;assez de texte : chaque phrase apporte un minuscule biais statistique, et ces biais s&rsquo;additionnent. Sur cinquante mots, le signal est noy\u00e9 dans le bruit ; sur les quarante mille mots d&rsquo;un roman, une d\u00e9viation infime devient \u00e9crasante. C&rsquo;est pour cela que tous les d\u00e9tecteurs exigent une longueur minimale (Pangram refuse les textes de moins de 50 mots) et que leurs taux d&rsquo;erreur s&rsquo;am\u00e9liorent avec la longueur.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Mais il faut \u00eatre pr\u00e9cis sur ce que la longueur corrige. Elle r\u00e9duit l&rsquo;erreur al\u00e9atoire, pas l&rsquo;erreur syst\u00e9matique. Si un auteur \u00e9crit, pour des raisons qui lui sont propres, dans une direction que le d\u00e9tecteur associe \u00e0 l&rsquo;IA, chaque page suppl\u00e9mentaire renforce la conviction du mod\u00e8le dans le mauvais sens. Un texte long rend un d\u00e9tecteur plus s\u00fbr de lui, il ne le rend pas plus juste face \u00e0 un biais corr\u00e9l\u00e9 \u00e0 l&rsquo;auteur, au genre ou \u00e0 la cha\u00eene \u00e9ditoriale. Or de tels biais existent : les concepteurs de Pangram \u00e9crivent eux-m\u00eames que leur mod\u00e8le ne tient pas compte des personnes qui \u00e9crivent volontairement comme des LLM ou qui en ont absorb\u00e9 le style.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Il y a enfin une raison plus \u00e9l\u00e9mentaire. Un d\u00e9tecteur re\u00e7oit un texte, c&rsquo;est-\u00e0-dire un point dans un espace ; il ne re\u00e7oit pas le processus qui l&rsquo;a produit. Or la question pos\u00e9e (\u00ab qui a \u00e9crit ceci, et comment ? \u00bb) porte sur le processus. Le m\u00eame texte final peut r\u00e9sulter d&rsquo;une g\u00e9n\u00e9ration int\u00e9grale, d&rsquo;un brouillon humain lourdement r\u00e9\u00e9crit par un assistant, d&rsquo;une traduction retravaill\u00e9e, ou d&rsquo;un auteur qui a lu tellement de textes d&rsquo;IA qu&rsquo;il en reproduit les cadences. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Au mieux, un d\u00e9tecteur fournit un rapport de vraisemblance : \u00ab ce texte est plus probable sous ma distribution IA que sous ma distribution humaine \u00bb. Transformer ce rapport en conclusion sur l&rsquo;auteur exige des informations que le texte ne contient pas : des brouillons, des versions dat\u00e9es, un tatouage, un t\u00e9moignage. La preuve, quand elle existe, vient de la provenance, jamais de l&rsquo;analyse du produit fini.<\/p>\n\n\n\n<h2 id=\"pangram-et-le-piege-du-taux-de-faux-positifs\" class=\"wp-block-heading\">Pangram et le pi\u00e8ge du taux de faux positifs<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Le pourcentage qu&rsquo;affiche un d\u00e9tecteur n&rsquo;est pas la probabilit\u00e9 que le texte ait \u00e9t\u00e9 \u00e9crit par une IA. C&rsquo;est l&rsquo;erreur de lecture la plus r\u00e9pandue, et elle se joue \u00e0 trois niveaux.<\/p>\n\n\n\n<h3 id=\"ce-que-le-chiffre-mesure-vraiment\" class=\"wp-block-heading\">Ce que le chiffre mesure vraiment<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Chaque outil affiche une grandeur diff\u00e9rente. Chez Pangram 4, le pourcentage est la fraction des caract\u00e8res du document qui ont re\u00e7u l&rsquo;\u00e9tiquette \u00ab IA \u00bb apr\u00e8s un traitement en plusieurs \u00e9tapes : pr\u00e9diction par token, vote majoritaire par phrase, fusion des segments trop courts dans leurs voisins. La \u00ab confiance \u00bb affich\u00e9e \u00e0 c\u00f4t\u00e9 mesure la nettet\u00e9 de la distribution interne du mod\u00e8le avant ces votes ; le rapport technique pr\u00e9cise qu&rsquo;elle n&rsquo;est pas une probabilit\u00e9 recalibr\u00e9e que l&rsquo;\u00e9tiquette finale soit correcte. \u00ab 100 % IA, confiance \u00e9lev\u00e9e \u00bb signifie donc \u00ab toutes les phrases ont \u00e9t\u00e9 \u00e9tiquet\u00e9es IA et le mod\u00e8le n&rsquo;h\u00e9sitait pas \u00bb, et non \u00ab il y a 100 % de chances que ce soit de l&rsquo;IA \u00bb.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Les \u00e9tiquettes elles-m\u00eames cachent des seuils. Pour ses \u00e9valuations, Pangram d\u00e9clare un document humain si la fraction humaine atteint 90 %, IA si la fraction IA atteint 80 %, mixte sinon. Le score continu est ainsi transform\u00e9 en verdict binaire, et le curseur qui s\u00e9pare les deux est un choix de l&rsquo;\u00e9diteur du logiciel, modifiable \u00e0 chaque version.<\/p>\n\n\n\n<h3 id=\"le-taux-de-base\" class=\"wp-block-heading\">Le taux de base<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Supposons un d\u00e9tecteur honorable : il rep\u00e8re 90 % des textes d&rsquo;IA et n&rsquo;accuse \u00e0 tort que 2 % des textes humains. Un enseignant corrige 1 000 copies dont 100 ont \u00e9t\u00e9 r\u00e9dig\u00e9es par IA. Le d\u00e9tecteur signale 90 vraies copies d&rsquo;IA, mais aussi 18 copies humaines sur les 900 restantes. Sur les 108 copies signal\u00e9es, une sur six est innocente, et rien ne permet de savoir lesquelles. Plus la triche est rare dans la population test\u00e9e, plus la proportion d&rsquo;innocents parmi les signal\u00e9s augmente. Un taux de faux positifs n&rsquo;a de sens que rapport\u00e9 au taux de base de ce que l&rsquo;on cherche.<\/p>\n\n\n\n<h3 id=\"sur-quelle-population-le-taux-a-ete-mesure\" class=\"wp-block-heading\">Sur quelle population le taux a \u00e9t\u00e9 mesur\u00e9<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">C&rsquo;est le niveau le plus important, et le moins discut\u00e9. Un taux de faux positifs est une mesure sur un corpus donn\u00e9, et il ne se transporte pas automatiquement \u00e0 un autre corpus. Pangram 4 annonce 0,0041 % de faux positifs, soit un pour 24 300 environ, mesur\u00e9 sur plus d&rsquo;un million de textes anglais ; pour le fran\u00e7ais, 0,0026 %, soit un pour 38 000. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Ces chiffres sont r\u00e9els. Mais les faux positifs multilingues sont mesur\u00e9s sur des sous-ensembles du corpus web FineWeb2 ant\u00e9rieurs \u00e0 2022, c&rsquo;est-\u00e0-dire sur du texte humain \u00e9crit avant ChatGPT, dans des registres web ordinaires. Le taux qui compte pour un roman de 2026, pass\u00e9 par une cha\u00eene \u00e9ditoriale o\u00f9 les outils d&rsquo;IA sont d\u00e9sormais courants, n&rsquo;a \u00e9t\u00e9 mesur\u00e9 par&#8230; personne !<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Les \u00e9valuations ind\u00e9pendantes confirment la performance et illustrent la d\u00e9pendance au corpus. L&rsquo;\u00e9tude de l&rsquo;universit\u00e9 de Chicago (Jabarian et Imas, 2025) conclut, sur 1 992 textes humains d&rsquo;avant 2020 et autant de textes d&rsquo;IA, que Pangram est le seul outil \u00e0 respecter un plafond strict de faux positifs sans sacrifier la d\u00e9tection. Celle de la Vrije Universiteit Brussel (Van Vlasselaer et al., 2026) le place en t\u00eate de quatre outils sur des travaux acad\u00e9miques. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Mais une \u00e9quipe de Notre Dame, sur des r\u00e9sum\u00e9s scientifiques l\u00e9g\u00e8rement retouch\u00e9s par IA, mesure des signalements par Pangram dans 64 \u00e0 80 % des cas, l\u00e0 o\u00f9 Pangram annonce 0,01 % sur son propre jeu de textes polis. <strong>Le m\u00eame outil, test\u00e9 par deux \u00e9quipes sur deux corpus, donne des conclusions oppos\u00e9es. Le taux affich\u00e9 est une propri\u00e9t\u00e9 du couple outil-corpus, jamais de l&rsquo;outil seul.<\/strong><\/p>\n\n\n\n<h2 id=\"les-faux-positifs\" class=\"wp-block-heading\">Les faux positifs<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Un faux positif est un texte humain d\u00e9clar\u00e9 IA, et c&rsquo;est l&rsquo;erreur qui d\u00e9truit des r\u00e9putations. Elle ne frappe pas au hasard : elle se concentre sur des populations identifiables, et elle est amplifi\u00e9e par l&rsquo;\u00e9chelle \u00e0 laquelle les outils sont utilis\u00e9s.<\/p>\n\n\n\n<h3 id=\"qui-est-touche\" class=\"wp-block-heading\">Qui est touch\u00e9<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Les non-natifs, d&rsquo;abord. Liang et al. (2023, <em>Patterns<\/em>) ont soumis des r\u00e9dactions du TOEFL \u00e9crites par des \u00e9tudiants non anglophones \u00e0 sept d\u00e9tecteurs : en moyenne 61,3 % d&rsquo;entre elles ont \u00e9t\u00e9 class\u00e9es IA, contre presque aucune r\u00e9daction d&rsquo;\u00e9l\u00e8ves am\u00e9ricains. Un vocabulaire plus restreint et une syntaxe plus r\u00e9guli\u00e8re rendent un texte plus pr\u00e9visible, et la pr\u00e9visibilit\u00e9 est exactement ce que mesurent les m\u00e9thodes statistiques. Pangram affirme avoir corrig\u00e9 ce biais, avec un seul faux positif sur 24 586 textes d&rsquo;apprenants ; mais le m\u00eame rapport r\u00e9v\u00e8le que, lors d&rsquo;une exp\u00e9rience d&rsquo;entra\u00eenement, les d\u00e9faillances se sont concentr\u00e9es dans deux registres pr\u00e9cis, l&rsquo;\u00e9criture acad\u00e9mique et les essais d&rsquo;apprenants de l&rsquo;anglais. La fragilit\u00e9 n&rsquo;a pas disparu, elle a \u00e9t\u00e9 contenue.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">L&rsquo;\u00e9criture norm\u00e9e, ensuite. Un rapport technique, un texte r\u00e9glementaire, un r\u00e9sum\u00e9 scolaire bien appliqu\u00e9, une notice, tout ce qui ob\u00e9it \u00e0 un format obtient une perplexit\u00e9 basse. Des d\u00e9tecteurs ont signal\u00e9 la Constitution am\u00e9ricaine et des passages de la Bible comme g\u00e9n\u00e9r\u00e9s, non parce qu&rsquo;ils ressemblent \u00e0 ChatGPT, mais parce que les mod\u00e8les de r\u00e9f\u00e9rence les ont m\u00e9moris\u00e9s.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Enfin, une cat\u00e9gorie nouvelle et mal mesur\u00e9e : les humains dont le style a \u00e9t\u00e9 fa\u00e7onn\u00e9 par la fr\u00e9quentation des IA, et les textes pass\u00e9s par des outils d&rsquo;aide \u00e0 l&rsquo;\u00e9criture. On y reviendra plus bas ; retenons que Pangram exclut explicitement ce cas de son p\u00e9rim\u00e8tre.<\/p>\n\n\n\n<h3 id=\"leffet-dechelle\" class=\"wp-block-heading\">L&rsquo;effet d&rsquo;\u00e9chelle<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Un taux de faux positifs de 1 % para\u00eet faible. Appliqu\u00e9 aux millions de devoirs soumis chaque ann\u00e9e aux plateformes d&rsquo;int\u00e9grit\u00e9 acad\u00e9mique, il produit des dizaines de milliers d&rsquo;accusations infond\u00e9es. Turnitin annon\u00e7ait moins de 1 % de faux positifs au niveau du document lors du lancement de sa fonction en 2023 ; l&rsquo;universit\u00e9 Vanderbilt a d\u00e9sactiv\u00e9 cette fonction la m\u00eame ann\u00e9e, en invoquant pr\u00e9cis\u00e9ment ce calcul et l&rsquo;impossibilit\u00e9 pour un \u00e9tudiant de prouver qu&rsquo;il n&rsquo;a pas utilis\u00e9 d&rsquo;IA. Weber-Wulff et al. (2023), dans la plus vaste \u00e9valuation acad\u00e9mique de l&rsquo;\u00e9poque, concluaient qu&rsquo;aucun des quatorze outils test\u00e9s n&rsquo;atteignait 80 % de pr\u00e9cision et qu&rsquo;aucun n&rsquo;\u00e9tait fiable pour un usage disciplinaire.<\/p>\n\n\n\n<h3 id=\"lasymetrie-des-consequences\" class=\"wp-block-heading\">L&rsquo;asym\u00e9trie des cons\u00e9quences<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Un faux positif co\u00fbte \u00e0 la personne accus\u00e9e bien plus qu&rsquo;un faux n\u00e9gatif ne co\u00fbte \u00e0 l&rsquo;institution. La personne accus\u00e9e doit prouver un fait n\u00e9gatif, ce qui est impossible \u00e0 partir du texte seul. Les meilleurs outils ont tir\u00e9 la le\u00e7on en r\u00e9glant leur curseur pour minimiser les faux positifs, au prix des faux n\u00e9gatifs. C&rsquo;est un choix raisonnable, mais il a une cons\u00e9quence que la section suivante d\u00e9taille : un verdict \u00ab humain \u00bb de ces outils ne vaut \u00e0 peu pr\u00e8s rien.<\/p>\n\n\n\n<h2 id=\"les-faux-negatifs-qui-ne-prouvent-rien\" class=\"wp-block-heading\">Les faux n\u00e9gatifs, qui ne prouvent rien<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Un verdict \u00ab \u00e9crit par un humain \u00bb n&rsquo;\u00e9tablit pas qu&rsquo;un texte a \u00e9t\u00e9 \u00e9crit par un humain. Il \u00e9tablit seulement que le d\u00e9tecteur n&rsquo;a pas trouv\u00e9 ce qu&rsquo;il cherche, et il existe au moins quatre fa\u00e7ons document\u00e9es de le lui cacher.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La paraphrase est la plus ancienne. Krishna et al. (2023) ont entra\u00een\u00e9 un mod\u00e8le de reformulation et l&rsquo;ont appliqu\u00e9 \u00e0 des textes d&rsquo;IA : la d\u00e9tection de DetectGPT est tomb\u00e9e de 70,3 % \u00e0 4,6 %, et les tatouages ont \u00e9t\u00e9 fortement d\u00e9grad\u00e9s. Sadasivan et al. ont montr\u00e9 qu&rsquo;une paraphrase r\u00e9cursive l\u00e9g\u00e8re suffisait \u00e0 casser la quasi-totalit\u00e9 des d\u00e9tecteurs sans d\u00e9grader la qualit\u00e9 du texte. Perkins et al. (2024) ont obtenu des r\u00e9sultats comparables avec des techniques triviales, accessibles \u00e0 n&rsquo;importe quel \u00e9tudiant.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Les \u00ab humaniseurs \u00bb industrialisent ce contournement. Ce sont des services commerciaux, ou de simples jeux d&rsquo;instructions, qui injectent des fautes, changent la casse, substituent des synonymes ou reformulent dans un style plus irr\u00e9gulier. Pangram consacre une t\u00eate de classification \u00e0 leur d\u00e9tection et revendique de rep\u00e9rer les textes humanis\u00e9s comme IA dans 97,7 % des cas sur treize services commerciaux. Mais le rapport pr\u00e9cise que ce classifieur n&rsquo;est appliqu\u00e9 que lorsque le d\u00e9tecteur principal a d\u00e9j\u00e0 trouv\u00e9 des indices d&rsquo;IA. Si l&rsquo;humanisation r\u00e9ussit \u00e0 faire basculer le score principal vers \u00ab humain \u00bb, le garde-fou ne s&rsquo;ex\u00e9cute jamais. L&rsquo;\u00e9quipe de Notre Dame observe d&rsquo;ailleurs que plus de 96 % des r\u00e9\u00e9critures humanis\u00e9es \u00e9chappent \u00e0 Pangram et \u00e0 GPTZero sur son corpus.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Les attaques par optimisation directe sont les plus puissantes. Elles utilisent le d\u00e9tecteur comme oracle : on g\u00e9n\u00e8re un texte, on lit le score, on modifie, on recommence. StealthRL (UCSD, 2026) atteint ainsi 99,9 % d&rsquo;\u00e9vasion par apprentissage par renforcement. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">En septembre 2026, l&rsquo;ing\u00e9nieur Anis Ayari a montr\u00e9 publiquement qu&rsquo;un simple algorithme g\u00e9n\u00e9tique, avec Pangram comme fonction d&rsquo;\u00e9valuation, produisait en six heures un article enti\u00e8rement g\u00e9n\u00e9r\u00e9 que Pangram 4 classait \u00ab 100 % humain \u00bb. Ce r\u00e9sultat n&rsquo;a rien de surprenant pour qui conna\u00eet la litt\u00e9rature ; il contredit seulement l&rsquo;id\u00e9e, entretenue par la communication des \u00e9diteurs, que le contournement serait difficile. La contrepartie est que de telles recettes ont une dur\u00e9e de vie courte : d\u00e8s qu&rsquo;elles circulent, elles deviennent des donn\u00e9es d&rsquo;entra\u00eenement pour la version suivante.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Enfin, il y a l&rsquo;asym\u00e9trie voulue. Un d\u00e9tecteur r\u00e9gl\u00e9 pour presque jamais accuser \u00e0 tort laisse passer davantage de textes d&rsquo;IA ; c&rsquo;est m\u00e9canique. Un internaute a fait remarquer qu&rsquo;en changeant quelques mots d&rsquo;un paragraphe du roman d&rsquo;Or\u00e9lien, Pangram le d\u00e9clarait 100 % humain. La chercheuse Marzena Karpinska a r\u00e9pondu que cela ne la surprenait pas : c&rsquo;est ainsi que l&rsquo;on humanise un texte, et Pangram est plus facile \u00e0 tromper de cette fa\u00e7on parce qu&rsquo;il est optimis\u00e9 pour un taux minime de faux positifs.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La cons\u00e9quence pratique est simple. Quand une r\u00e9daction rassure en indiquant que les autres finalistes d&rsquo;un prix sont \u00ab 100 % humain \u00bb, elle ne prouve rien sur ces autres finalistes. Et quand un auteur brandit un verdict \u00ab humain \u00bb d&rsquo;un autre outil pour se d\u00e9fendre, il ne prouve rien non plus. Le faux n\u00e9gatif est facile \u00e0 fabriquer, donc le n\u00e9gatif n&rsquo;a pas de valeur probante ; le faux positif est rare mais impossible \u00e0 r\u00e9futer depuis le texte, donc le positif est un indice fort mais pas une preuve.<\/p>\n\n\n\n<h2 id=\"le-probleme-de-la-fenetre-de-test\" class=\"wp-block-heading\">Le probl\u00e8me de la fen\u00eatre de test<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Un d\u00e9tecteur ne lit jamais le livre ; il lit des fen\u00eatres, et la fa\u00e7on dont on d\u00e9coupe le texte change le verdict. Ce point est rarement expliqu\u00e9, alors qu&rsquo;il conditionne toute lecture de capture d&rsquo;\u00e9cran.<\/p>\n\n\n\n<h3 id=\"comment-le-texte-est-reellement-lu\" class=\"wp-block-heading\">Comment le texte est r\u00e9ellement lu<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Le mod\u00e8le de Pangram 4 a un contexte de 512 tokens, soit environ 350 \u00e0 400 mots de fran\u00e7ais. Un document plus long est d\u00e9coup\u00e9 en fen\u00eatres chevauchantes de 512 tokens avec un pas de 256, chaque token \u00e9tant vu par deux fen\u00eatres, puis les pr\u00e9dictions sont recombin\u00e9es par un d\u00e9codage global. GPTZero proc\u00e8de diff\u00e9remment, en faisant tourner un classifieur phrase par phrase. Dans les deux cas, l&rsquo;unit\u00e9 d&rsquo;analyse n&rsquo;est pas le document mais le fragment, et le score de document est une agr\u00e9gation.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Cette agr\u00e9gation est ensuite liss\u00e9e. Chez Pangram, le d\u00e9codage p\u00e9nalise les changements d&rsquo;\u00e9tiquette entre tokens voisins, chaque phrase re\u00e7oit l&rsquo;\u00e9tiquette majoritaire de ses tokens, et les plages d&rsquo;\u00e9tiquettes plus courtes qu&rsquo;un minimum configurable sont fusionn\u00e9es avec leurs voisines. Le r\u00e9sultat est fait pour produire des blocs homog\u00e8nes. Un passage affich\u00e9 \u00ab 100 % IA \u00bb d&rsquo;un seul tenant est donc en partie un artefact de conception : le syst\u00e8me est construit pour trancher par plages, pas pour nuancer phrase \u00e0 phrase. C&rsquo;est aussi ce qui explique que les scores \u00e9voluent par paliers quand on modifie un texte, une phrase qui bascule faisant sauter tout un segment.<\/p>\n\n\n\n<h3 id=\"lendroit-du-decoupage\" class=\"wp-block-heading\">L&rsquo;endroit du d\u00e9coupage<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Le rapport technique de Pangram le reconna\u00eet noir sur blanc : les pr\u00e9dictions pour un m\u00eame texte dans des contextes diff\u00e9rents peuvent \u00eatre incoh\u00e9rentes, et une section d&rsquo;un article analys\u00e9e isol\u00e9ment peut recevoir une pr\u00e9diction diff\u00e9rente de celle qu&rsquo;elle re\u00e7oit au sein du document complet. Les concepteurs ajoutent qu&rsquo;ils travaillent \u00e0 r\u00e9duire ces incoh\u00e9rences.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">On peut raisonnablement penser que l&rsquo;endroit pr\u00e9cis o\u00f9 l&rsquo;on coupe influe sur le r\u00e9sultat, pour trois raisons. Un extrait qui commence au milieu d&rsquo;un paragraphe prive les premi\u00e8res fen\u00eatres de leur contexte ; un extrait court n&rsquo;est vu que par une ou deux fen\u00eatres, ce qui supprime l&rsquo;effet de moyenne ; et la r\u00e8gle de fusion des segments courts fait que l&rsquo;\u00e9tiquette d&rsquo;une phrase d\u00e9pend de ses voisines, donc de ce qu&rsquo;on a inclus ou exclu. Le rapport montre d&rsquo;ailleurs que les taux d&rsquo;erreur diminuent r\u00e9guli\u00e8rement quand la longueur passe de 50 \u00e0 500 mots. Deux personnes qui soumettent le m\u00eame chapitre en le d\u00e9coupant diff\u00e9remment peuvent obtenir des pourcentages diff\u00e9rents, sans que l&rsquo;une ou l&rsquo;autre ait trich\u00e9.<\/p>\n\n\n\n<h3 id=\"ce-que-le-texte-a-subi-avant-darriver\" class=\"wp-block-heading\">Ce que le texte a subi avant d&rsquo;arriver<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Un dernier facteur est presque jamais document\u00e9 : la forme sous laquelle le texte arrive au d\u00e9tecteur. Un roman copi\u00e9 depuis un fichier EPUB, extrait d&rsquo;un PDF, pass\u00e9 par une reconnaissance optique ou retap\u00e9 n&rsquo;a pas les m\u00eames apostrophes, les m\u00eames guillemets, les m\u00eames espaces ins\u00e9cables ni les m\u00eames tirets. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Le fran\u00e7ais est satur\u00e9 d&rsquo;apostrophes, et l&rsquo;apostrophe typographique d&rsquo;un livre compos\u00e9 n&rsquo;est ni l&rsquo;apostrophe droite d&rsquo;un traitement de texte ni celle d&rsquo;une sortie de chatbot. Pangram indique que les artefacts accidentels (extraction PDF, copier-coller, OCR, normalisation Unicode) ne sont pas class\u00e9s comme humanisation par son garde-fou ; rien n&rsquo;est dit de leur effet sur le d\u00e9tecteur principal, et la d\u00e9monstration d&rsquo;Ayari, qui identifie l&rsquo;apostrophe comme un levier efficace pour faire basculer le score, sugg\u00e8re que cet effet n&rsquo;est pas nul.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La cons\u00e9quence m\u00e9thodologique est claire. Un r\u00e9sultat de d\u00e9tecteur devrait toujours \u00eatre accompagn\u00e9 du texte exact soumis, de sa provenance, de la version de l&rsquo;outil et de la date. Un test s\u00e9rieux soumet le document entier, puis plusieurs d\u00e9coupages, et rapporte la variance. Une capture d&rsquo;\u00e9cran d&rsquo;un paragraphe isol\u00e9 ne satisfait aucune de ces conditions.<\/p>\n\n\n\n<h2 id=\"les-tics-de-l-ia-quon-retrouve-partout\" class=\"wp-block-heading\">Les tics de l&rsquo;IA qu&rsquo;on retrouve partout<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Les mod\u00e8les de langage ont un style par d\u00e9faut, reconnaissable et mesur\u00e9, mais ce style est un indice de ressemblance, pas une signature d&rsquo;origine. Il faut d&rsquo;abord comprendre d&rsquo;o\u00f9 il vient.<\/p>\n\n\n\n<h3 id=\"pourquoi-les-modeles-ecrivent-tous-pareil\" class=\"wp-block-heading\">Pourquoi les mod\u00e8les \u00e9crivent tous pareil<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Sans consigne particuli\u00e8re, un mod\u00e8le retombe sur ce que l&rsquo;alignement par retour humain lui a appris \u00e0 produire. Les annotateurs ont r\u00e9compens\u00e9 les r\u00e9ponses claires, structur\u00e9es, \u00e9quilibr\u00e9es, polies et rassurantes ; le mod\u00e8le a appris \u00e0 maximiser ces signaux jusqu&rsquo;\u00e0 la caricature. Le r\u00e9sultat est une r\u00e9gression vers un registre moyen, celui du r\u00e9dacteur web ou du consultant, que les mod\u00e8les n&rsquo;ont pas invent\u00e9 mais concentr\u00e9. Ce ph\u00e9nom\u00e8ne de resserrement stylistique est document\u00e9 sous le nom d&rsquo;effondrement de mode : les sorties d&rsquo;un mod\u00e8le align\u00e9 sont moins diverses que celles du mod\u00e8le de base.<\/p>\n\n\n\n<h3 id=\"ce-quon-observe\" class=\"wp-block-heading\">Ce qu&rsquo;on observe<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Les constructions rh\u00e9toriques d&rsquo;abord. L&rsquo;antith\u00e8se corrective (\u00ab ce n&rsquo;est pas X, c&rsquo;est Y \u00bb), le recentrage dramatique (\u00ab la vraie question est \u00bb), la question suivie de sa r\u00e9ponse imm\u00e9diate, la r\u00e8gle de trois, la chute sentencieuse en fin de paragraphe, et le participe pr\u00e9sent en queue de phrase (\u00ab soulignant ainsi l&rsquo;importance de \u00bb). Reinhart et al. (2025, <em>PNAS<\/em>) ont mesur\u00e9 que les mod\u00e8les ajust\u00e9s par instruction utilisent nettement plus de propositions participiales et de nominalisations que les humains, sur des corpus contr\u00f4l\u00e9s.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Le vocabulaire ensuite. Kobak et al. (2024) ont analys\u00e9 plus de quatorze millions de r\u00e9sum\u00e9s PubMed et observ\u00e9 l&rsquo;explosion soudaine de mots comme <em>delves<\/em>, <em>underscores<\/em>, <em>intricate<\/em> ou <em>showcasing<\/em> \u00e0 partir de 2023 ; ils en d\u00e9duisent qu&rsquo;au moins 10 % des r\u00e9sum\u00e9s de 2024 ont \u00e9t\u00e9 retravaill\u00e9s par un mod\u00e8le de langage. En fran\u00e7ais, les \u00e9quivalents sont \u00ab souligner \u00bb, \u00ab mettre en lumi\u00e8re \u00bb, \u00ab t\u00e9moigner de \u00bb, \u00ab se pencher sur \u00bb, \u00ab crucial \u00bb, \u00ab incontournable \u00bb, \u00ab marque un tournant \u00bb, \u00ab joue un r\u00f4le cl\u00e9 \u00bb.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La mise en forme enfin. Titres et listes \u00e0 puces l\u00e0 o\u00f9 un humain \u00e9crirait trois paragraphes, gras syst\u00e9matique, sym\u00e9trie des sections, tiret cadratin pour les incises, calques de l&rsquo;anglais et typographie anglaise dans un texte fran\u00e7ais. La page \u00ab Signs of AI writing \u00bb de Wikip\u00e9dia, tenue par les b\u00e9n\u00e9voles du projet de nettoyage, en dresse l&rsquo;inventaire le plus complet.<\/p>\n\n\n\n<h3 id=\"pourquoi-ce-ne-sont-pas-des-preuves\" class=\"wp-block-heading\">Pourquoi ce ne sont pas des preuves<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Ces marqueurs ont trois d\u00e9fauts en tant qu&rsquo;indices d&rsquo;origine. Ils pr\u00e9existaient aux mod\u00e8les : les manuels de r\u00e9daction commerciale, les publications LinkedIn et les rapports de conseil les employaient d\u00e9j\u00e0, et c&rsquo;est pr\u00e9cis\u00e9ment parce qu&rsquo;ils \u00e9taient fr\u00e9quents dans les donn\u00e9es d&rsquo;entra\u00eenement que les mod\u00e8les les ont amplifi\u00e9s. Ils s&rsquo;effacent \u00e0 la premi\u00e8re consigne : un utilisateur qui demande \u00ab \u00e9cris sans listes, sans formules toutes faites, avec des phrases irr\u00e9guli\u00e8res \u00bb en supprime l&rsquo;essentiel, et les \u00e9diteurs de mod\u00e8les ajustent leur entra\u00eenement d\u00e8s qu&rsquo;un tic devient un m\u00e8me public. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Et surtout, ils se r\u00e9pandent chez les humains, ce qui est l&rsquo;objet de la section suivante. Un texte qui accumule dix de ces marqueurs m\u00e9rite un regard attentif ; un texte qui en contient trois ressemble simplement \u00e0 ce qu&rsquo;on \u00e9crit en 2026.<\/p>\n\n\n\n<h2 id=\"la-contamination-de-lecriture-humaine\" class=\"wp-block-heading\">La contamination de l&rsquo;\u00e9criture humaine<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Dans cette affaire, il ne faut pas non plus oublier que les humains se mettent \u00e0 \u00e9crire, et m\u00eame \u00e0 parler, comme les mod\u00e8les, ce qui referme par l&rsquo;autre c\u00f4t\u00e9 l&rsquo;\u00e9cart sur lequel reposent les d\u00e9tecteurs. Ce mouvement est mesur\u00e9, et il est reconnu par les concepteurs d&rsquo;outils eux-m\u00eames.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La mesure la plus frappante porte sur l&rsquo;oral. Une \u00e9quipe de l&rsquo;Institut Max Planck pour le d\u00e9veloppement humain (Yakura et al., 2024) a analys\u00e9 plusieurs centaines de milliers de vid\u00e9os de conf\u00e9rences, de podcasts et de cours universitaires. Dans les dix-huit mois qui ont suivi la sortie de ChatGPT, la fr\u00e9quence des mots typiques du mod\u00e8le, <em>delve<\/em>, <em>meticulous<\/em>, <em>realm<\/em>, <em>comprehend<\/em>, a augment\u00e9 dans la parole spontan\u00e9e des locuteurs anglophones, avec une courbe qui suit celle de l&rsquo;adoption de l&rsquo;outil. Ce n&rsquo;est pas du texte g\u00e9n\u00e9r\u00e9, ce sont des personnes qui ont lu assez de sorties de mod\u00e8les pour en adopter le lexique.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Le m\u00e9canisme est ordinaire. On apprend \u00e0 \u00e9crire par imitation de ce qu&rsquo;on lit, et une part croissante de ce qu&rsquo;on lit est produite ou retouch\u00e9e par des mod\u00e8les. Un \u00e9tudiant qui interroge un assistant tous les jours int\u00e9riorise ses cadences. Un journaliste dont les d\u00e9p\u00eaches passent par un outil de r\u00e9\u00e9criture voit son propre style d\u00e9river. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Un auteur qui utilise un correcteur int\u00e9gr\u00e9 \u00e0 son traitement de texte re\u00e7oit, \u00e0 chaque suggestion accept\u00e9e, une le\u00e7on de style dans la direction du mod\u00e8le. Les outils \u00e9ditoriaux ont d&rsquo;ailleurs rendu la fronti\u00e8re poreuse : Pangram classe comme \u00ab humain \u00bb un texte ayant subi une relecture l\u00e9g\u00e8re ou une traduction litt\u00e9rale, comme \u00ab assist\u00e9 \u00bb un texte r\u00e9\u00e9crit en profondeur, et l&rsquo;\u00e9cart entre les deux d\u00e9pend d&rsquo;un seuil interne.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Les d\u00e9tecteurs le savent. Le rapport de Pangram 4 formule la limite sans d\u00e9tour : le mod\u00e8le ne tient pas compte des personnes qui \u00e9crivent volontairement comme des LLM ou qui ont absorb\u00e9 des \u00e9l\u00e9ments de leur style, et cette d\u00e9rive des donn\u00e9es est un axe majeur de ses recherches. La formulation m\u00e9rite d&rsquo;\u00eatre lue lentement. Le taux de faux positifs de un pour 38 000 en fran\u00e7ais a \u00e9t\u00e9 mesur\u00e9 sur du texte humain d&rsquo;avant 2022, c&rsquo;est-\u00e0-dire sur une population qui n&rsquo;existe plus tout \u00e0 fait. Un d\u00e9tecteur entra\u00een\u00e9 \u00e0 rep\u00e9rer l&rsquo;\u00e9cart entre deux distributions mesure un \u00e9cart que les deux c\u00f4t\u00e9s sont en train de combler.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Il y a une boucle de r\u00e9troaction suppl\u00e9mentaire, propre \u00e0 la suspicion elle-m\u00eame. D\u00e8s qu&rsquo;un tic devient un signal public d&rsquo;IA, les humains qui l&#8217;employaient l&rsquo;abandonnent : on supprime ses tirets cadratins, on \u00e9vite \u00ab souligner \u00bb, on r\u00e9introduit des fautes. La distribution humaine se d\u00e9place alors dans l&rsquo;autre sens, non par contamination mais par \u00e9vitement. Les d\u00e9tecteurs, entra\u00een\u00e9s sur un instantan\u00e9, courent apr\u00e8s une cible qui bouge dans les deux directions \u00e0 la fois. La borne de Sadasivan ne dit pas seulement que les g\u00e9n\u00e9rateurs se rapprochent des humains ; elle s&rsquo;applique aussi quand les humains se rapprochent des g\u00e9n\u00e9rateurs.<\/p>\n\n\n\n<h2 id=\"laffaire-thelyson-orelien-et-la-suspicion-generalisee\" class=\"wp-block-heading\">L&rsquo;affaire Th\u00e9lyson Or\u00e9lien et la suspicion g\u00e9n\u00e9ralis\u00e9e<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Ce que je constate c&rsquo;est aussi que la pr\u00e9somption s&rsquo;est invers\u00e9e : face \u00e0 un texte propre, structur\u00e9 et sans faute, le r\u00e9flexe est d\u00e9sormais de supposer qu&rsquo;une machine l&rsquo;a \u00e9crit. Ce renversement a des causes mesurables et des co\u00fbts qui ne le sont pas encore.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Les causes sont d&rsquo;abord quantitatives. Pangram estime qu&rsquo;une part importante des nouveaux contenus en ligne est largement ou enti\u00e8rement g\u00e9n\u00e9r\u00e9e, et cite dans son rapport des travaux \u00e9valuant \u00e0 plus d&rsquo;un tiers la proportion de nouveaux contenus internet, \u00e0 26 % celle des publications longues sur les r\u00e9seaux sociaux et \u00e0 9 % celle des articles de presse. Quand un lecteur sait qu&rsquo;un texte sur trois ou quatre est produit par une machine, il ajuste sa probabilit\u00e9 a priori, et il a raison de le faire au niveau statistique. Le probl\u00e8me est qu&rsquo;il l&rsquo;applique ensuite \u00e0 chaque texte individuel comme s&rsquo;il s&rsquo;agissait d&rsquo;une certitude.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La suspicion a un co\u00fbt document\u00e9 pour les auteurs. Raj, Berg et Seamans (2026, <em>Journal of Experimental Psychology: General<\/em>) montrent que les lecteurs d\u00e9valuent de fa\u00e7on persistante une \u0153uvre cr\u00e9ative d\u00e8s lors qu&rsquo;on leur indique qu&rsquo;une IA y a contribu\u00e9, m\u00eame quand le texte est identique. Cette p\u00e9nalit\u00e9 de divulgation cr\u00e9e une incitation \u00e0 ne rien d\u00e9clarer, qui nourrit \u00e0 son tour la suspicion : puisque personne n&rsquo;avoue, tout le monde est suspect.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Elle a aussi un co\u00fbt pour la v\u00e9rit\u00e9. L&rsquo;affaire du roman de Th\u00e9lyson Or\u00e9lien en est un cas d&rsquo;\u00e9cole. Un compte anonyme, cr\u00e9\u00e9 quelques jours plus t\u00f4t, publie des captures d&rsquo;\u00e9cran d&rsquo;un d\u00e9tecteur ; le message atteint trois millions de vues en deux jours ; des r\u00e9dactions r\u00e9pliquent le test et obtiennent des r\u00e9sultats convergents ; d&rsquo;autres outils donnent des r\u00e9sultats oppos\u00e9s ; l&rsquo;auteur et ses \u00e9diteurs d\u00e9noncent une campagne, et le d\u00e9bat prend une dimension politique et raciale. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">\u00c0 aucun moment la question du processus d&rsquo;\u00e9criture n&rsquo;est examin\u00e9e, parce que personne n&rsquo;y a acc\u00e8s. La capture d&rsquo;\u00e9cran a tenu lieu de verdict, et le verdict tient lieu de preuve. La chercheuse de la VUB dont l&rsquo;\u00e9tude est invoqu\u00e9e pour d\u00e9fendre l&rsquo;outil \u00e9crit pourtant qu&rsquo;un score d&rsquo;IA ne peut servir que de signal invitant \u00e0 regarder de plus pr\u00e8s.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Il y a enfin un co\u00fbt sur l&rsquo;\u00e9criture elle-m\u00eame, qui rejoint la section pr\u00e9c\u00e9dente. Des auteurs modifient leur style pour ne pas ressembler \u00e0 une machine : phrases volontairement bancales, fautes laiss\u00e9es, structures brouill\u00e9es. Des enseignants apprennent \u00e0 leurs \u00e9l\u00e8ves \u00e0 \u00e9viter les tirets, les listes et le mot \u00ab crucial \u00bb. L&rsquo;\u00e9criture soign\u00e9e devient un indice \u00e0 charge, et la maladresse une preuve d&rsquo;humanit\u00e9. C&rsquo;est une inversion des valeurs de la r\u00e9daction que ni les d\u00e9tecteurs ni les mod\u00e8les n&rsquo;ont voulue, mais que leur coexistence produit.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La suspicion g\u00e9n\u00e9ralis\u00e9e est, au fond, le r\u00e9sultat le plus solide de tout ce qui pr\u00e9c\u00e8de. Puisqu&rsquo;aucune preuve n&rsquo;est possible depuis le texte seul, la place laiss\u00e9e vide est occup\u00e9e par la pr\u00e9somption, et la pr\u00e9somption suit le taux de base per\u00e7u. Tant que l&rsquo;on demandera aux d\u00e9tecteurs de trancher, ils trancheront, et le doute se d\u00e9placera vers ceux qui \u00e9crivent bien.<\/p>\n\n\n\n<h2 id=\"ce-quil-reste-a-faire\" class=\"wp-block-heading\">Ce qu&rsquo;il reste \u00e0 faire<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Un score de d\u00e9tecteur est un signal \u00e0 instruire, pas un verdict \u00e0 publier. Les meilleurs outils sont r\u00e9ellement bons, et un signal fort, r\u00e9pliqu\u00e9 sur un texte long, m\u00e9rite d&rsquo;\u00eatre pris au s\u00e9rieux. Mais le prendre au s\u00e9rieux signifie ouvrir une enqu\u00eate sur le processus, pas clore le d\u00e9bat sur le produit fini.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Pour qui utilise un d\u00e9tecteur, quatre pratiques d\u00e9coulent de ce qui pr\u00e9c\u00e8de. Soumettre le document entier et non un extrait, puis plusieurs d\u00e9coupages, et rapporter la variance. Consigner le texte exact soumis, sa provenance, la version de l&rsquo;outil et la date, puisque tous ces param\u00e8tres changent le r\u00e9sultat. Ne jamais lire un pourcentage comme une probabilit\u00e9, et exiger de l&rsquo;\u00e9diteur du logiciel le corpus sur lequel son taux de faux positifs a \u00e9t\u00e9 mesur\u00e9. Et traiter un verdict \u00ab humain \u00bb comme une absence de signal, jamais comme un certificat.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Pour qui doit trancher, les preuves de processus sont les seules qui vaillent : historiques de versions, brouillons dat\u00e9s, \u00e9changes \u00e9ditoriaux, capacit\u00e9 de l&rsquo;auteur \u00e0 rendre compte de ses choix, bibliographies v\u00e9rifiables. Elles ne sont pas infaillibles, mais elles sont contestables et v\u00e9rifiables, ce qu&rsquo;un score de bo\u00eete noire n&rsquo;est pas. Jabarian et Imas proposent un cadre utile pour les institutions : fixer d&rsquo;abord un plafond de faux positifs tol\u00e9rable, puis n&rsquo;accepter que les outils qui le respectent, et n&rsquo;en faire qu&rsquo;un d\u00e9clencheur d&rsquo;examen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Pour qui \u00e9crit, la seule protection durable est la trace. \u00c9crire dans des outils qui conservent l&rsquo;historique, dater ses brouillons, garder ses notes. C&rsquo;est une contrainte nouvelle et injuste, impos\u00e9e par une technologie que l&rsquo;auteur n&rsquo;a pas choisie. Mais tant que la preuve restera impossible depuis le texte, la provenance restera le seul rempart contre la pr\u00e9somption&#8230; <\/p>\n\n\n\n<h2 id=\"references\" class=\"wp-block-heading\">R\u00e9f\u00e9rences<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Th\u00e9orie de la d\u00e9tection<\/strong><\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Sadasivan, Kumar, Balasubramanian, Wang, Feizi (2023). <em>Can AI-Generated Text be Reliably Detected?<\/em> <a href=\"https:\/\/arxiv.org\/abs\/2303.11156\" target=\"_blank\" rel=\"noopener\">arXiv:2303.11156<\/a><\/li>\n\n\n\n<li>Chakraborty, Bedi, Zhu, An, Manocha, Huang (2023). <em>On the Possibilities of AI-Generated Text Detection.<\/em> <a href=\"https:\/\/arxiv.org\/abs\/2304.04736\" target=\"_blank\" rel=\"noopener\">arXiv:2304.04736<\/a><\/li>\n\n\n\n<li>Krishna, Song, Karpinska, Wieting, Iyyer (2023). <em>Paraphrasing evades detectors of AI-generated text, but retrieval is an effective defense.<\/em> <a href=\"https:\/\/arxiv.org\/abs\/2303.13408\" target=\"_blank\" rel=\"noopener\">arXiv:2303.13408<\/a><\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>M\u00e9thodes statistiques et classifieurs<\/strong><\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Mitchell, Lee, Khazatsky, Manning, Finn (2023). <em>DetectGPT: Zero-Shot Machine-Generated Text Detection using Probability Curvature.<\/em> <a href=\"https:\/\/arxiv.org\/abs\/2301.11305\" target=\"_blank\" rel=\"noopener\">arXiv:2301.11305<\/a><\/li>\n\n\n\n<li>Hans et al. (2024). <em>Spotting LLMs with Binoculars: Zero-Shot Detection of Machine-Generated Text.<\/em> <a href=\"https:\/\/arxiv.org\/abs\/2401.12070\" target=\"_blank\" rel=\"noopener\">arXiv:2401.12070<\/a><\/li>\n\n\n\n<li>Emi, Spero (2024). <em>Technical Report on the Pangram AI-Generated Text Classifier.<\/em> <a href=\"https:\/\/arxiv.org\/abs\/2402.14873\" target=\"_blank\" rel=\"noopener\">arXiv:2402.14873<\/a><\/li>\n\n\n\n<li>Glickenhaus, Thai, Russell, Masrour, Han, Spero, Emi (2026). <em>Pangram 4 Technical Report.<\/em> <a href=\"https:\/\/arxiv.org\/pdf\/2607.27183v1\" target=\"_blank\" rel=\"noopener\">arXiv:2607.27183<\/a><\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Tatouage<\/strong><\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Kirchenbauer, Geiping, Wen, Katz, Miers, Goldstein (2023). <em>A Watermark for Large Language Models.<\/em> <a href=\"https:\/\/arxiv.org\/abs\/2301.10226\" target=\"_blank\" rel=\"noopener\">arXiv:2301.10226<\/a><\/li>\n\n\n\n<li>Dathathri et al. (2024). <em>Scalable watermarking for identifying large language model outputs.<\/em> Nature, 634. <a href=\"https:\/\/www.nature.com\/articles\/s41586-024-08025-4\" target=\"_blank\" rel=\"noopener\">Article<\/a><\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>\u00c9valuations ind\u00e9pendantes et faux positifs<\/strong><\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Jabarian, Imas (2025). <em>Artificial Writing and Automated Detection.<\/em> NBER Working Paper 34223. <a href=\"https:\/\/www.nber.org\/papers\/w34223\" target=\"_blank\" rel=\"noopener\">NBER<\/a><\/li>\n\n\n\n<li>Van Vlasselaer, Van Droogenbroeck, Spruyt (2026). <em>Who wrote this? Evaluating the reliability of AI detection tools in higher education.<\/em> International Journal for Educational Integrity, 22:16. <a href=\"https:\/\/link.springer.com\/article\/10.1007\/s40979-026-00226-w\" target=\"_blank\" rel=\"noopener\">Springer<\/a><\/li>\n\n\n\n<li>Notre Dame (2026). <em>Why AI Detection Fails for Academic Integrity.<\/em> <a href=\"https:\/\/arxiv.org\/pdf\/2608.11256\" target=\"_blank\" rel=\"noopener\">arXiv:2608.11256<\/a><\/li>\n\n\n\n<li>Liang, Yuksekgonul, Mao, Wu, Zou (2023). <em>GPT detectors are biased against non-native English writers.<\/em> Patterns, 4(7). <a href=\"https:\/\/doi.org\/10.1016\/j.patter.2023.100779\" target=\"_blank\" rel=\"noopener\">DOI<\/a><\/li>\n\n\n\n<li>Weber-Wulff et al. (2023). <em>Testing of detection tools for AI-generated text.<\/em> International Journal for Educational Integrity, 19:26. <a href=\"https:\/\/doi.org\/10.1007\/s40979-023-00146-z\" target=\"_blank\" rel=\"noopener\">Springer<\/a><\/li>\n\n\n\n<li>Perkins et al. (2024). <em>Simple Techniques to Bypass GenAI Text Detectors.<\/em> International Journal of Educational Technology in Higher Education, 21:53. <a href=\"https:\/\/doi.org\/10.1186\/s41239-024-00487-w\" target=\"_blank\" rel=\"noopener\">DOI<\/a><\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Style des mod\u00e8les et contamination<\/strong><\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Kobak, Gonz\u00e1lez-M\u00e1rquez, Horv\u00e1t, Lause (2024). <em>Delving into ChatGPT usage in academic writing through excess vocabulary.<\/em> <a href=\"https:\/\/arxiv.org\/abs\/2406.07016\" target=\"_blank\" rel=\"noopener\">arXiv:2406.07016<\/a><\/li>\n\n\n\n<li>Reinhart et al. (2025). <em>Do LLMs write like humans? Variation in grammatical and rhetorical styles.<\/em> PNAS, 122(8). <a href=\"https:\/\/doi.org\/10.1073\/pnas.2422455122\" target=\"_blank\" rel=\"noopener\">DOI<\/a><\/li>\n\n\n\n<li>Yakura, Lopez-Lopez, Brinkmann, Serna, Gupta, Rahwan (2024). <em>Empirical evidence of Large Language Model&rsquo;s influence on human spoken communication.<\/em> <a href=\"https:\/\/arxiv.org\/abs\/2409.01754\" target=\"_blank\" rel=\"noopener\">arXiv:2409.01754<\/a><\/li>\n\n\n\n<li>Russell, Karpinska, Iyyer (2025). <em>People who frequently use ChatGPT for writing tasks are accurate and robust detectors of AI-generated text.<\/em> ACL 2025. <a href=\"https:\/\/arxiv.org\/abs\/2501.15654\" target=\"_blank\" rel=\"noopener\">arXiv:2501.15654<\/a><\/li>\n\n\n\n<li>Wikip\u00e9dia, WikiProject AI Cleanup. <em>Signs of AI writing.<\/em> <a href=\"https:\/\/en.wikipedia.org\/wiki\/Wikipedia:Signs_of_AI_writing\" target=\"_blank\" rel=\"noopener\">Page<\/a><\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Suspicion et perception<\/strong><\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Raj, Berg, Seamans (2026). <em>The artificial intelligence disclosure penalty: Humans persistently devalue AI-generated creative writing.<\/em> Journal of Experimental Psychology: General, 155(4). <a href=\"https:\/\/doi.org\/10.1037\/xge0001889\" target=\"_blank\" rel=\"noopener\">DOI<\/a><\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Affaire Or\u00e9lien et d\u00e9monstrations publiques<\/strong><\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Radio-Canada (23 septembre 2026). <em>Controverse Th\u00e9lyson Or\u00e9lien : ce qu&rsquo;il faut savoir sur Pangram.<\/em> <a href=\"https:\/\/ici.radio-canada.ca\/nouvelle\/2286476\/thelyson-orelien-pangram-test-roman-ia\" target=\"_blank\" rel=\"noopener\">Article<\/a><\/li>\n\n\n\n<li>Le Devoir (23 septembre 2026). <em>Th\u00e9lyson Or\u00e9lien accus\u00e9 sur X d&rsquo;avoir g\u00e9n\u00e9r\u00e9 son roman par IA.<\/em> <a href=\"https:\/\/www.ledevoir.com\/lire\/1011020\/thelyson-orelien-accuse-x-avoir-genere-roman-c-etait-ou-mourir-ia\" target=\"_blank\" rel=\"noopener\">Article<\/a><\/li>\n\n\n\n<li>Franceinfo (23 septembre 2026). <em>Vrai ou faux : l&rsquo;\u00e9crivain Th\u00e9lyson Or\u00e9lien a-t-il utilis\u00e9 l&rsquo;IA ?<\/em> <a href=\"https:\/\/www.franceinfo.fr\/replay-radio\/le-vrai-du-faux\/l-ecrivain-thelyson-orelien-a-t-il-utilise-l-intelligence-artificielle-pour-ecrire-son-premier-roman-c-etait-ca-ou-mourir_8183894.html\" target=\"_blank\" rel=\"noopener\">Article<\/a><\/li>\n\n\n\n<li>Anis Ayari, Defend Intelligence (septembre 2026). Fil X sur le contournement de Pangram par algorithme g\u00e9n\u00e9tique. <a href=\"https:\/\/x.com\/dfintelligence\" target=\"_blank\" rel=\"noopener\">Compte<\/a><\/li>\n<\/ul>\n\n\n<div id=\"rank-math-faq\" class=\"rank-math-block\">\n<div class=\"rank-math-list \">\n<div id=\"faq-question-1790405314529\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Le roman de Th\u00e9lyson Or\u00e9lien a-t-il \u00e9t\u00e9 \u00e9crit par une IA ?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>Personne ne peut l&rsquo;\u00e9tablir \u00e0 partir du texte seul. Le d\u00e9tecteur Pangram classe plus de 94 % de <em>C&rsquo;\u00e9tait \u00e7a ou mourir<\/em> comme g\u00e9n\u00e9r\u00e9, un r\u00e9sultat r\u00e9pliqu\u00e9 par Le Monde, Radio-Canada et franceinfo, tandis que d&rsquo;autres outils concluent l&rsquo;inverse. C&rsquo;est un indice statistique fort, pas une preuve : seuls des brouillons dat\u00e9s, un historique de versions ou des \u00e9changes \u00e9ditoriaux pourraient trancher.<\/p>\n\n<\/div>\n<\/div>\n<div id=\"faq-question-1790405326136\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Comment fonctionne le d\u00e9tecteur Pangram ?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>Pangram est un mod\u00e8le de langage r\u00e9entra\u00een\u00e9 \u00e0 distinguer des millions de textes humains de leurs \u00ab miroirs \u00bb g\u00e9n\u00e9r\u00e9s par une vingtaine d&rsquo;IA. Il lit le texte par fen\u00eatres de 512 tokens, \u00e9tiquette chaque phrase, puis lisse le r\u00e9sultat par plages. Le pourcentage affich\u00e9 est la part du texte \u00e9tiquet\u00e9e IA, et non la probabilit\u00e9 que le texte ait \u00e9t\u00e9 \u00e9crit par une IA.<\/p>\n\n<\/div>\n<\/div>\n<div id=\"faq-question-1790405336320\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Pangram est-il fiable ? Quel est son taux de faux positifs ?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>Pangram annonce un faux positif pour 24 000 textes en anglais et pour 38 000 en fran\u00e7ais, des chiffres confirm\u00e9s par des \u00e9tudes de Chicago et de la VUB. Mais ces taux sont mesur\u00e9s sur du texte web d&rsquo;avant 2022 ; une \u00e9quipe de Notre Dame trouve 64 \u00e0 80 % de signalements sur des textes humains l\u00e9g\u00e8rement retouch\u00e9s. La fiabilit\u00e9 d\u00e9pend du corpus, du d\u00e9coupage et de la version.<\/p>\n\n<\/div>\n<\/div>\n<div id=\"faq-question-1790405346880\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Comment reconna\u00eetre un texte \u00e9crit par ChatGPT ou une autre IA ?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>Certains tics sont fr\u00e9quents : formules du type \u00ab ce n&rsquo;est pas X, c&rsquo;est Y \u00bb, triplets, listes \u00e0 puces, participes pr\u00e9sents, vocabulaire comme \u00ab souligner \u00bb ou \u00ab crucial \u00bb. Mais ces marqueurs pr\u00e9existaient aux mod\u00e8les, disparaissent \u00e0 la premi\u00e8re consigne et se r\u00e9pandent chez les humains. Seuls les artefacts (\u00ab En tant que mod\u00e8le de langage\u2026 \u00bb, r\u00e9f\u00e9rences invent\u00e9es) approchent une preuve.<\/p>\n\n<\/div>\n<\/div>\n<\/div>\n<\/div>\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Aucun outil ne peut prouver qu&rsquo;un texte a \u00e9t\u00e9 \u00e9crit par une intelligence artificielle. Je le dis depuis 2023 : AUCUN outil ne peut PROUVER qu&rsquo;un texte est produit par une IA. Cette phrase peut sembler provocatrice au moment o\u00f9 un roman en lice pour le Goncourt est mis en cause sur la foi de captures d&rsquo;\u00e9cran d&rsquo;un d\u00e9tecteur, et o\u00f9 des r\u00e9dactions enti\u00e8res ont r\u00e9pliqu\u00e9 le test. On peut la reformuler en : Th\u00e9lyson Or\u00e9lien et l&rsquo;IA : peut-on prouver qu&rsquo;un texte est \u00e9crit par une IA ? Elle est pourtant la conclusion commune des math\u00e9maticiens qui ont \u00e9tudi\u00e9 la question, des concepteurs des meilleurs d\u00e9tecteurs, et des chercheurs qui les ont \u00e9valu\u00e9s de mani\u00e8re ind\u00e9pendante.<\/p>\n<p>La confusion vient de ce que le mot \u00ab d\u00e9tecteur \u00bb recouvre des objets tr\u00e8s diff\u00e9rents. Certains mesurent la pr\u00e9visibilit\u00e9 d&rsquo;un texte, d&rsquo;autres apprennent \u00e0 distinguer deux corpus, d&rsquo;autres encore cherchent une signature d\u00e9pos\u00e9e par le g\u00e9n\u00e9rateur. Ces objets n&rsquo;ont ni les m\u00eames forces, ni les m\u00eames angles morts, ni le m\u00eame rapport \u00e0 l&rsquo;id\u00e9e de preuve. Ils ont en commun de produire un score, et ce score est presque toujours mal lu.<\/p>\n<p>Cet article explique ce que ces outils calculent r\u00e9ellement, pourquoi leur r\u00e9sultat ne peut pas constituer une preuve, comment lire leurs taux d&rsquo;erreur, et pourquoi le simple choix du passage soumis peut changer le verdict. Il d\u00e9crit ensuite un ph\u00e9nom\u00e8ne plus lent mais plus profond : les tics d&rsquo;\u00e9criture des mod\u00e8les se r\u00e9pandent dans l&rsquo;\u00e9criture humaine, et la suspicion d&rsquo;IA devient le r\u00e9flexe par d\u00e9faut face \u00e0 tout texte un peu lisse. Les sources sont indiqu\u00e9es au fil du texte et rassembl\u00e9es \u00e0 la fin.<\/p>\n","protected":false},"author":1,"featured_media":1016,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[45],"tags":[49,21],"class_list":["post-1013","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-actualites-de-lia","tag-ia","tag-impacts-metier"],"_links":{"self":[{"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/posts\/1013","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/comments?post=1013"}],"version-history":[{"count":11,"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/posts\/1013\/revisions"}],"predecessor-version":[{"id":1026,"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/posts\/1013\/revisions\/1026"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/media\/1016"}],"wp:attachment":[{"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/media?parent=1013"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/categories?post=1013"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/tags?post=1013"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}