{"id":958,"date":"2026-08-26T06:35:00","date_gmt":"2026-08-26T04:35:00","guid":{"rendered":"https:\/\/alain.goudey.eu\/side\/?p=958"},"modified":"2026-08-25T11:36:43","modified_gmt":"2026-08-25T09:36:43","slug":"ia-et-apprentissage-ce-que-letude-chinoise-prouve-et-ce-quelle-rate-en-6-points","status":"publish","type":"post","link":"https:\/\/alain.goudey.eu\/side\/2026\/08\/26\/ia-et-apprentissage-ce-que-letude-chinoise-prouve-et-ce-quelle-rate-en-6-points\/","title":{"rendered":"IA et apprentissage : ce que l&rsquo;\u00e9tude chinoise prouve, et ce qu&rsquo;elle rate en 6 points"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">C&rsquo;est la rentr\u00e9e ! L&rsquo;\u00e9tude la plus comment\u00e9e du moment sur IA et apprentissage vient de Chine. Dans un working paper intitul\u00e9 <a href=\"https:\/\/papers.ssrn.com\/sol3\/papers.cfm?abstract_id=6977138\" data-type=\"link\" data-id=\"https:\/\/papers.ssrn.com\/sol3\/papers.cfm?abstract_id=6977138\" target=\"_blank\" rel=\"noopener\">The Generative AI Learning Penalty: Evidence from Chinese Secondary Education<\/a> dat\u00e9 de juin 2026 et post\u00e9 sur SSRN en juillet, David Str\u00f6mberg (Universit\u00e9 de Stockholm), Victor Lei et Yanhui Wu (Universit\u00e9 de Hong Kong) suivent 26 811 coll\u00e9giens et lyc\u00e9ens pendant 30 mois. Six mois apr\u00e8s l&rsquo;adoption d&rsquo;une IA g\u00e9n\u00e9rative, les notes de devoirs bondissent de 18 %, le temps de travail chute de 64 \u00e0 45 minutes, et les scores aux examens sur table s&rsquo;effondrent de 20 %.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Le graphique repris par <em>The Economist<\/em> a fait le tour des r\u00e9seaux (mon image d&rsquo;illustration reprise ci-dessous), souvent r\u00e9sum\u00e9 en une phrase : l&rsquo;IA rend les \u00e9l\u00e8ves moins bons. Ce n&rsquo;est pas ce que l&rsquo;\u00e9tude d\u00e9montre. Et ce que le graphique fait croire n&rsquo;est pas exactement ce que le papier mesure !<\/p>\n\n\n<div class=\"wp-block-image\">\n<figure class=\"aligncenter size-full is-resized\"><img loading=\"lazy\" decoding=\"async\" width=\"752\" height=\"900\" src=\"https:\/\/alain.goudey.eu\/side\/wp-content\/uploads\/2026\/08\/1787214634658.jpg\" alt=\"IA g\u00e9n\u00e9rative et apprentissage\" class=\"wp-image-959\" style=\"aspect-ratio:0.8355527005677182;width:526px;height:auto\" srcset=\"https:\/\/alain.goudey.eu\/side\/wp-content\/uploads\/2026\/08\/1787214634658.jpg 752w, https:\/\/alain.goudey.eu\/side\/wp-content\/uploads\/2026\/08\/1787214634658-251x300.jpg 251w\" sizes=\"auto, (max-width: 752px) 100vw, 752px\" \/><figcaption class=\"wp-element-caption\">IA g\u00e9n\u00e9rative et apprentissage<\/figcaption><\/figure>\n<\/div>\n\n\n<p class=\"wp-block-paragraph\">J&rsquo;ai lu le papier en entier, tableaux d&rsquo;annexe compris. Mon verdict tient en une phrase : l&rsquo;identification statistique est parmi les plus solides jamais produites sur ce sujet, mais le m\u00e9canisme qui fait tout l&rsquo;int\u00e9r\u00eat du r\u00e9sultat, \u00e0 savoir ce que les \u00e9l\u00e8ves <em>font<\/em> r\u00e9ellement avec l&rsquo;IA n&rsquo;est pratiquement jamais observ\u00e9. Voici ce que le papier \u00e9tablit, ce qu&rsquo;il sugg\u00e8re seulement, o\u00f9 sa causalit\u00e9 reste discutable, pourquoi sa traduction m\u00e9diatique d\u00e9rape, et pourquoi sa vraie d\u00e9couverte est ailleurs que dans le -20 % ! <\/p>\n\n\n\n<div class=\"wp-block-rank-math-toc-block\" id=\"rank-math-toc\"><h2>Au sommaire<\/h2><nav><ul><li class=\"\"><a href=\"#une-etude-nettement-plus-solide-que-la-moyenne-du-genre\">Une \u00e9tude nettement plus solide que la moyenne du genre<\/a><\/li><li class=\"\"><a href=\"#le-paradoxe-une-econometrie-de-pointe-pour-un-traitement-invisible\">Le paradoxe : une \u00e9conom\u00e9trie de pointe pour un traitement invisible<\/a><\/li><li class=\"\"><a href=\"#outsourcing-et-tutoring-une-mediation-racontee-pas-mesuree\">\u00ab Outsourcing \u00bb et \u00ab tutoring \u00bb : une m\u00e9diation racont\u00e9e, pas mesur\u00e9e<\/a><\/li><li class=\"\"><a href=\"#le-choc-concomitant-que-les-auteurs-ecartent-un-peu-vite\">Le choc concomitant que les auteurs \u00e9cartent un peu vite<\/a><\/li><li class=\"\"><a href=\"#learning-efficiency-une-equation-a-laquelle-il-manque-le-denominateur\">\u00ab Learning efficiency \u00bb : une \u00e9quation \u00e0 laquelle il manque le d\u00e9nominateur<\/a><\/li><li class=\"\"><a href=\"#des-moyennes-qui-ecrasent-les-conditions-frontieres\">Des moyennes qui \u00e9crasent les conditions fronti\u00e8res<\/a><\/li><li class=\"\"><a href=\"#la-vraie-decouverte-le-devoir-ne-prouve-plus-lapprentissage\">La vraie d\u00e9couverte : le devoir ne prouve plus l&rsquo;apprentissage<\/a><\/li><li class=\"\"><a href=\"#le-graphique-de-the-economist-efficace-et-trompeur-trois-fois\">Le graphique de The Economist : efficace, et trompeur trois fois<\/a><\/li><li class=\"\"><a href=\"#les-limites-qui-empechent-de-generaliser\">Les limites qui emp\u00eachent de g\u00e9n\u00e9raliser<\/a><\/li><li class=\"\"><a href=\"#ce-quil-faut-en-faire\">Ce qu&rsquo;il faut en faire<\/a><\/li><\/ul><\/nav><\/div>\n\n\n\n<h2 id=\"une-etude-nettement-plus-solide-que-la-moyenne-du-genre\" class=\"wp-block-heading\">Une \u00e9tude nettement plus solide que la moyenne du genre<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Commen\u00e7ons par rendre justice au travail. Les auteurs exploitent les donn\u00e9es administratives d&rsquo;un comt\u00e9 du centre de la Chine (plus d&rsquo;un million d&rsquo;habitants, 90 % des \u00e9l\u00e8ves du secondaire couverts) : notes et horodatages des devoirs hebdomadaires, examens mensuels sur table, examens communs au comt\u00e9, et les deux examens d&rsquo;entr\u00e9e \u00e0 tr\u00e8s forts enjeux, Zhongkao et Gaokao. On ne demande pas aux \u00e9l\u00e8ves s&rsquo;ils ont l&rsquo;impression d&rsquo;avoir appris ; on observe ce qu&rsquo;ils produisent.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">C\u00f4t\u00e9 m\u00e9thode, c&rsquo;est du s\u00e9rieux : diff\u00e9rence de diff\u00e9rences \u00e9chelonn\u00e9e avec l&rsquo;estimateur de Callaway et Sant&rsquo;Anna (2021), tendances pr\u00e9-adoption plates, tests de spillovers, r\u00e9plication sur les examens communs corrig\u00e9s hors de la classe, et des coefficients qui bougent \u00e0 peine d&rsquo;une sp\u00e9cification \u00e0 l&rsquo;autre. La chute de 20 % des scores mensuels, et de 18 \u00e0 24 % sur les examens d&rsquo;entr\u00e9e pour les adopteurs de longue dur\u00e9e, n&rsquo;est pas un artefact fragile.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Il faut pourtant distinguer trois propositions de statut tr\u00e8s diff\u00e9rent :<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Apr\u00e8s l&rsquo;adoption de l&rsquo;IA, les performances divergent brutalement. C&rsquo;est solidement document\u00e9.<\/li>\n\n\n\n<li>Cette divergence est caus\u00e9e par l&rsquo;adoption, cr\u00e9dible, sous l&rsquo;hypoth\u00e8se de tendances parall\u00e8les, mais observationnel. <\/li>\n\n\n\n<li>La baisse s&rsquo;explique parce que 80 % des \u00e9l\u00e8ves \u00ab externalisent \u00bb leurs devoirs tandis que les autres utilisent l&rsquo;IA comme tuteur et c&rsquo;est l\u00e0 que le papier change de niveau de preuve sans toujours le signaler.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">Les trois sections qui suivent examinent chacun de ces \u00e9tages, dans l&rsquo;ordre inverse de leur solidit\u00e9.<\/p>\n\n\n\n<h2 id=\"le-paradoxe-une-econometrie-de-pointe-pour-un-traitement-invisible\" class=\"wp-block-heading\">Le paradoxe : une \u00e9conom\u00e9trie de pointe pour un traitement invisible<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Voici ce qui m&rsquo;a le plus frapp\u00e9 \u00e0 la lecture. Le traitement \u00e9tudi\u00e9 est en r\u00e9alit\u00e9 <em>\u00ab\u00a0\u00eatre entr\u00e9 dans l&rsquo;\u00e9tat d&rsquo;utilisateur d&rsquo;IA<\/em>\u00ab\u00a0. Les auteurs connaissent la date d&rsquo;adoption d\u00e9clar\u00e9e, les heures hebdomadaires d\u00e9clar\u00e9es, les mati\u00e8res concern\u00e9es et les outils utilis\u00e9s (Doubao, DeepSeek, ChatGLM, Ernie Bot, Qwen). <strong>Ils ne connaissent ni les prompts, ni le nombre d&rsquo;interactions, ni si l&rsquo;\u00e9l\u00e8ve demande la solution ou une explication, ni s&rsquo;il tente une r\u00e9ponse avant de consulter, ni s&rsquo;il copie-colle. <\/strong>Or c&rsquo;est pr\u00e9cis\u00e9ment cela, le traitement p\u00e9dagogique.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Dans mes propres travaux sur l&rsquo;acceptation des technologies, j&rsquo;ai appris \u00e0 me m\u00e9fier de la variable utilisateur \/ non-utilisateur : le TAM et ses h\u00e9ritiers montrent depuis longtemps que l&rsquo;intention d&rsquo;usage ne dit rien de l&rsquo;usage durable, et encore moins de sa nature. Avec une technologie aussi polyvalente qu&rsquo;une IA g\u00e9n\u00e9rative, cette variable devient presque vide. <strong>Deux \u00e9l\u00e8ves peuvent d\u00e9clarer cinq heures par semaine et pratiquer des activit\u00e9s cognitives diam\u00e9tralement oppos\u00e9es : l&rsquo;un externalise la production, l&rsquo;autre demande la contradiction.<\/strong><\/p>\n\n\n\n<blockquote class=\"wp-block-quote is-layout-flow wp-block-quote-is-layout-flow\">\n<p class=\"wp-block-paragraph\">Le papier mesure tr\u00e8s bien l&rsquo;entr\u00e9e dans l&rsquo;\u00e9tat \u00ab j&rsquo;utilise une IA \u00bb, beaucoup moins bien l&rsquo;effet des diff\u00e9rentes formes d&rsquo;usage de cette IA.<\/p>\n<\/blockquote>\n\n\n\n<p class=\"wp-block-paragraph\">Le papier mesure tr\u00e8s bien l&rsquo;entr\u00e9e dans l&rsquo;\u00e9tat \u00ab j&rsquo;utilise une IA \u00bb, beaucoup moins bien l&rsquo;effet des diff\u00e9rentes formes d&rsquo;usage de cette IA. La distinction est majeure, parce que toutes les recommandations de politique \u00e9ducative d\u00e9pendent du second, pas du premier.<\/p>\n\n\n\n<h2 id=\"outsourcing-et-tutoring-une-mediation-racontee-pas-mesuree\" class=\"wp-block-heading\">\u00ab Outsourcing \u00bb et \u00ab tutoring \u00bb : une m\u00e9diation racont\u00e9e, pas mesur\u00e9e<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">La cha\u00eene causale que le papier voudrait \u00e9tablir est une m\u00e9diation classique : adoption de l&rsquo;IA -> externalisation de l&rsquo;effort cognitif -> moins d&rsquo;apprentissage. <strong>Ce qui est r\u00e9ellement observ\u00e9 : 81 % des utilisateurs de plus de cinq mois bouclent leurs devoirs en moins de 50 minutes, plus vite que les non-utilisateurs les plus rapides, avec d&rsquo;excellentes notes de devoirs et de mauvaises notes d&rsquo;examens. <\/strong>C&rsquo;est <em>compatible<\/em> avec de l&rsquo;externalisation. Ce n&rsquo;est pas \u00e9quivalent.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Le temps de compl\u00e9tion est un proxy comportemental, pas une mesure d&rsquo;engagement cognitif. Un \u00e9l\u00e8ve peut apprendre \u00e9norm\u00e9ment en 40 minutes de pratique intense assist\u00e9e, et tr\u00e8s peu en 70 minutes de relecture passive avec un chatbot ouvert. Les auteurs le reconnaissent d&rsquo;ailleurs eux-m\u00eames : <strong>la relation entre temps de devoir et score d&rsquo;examen ne doit pas, \u00e9crivent-ils, \u00eatre interpr\u00e9t\u00e9e comme causale. Le graphique sur le temps qui circule ne d\u00e9montre donc pas que passer plus de temps prot\u00e8ge l&rsquo;apprentissage <\/strong>; il montre qu&rsquo;une variable latente (motivation, supervision parentale, m\u00e9tacognition) distingue deux populations. Les auteurs \u00e9num\u00e8rent eux-m\u00eames ces explications concurrentes en section 5.2, ce qui revient \u00e0 lister les facteurs de confusion du m\u00e9canisme qu&rsquo;ils cherchent \u00e0 d\u00e9fendre.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Et puis, page 20, surgit l&rsquo;explication du sous-groupe pr\u00e9serv\u00e9 : une \u00ab greater skill in using generative AI as a learning aid \u00bb. Comp\u00e9tence jamais d\u00e9finie, jamais mesur\u00e9e, jamais op\u00e9rationnalis\u00e9e. S&rsquo;agit-il de prompting \u00e9labor\u00e9 ? De m\u00e9tacognition ? De v\u00e9rification syst\u00e9matique ? De questionnement socratique ? Rien de tout cela n&rsquo;est observ\u00e9. <\/strong>En termes peirciens, c&rsquo;est une abduction parfaitement l\u00e9gitime : une anomalie appelle une hypoth\u00e8se explicative. Mais une abduction ouvre la prochaine question de recherche ; elle ne cl\u00f4t pas celle-ci. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>La comparaison avec Bastani et al. (PNAS, 2025) est cruelle sur ce point pr\u00e9cis. Leur essai randomis\u00e9 aupr\u00e8s d&rsquo;environ 1 000 lyc\u00e9ens turcs trouve un effet imm\u00e9diat de -17 % en math\u00e9matiques avec un GPT donnant les r\u00e9ponses, et pas de p\u00e9nalit\u00e9 significative avec une version tuteur dot\u00e9e de garde-fous p\u00e9dagogiques.<\/strong> Surtout, ils ont les logs : ils voient qui demande directement la r\u00e9ponse et qui tente d&rsquo;abord, qui sollicite une aide et qui recopie. Str\u00f6mberg et ses coauteurs ont le meilleur terrain longitudinal, \u00e9cologique, et massif mais Bastani a finalement le meilleur microscope. Les deux \u00e9tudes se compl\u00e8tent, mais la premi\u00e8re s&rsquo;appuie un peu confortablement sur la seconde pour combler le trou m\u00e9canistique de ses propres donn\u00e9es.<\/p>\n\n\n\n<h2 id=\"le-choc-concomitant-que-les-auteurs-ecartent-un-peu-vite\" class=\"wp-block-heading\">Le choc concomitant que les auteurs \u00e9cartent un peu vite<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Reste la question causale elle-m\u00eame. La d\u00e9fense principale du papier est \u00e9l\u00e9gante : si des chocs n\u00e9gatifs de cette ampleur \u00e9taient fr\u00e9quents, on devrait les observer aussi chez les non-utilisateurs. Or il est extr\u00eamement rare qu&rsquo;un \u00e9l\u00e8ve sans IA perde plus de 20 % de score moyen en six mois cinq cas dans tout l&rsquo;\u00e9chantillon, et pratiquement aucun en 2022-2023 quand l&rsquo;adoption \u00e9tait encore marginale. L&rsquo;argument a du poids.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Mais il vise le mauvais adversaire. <strong>Le facteur de confusion dangereux n&rsquo;est pas un \u00e9v\u00e9nement exog\u00e8ne isol\u00e9 (une maladie, un d\u00e9m\u00e9nagement) qui ferait brutalement chuter les notes. C&rsquo;est un basculement comportemental latent qui produirait <em>simultan\u00e9ment<\/em> l&rsquo;adoption de l&rsquo;IA et la baisse d&rsquo;investissement scolaire.<\/strong> Concr\u00e8tement : d\u00e9sengagement -> adoption de l&rsquo;IA -> moindre effort g\u00e9n\u00e9ral -> scores en baisse progressive. Les trajectoires observ\u00e9es sont compatibles avec ce sc\u00e9nario comme avec celui du papier (adoption -> externalisation -> baisse). Les pr\u00e9-tendances plates rendent ce sc\u00e9nario alternatif moins trivial, puisqu&rsquo;il faudrait que le basculement d\u00e9marre pr\u00e9cis\u00e9ment au mois d&rsquo;adoption d\u00e9clar\u00e9, d\u00e9clar\u00e9 r\u00e9trospectivement, rappelons-le. Elles ne l&rsquo;\u00e9liminent pas.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Je dois signaler, \u00e0 d\u00e9charge, le second argument des auteurs, plus fort que le premier : la structure fine des effets par mati\u00e8re est quasi identique entre examens mensuels et examens d&rsquo;entr\u00e9e, alors que ces \u00e9preuves diff\u00e8rent par leur port\u00e9e, leurs enjeux, leur correction et leur calendrier. Un facteur de confusion devrait r\u00e9pliquer cette structure pr\u00e9cise, ce qui est difficile. Je pense donc que les r\u00e9sultats sont fortement suggestifs d&rsquo;un effet causal et c&rsquo;est d\u00e9j\u00e0 beaucoup (!) mais le langage de la causalit\u00e9 parfaitement \u00e9tablie, que l&rsquo;abstract assume, va un cran trop loin pour une \u00e9tude d&rsquo;observation \u00e0 date de traitement auto-d\u00e9clar\u00e9e&#8230; un peu de mesure aurait \u00e9t\u00e9 la bienvenue.<\/p>\n\n\n\n<h2 id=\"learning-efficiency-une-equation-a-laquelle-il-manque-le-denominateur\" class=\"wp-block-heading\">\u00ab Learning efficiency \u00bb : une \u00e9quation \u00e0 laquelle il manque le d\u00e9nominateur<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Le passage qui m&rsquo;a fait le plus tiquer se trouve en section 5.1. Dans la zone de recouvrement des temps de devoir (50 \u00e0 65 minutes), les \u00e9l\u00e8ves avec et sans IA obtiennent des scores d&rsquo;examen similaires, alors que les premiers ont de meilleures notes de devoirs, preuve qu&rsquo;ils utilisent bien l&rsquo;outil. Les auteurs v\u00e9rifient que ce sous-groupe n&rsquo;est pas s\u00e9lectionn\u00e9 sur le niveau ant\u00e9rieur, puis concluent que les deux groupes ont une productivit\u00e9 d&rsquo;apprentissage \u00e0 peu pr\u00e8s \u00e9gale, et que l&rsquo;IA ne r\u00e9duit pas ce qu&rsquo;ils appellent la <em>learning efficiency<\/em> de ces \u00e9l\u00e8ves.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Je trouve cette formulation trop forte, pour une raison de d\u00e9finition. Une efficience d&rsquo;apprentissage rapporte un gain d&rsquo;apprentissage \u00e0 un effort cognitif consenti. Ce dont disposent les auteurs, c&rsquo;est un score d&rsquo;examen rapport\u00e9 \u00e0 un intervalle d&rsquo;horodatage entre ouverture et soumission du devoir. Le temps est un intrant grossier : il ne mesure ni la charge cognitive, ni l&rsquo;attention, ni le degr\u00e9 d&rsquo;autonomie, ni la qualit\u00e9 des strat\u00e9gies mobilis\u00e9es. <\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La litt\u00e9rature sur l&rsquo;apprentissage distingue depuis longtemps le <em>time on task<\/em> de la qualit\u00e9 du traitement cognitif : 80 minutes de relecture passive apprennent moins que 35 minutes de pratique de r\u00e9cup\u00e9ration intensive. M\u00eame temps ne signifie pas m\u00eame engagement ; la phrase correcte serait donc : dans ce sous-\u00e9chantillon, conditionnellement \u00e0 ce proxy de temps, aucune p\u00e9nalit\u00e9 suppl\u00e9mentaire n&rsquo;est d\u00e9tectable. C&rsquo;est int\u00e9ressant. Ce n&rsquo;est pas une d\u00e9monstration d&rsquo;efficience \u00e9gale.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>L&rsquo;\u00e9quation implicite du papier c&rsquo;est moins de temps = moins d&rsquo;effort = moins d&rsquo;apprentissage. Mais le point pr\u00e9c\u00e9dant montre que cela ne peut d&rsquo;ailleurs pas devenir une th\u00e9orie g\u00e9n\u00e9rale. <\/strong>L&rsquo;exp\u00e9rience de Kestin et al. (2025), que les auteurs citent eux-m\u00eames, montre qu&rsquo;un tuteur IA con\u00e7u selon des principes p\u00e9dagogiques permet \u00e0 des \u00e9tudiants de physique de Harvard d&rsquo;apprendre davantage en moins de temps qu&rsquo;un dispositif d&rsquo;apprentissage actif en classe. <strong>L&rsquo;IA peut r\u00e9duire le temps tout en augmentant la qualit\u00e9 du feedback. Ce que Str\u00f6mberg montre est plus circonscrit : dans ce contexte pr\u00e9cis, la forte r\u00e9duction de temps est empiriquement associ\u00e9e \u00e0 une forte d\u00e9t\u00e9rioration ult\u00e9rieure.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Un d\u00e9tail du papier renforce d&rsquo;ailleurs le doute sur la stabilit\u00e9 de ce sous-groupe \u00ab vertueux \u00bb : les \u00e9l\u00e8ves qui passent plus de 65 minutes sur leurs devoirs sont tous des adopteurs de moins de cinq mois, et six mois apr\u00e8s l&rsquo;adoption, plus aucun utilisateur d&rsquo;IA ne d\u00e9passe ce seuil. Le plus haut niveau d&rsquo;effort est \u00e9vinc\u00e9 chez tout le monde. Le groupe pr\u00e9serv\u00e9 ressemble moins \u00e0 une population qu&rsquo;\u00e0 un \u00e9tat transitoire.<\/p>\n\n\n\n<h2 id=\"des-moyennes-qui-ecrasent-les-conditions-frontieres\" class=\"wp-block-heading\">Des moyennes qui \u00e9crasent les conditions fronti\u00e8res<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Deuxi\u00e8me r\u00e9flexe de mon m\u00e9tier : un effet moyen n&rsquo;est jamais universel, il faut le borner. Et les mod\u00e9rateurs racontent ici une histoire bien plus int\u00e9ressante que le chiffre unique du graphique viral.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La dose-r\u00e9ponse est massive : -5 % pour les \u00e9l\u00e8ves d\u00e9clarant moins d&rsquo;une heure d&rsquo;IA par semaine, -30 % au-del\u00e0 de cinq heures. Les coll\u00e9giens perdent plus que les lyc\u00e9ens (-24 % contre -17 %), les gar\u00e7ons plus que les filles, et, c&rsquo;est une vraie surprise, le <strong>tercile initialement le plus performant perd plus que le tercile le plus faible (-24 % contre -16 %).<\/strong> <strong>L&rsquo;IA comprime la distribution des comp\u00e9tences par le haut, \u00e0 rebours de la litt\u00e9rature sur la productivit\u00e9 au travail, o\u00f9 elle aide surtout les moins qualifi\u00e9s. Les sciences sociales trinquent le plus (-27 %), devant les STEM (-22 %) et loin devant le chinois (-9 %).<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Deux pr\u00e9cisions que les reprises m\u00e9diatiques gomment syst\u00e9matiquement. Le \u00ab 1,4 \u00e9cart-type \u00bb spectaculaire vient de l&rsquo;agr\u00e9gation entre mati\u00e8res, qui comprime la variance ; au niveau d&rsquo;une mati\u00e8re, l&rsquo;effet standardis\u00e9 est environ deux fois plus faible (0,84 SD en math\u00e9matiques). Et l&rsquo;identification des effets sur Zhongkao et Gaokao (les chiffres les plus repris) est nettement plus faible que celle des examens mensuels, ce que les auteurs admettent honn\u00eatement : ces examens ne sont observ\u00e9s qu&rsquo;une ou deux fois par \u00e9l\u00e8ve, sans pr\u00e9-tendance v\u00e9rifiable.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Dernier signal que je trouve fascinant : l&rsquo;effet \u00e0 cinq mois d&rsquo;exposition passe de -25 % d\u00e9but 2023 \u00e0 -16 % en juin 2025, y compris sur une cohorte fixe d&rsquo;adopteurs pr\u00e9coces. Quelque chose s&rsquo;adapte. Mais quoi ? Meilleurs mod\u00e8les, meilleurs usages, enseignants qui changent leurs devoirs, supervision accrue ? Le papier ne peut pas trancher, toujours pour la m\u00eame raison : l&rsquo;usage n&rsquo;est pas observ\u00e9.<\/strong><\/p>\n\n\n\n<h2 id=\"la-vraie-decouverte-le-devoir-ne-prouve-plus-lapprentissage\" class=\"wp-block-heading\">La vraie d\u00e9couverte : le devoir ne prouve plus l&rsquo;apprentissage<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Si je devais ne retenir qu&rsquo;un r\u00e9sultat, ce ne serait pas le -20 %. Ce serait celui-ci : chez les utilisateurs d&rsquo;IA, au-dessus de la moyenne, plus la note de devoir monte, plus la note d&rsquo;examen descend. La corr\u00e9lation qui fondait un si\u00e8cle de p\u00e9dagogie : bon devoir -> travail fourni -> comp\u00e9tence probable, s&rsquo;inverse, litt\u00e9ralement.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">C&rsquo;est exactement la tension que je documente dans mes propres r\u00e9flexions sur la l\u00e9gitimit\u00e9 de l&rsquo;IA g\u00e9n\u00e9rative dans l&rsquo;enseignement sup\u00e9rieur : la fluidit\u00e9 de l&rsquo;outil cr\u00e9e une dette cognitive, un \u00e9cart croissant entre la performance imm\u00e9diate de l&rsquo;artefact et l&rsquo;apprentissage durable de la personne. Le papier chinois en apporte la d\u00e9monstration la plus massive \u00e0 ce jour, avec un d\u00e9tail qui devrait obs\u00e9der tout responsable p\u00e9dagogique : <strong>la r\u00e9duction du temps de devoir ne repr\u00e9sente que 5 \u00e0 6 % du temps d&rsquo;\u00e9tude hebdomadaire total, pour 20 % de chute aux examens.<\/strong> <\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Le devoir du week-end n&rsquo;est probablement pas le m\u00e9canisme ; il est l&rsquo;indicateur visible d&rsquo;un r\u00e9gime cognitif entier qui bascule : l&rsquo;\u00e9l\u00e8ve qui externalise le devoir du samedi externalise vraisemblablement aussi les exercices, les r\u00e9visions, la pr\u00e9paration.<\/strong> Cela doit pousser \u00e0 guider les \u00e9l\u00e8ves au bon usage de cette technologie. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Autrement dit, ce que l&rsquo;\u00e9tude r\u00e9v\u00e8le n&rsquo;est pas seulement une p\u00e9nalit\u00e9 d&rsquo;apprentissage li\u00e9e \u00e0 l&rsquo;IA. <strong>C&rsquo;est une p\u00e9nalit\u00e9 de design p\u00e9dagogique que l&rsquo;IA expose brutalement : si un devoir peut \u00eatre r\u00e9ussi \u00e0 120 % de la moyenne en vingt minutes par un outil, sans que personne ne sache si l&rsquo;\u00e9l\u00e8ve a pens\u00e9, c&rsquo;est <a href=\"https:\/\/alain.goudey.eu\/side\/2023\/08\/22\/vers-la-fin-des-devoirs-a-la-rentree-a-cause-de-lia\/\" data-type=\"link\" data-id=\"https:\/\/alain.goudey.eu\/side\/2023\/08\/22\/vers-la-fin-des-devoirs-a-la-rentree-a-cause-de-lia\/\">l&rsquo;activit\u00e9 elle-m\u00eame qu&rsquo;il faut interroger<\/a>, autant que l&rsquo;\u00e9l\u00e8ve.<\/strong><\/p>\n\n\n\n<h2 id=\"le-graphique-de-the-economist-efficace-et-trompeur-trois-fois\" class=\"wp-block-heading\">Le graphique de The Economist : efficace, et trompeur trois fois<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Un mot maintenant sur la traduction m\u00e9diatique, parce qu&rsquo;elle conditionne ce que d\u00e9cideurs et parents retiendront. Soyons juste : l&rsquo;article de <em>The Economist<\/em> est plus nuanc\u00e9 que la circulation de son graphique. Le texte dit explicitement que l&rsquo;interdiction scolaire n&rsquo;est pas la conclusion qui s&rsquo;impose, que l&rsquo;essentiel se joue dans la mani\u00e8re dont les \u00e9l\u00e8ves utilisent l&rsquo;outil, et il cite d&rsquo;autres travaux comme l&rsquo;\u00e9tude de Contractor et Reyes notamment o\u00f9 certains usages de l&rsquo;IA produisent au contraire des gains d&rsquo;apprentissage. Trois probl\u00e8mes demeurent, et ils sont instructifs pour quiconque vulgarise de la recherche.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Premier probl\u00e8me, un mot : les 20 % de non-utilisateurs y sont d\u00e9crits comme le groupe de contr\u00f4le. Techniquement, c&rsquo;est le groupe de comparaison d&rsquo;une diff\u00e9rence de diff\u00e9rences, des \u00e9l\u00e8ves qui ont choisi de ne pas adopter.<\/strong> Pour un lecteur grand public, \u00ab groupe de contr\u00f4le \u00bb \u00e9voque une assignation al\u00e9atoire, donc un essai clinique. Ce n&rsquo;en est pas un, et toute la discussion sur les chocs concomitants ci-dessus n&rsquo;existe que pour cette raison. J&rsquo;aurais \u00e9crit : groupe de comparaison d&rsquo;\u00e9l\u00e8ves n&rsquo;ayant pas adopt\u00e9 l&rsquo;IA.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Deuxi\u00e8me probl\u00e8me, plus subtil : le grand graphique repris partout superpose trois distributions entre jamais utilis\u00e9, avant utilisation, pendant utilisation. Ce sont, pour l&rsquo;essentiel, les histogrammes descriptifs de la figure 2 du papier. Or l&rsquo;identification causale ne vient pas de ces histogrammes ; elle vient de l&rsquo;\u00e9tude d&rsquo;\u00e9v\u00e9nement et de l&rsquo;estimateur DID. Les auteurs le disent eux-m\u00eames : le trac\u00e9 des moyennes sert \u00e0 visualiser, l&rsquo;identification vient de l&rsquo;estimateur. <\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Dans la traduction m\u00e9diatique, cet avertissement dispara\u00eet, et <strong>la juxtaposition avant\/apr\u00e8s produit naturellement une impression de causalit\u00e9 \u00e9vidente.<\/strong> S&rsquo;y ajoute un pi\u00e8ge de lecture : les scores sont des indices normalis\u00e9s o\u00f9 100 repr\u00e9sente la moyenne des observations pr\u00e9-adoption. Le graphique n&rsquo;affiche pas des notes sur 100, ce que rien ne signale au lecteur press\u00e9.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Troisi\u00e8me probl\u00e8me, le plus r\u00e9v\u00e9lateur : le dernier paragraphe de l&rsquo;article affirme que les \u00e9l\u00e8ves qui conservent de bons r\u00e9sultats utilisaient plus vraisemblablement les chatbots comme un tuteur, pour se faire expliquer des concepts. C&rsquo;est plausible. Mais ce n&rsquo;est pas observ\u00e9, c&rsquo;est exactement la m\u00eame extrapolation que la \u00ab greater skill \u00bb de la page 20, reprise cette fois sans le conditionnel.<\/strong> <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Et la maxime finale (l&rsquo;IA dope la productivit\u00e9 d&rsquo;apprentissage de ceux qui l&rsquo;utilisent intelligemment) condense en une phrase des r\u00e9sultats de statuts tr\u00e8s diff\u00e9rents : une association longitudinale (Str\u00f6mberg), une corr\u00e9lation de sous-groupes (le temps maintenu), un effet de design d&rsquo;outil (Bastani). Journalistiquement, la phrase est excellente. Scientifiquement, \u00ab intelligemment \u00bb n&rsquo;est pas un concept op\u00e9rationnalis\u00e9 ; c&rsquo;est pr\u00e9cis\u00e9ment la variable que personne n&rsquo;a encore mesur\u00e9e en conditions r\u00e9elles.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Le faisceau de preuves pointe bien vers \u00ab la mani\u00e8re d&rsquo;utiliser compte \u00e9norm\u00e9ment \u00bb. Mais la question scientifique qui reste ouverte est autrement plus exigeante : <strong>quelles s\u00e9quences d&rsquo;interaction humain-IA produisent de l&rsquo;apprentissage, pour quels apprenants, sur quelles t\u00e2ches, \u00e0 quel moment ?<\/strong> Cela reste \u00e0 \u00e9tudier de mani\u00e8re plus formelle \u00e0 mon sens ! <\/p>\n\n\n\n<h2 id=\"les-limites-qui-empechent-de-generaliser\" class=\"wp-block-heading\">Les limites qui emp\u00eachent de g\u00e9n\u00e9raliser<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Avant d&rsquo;en tirer des politiques, cinq r\u00e9serves changent la port\u00e9e des conclusions. L&rsquo;adoption est auto-s\u00e9lectionn\u00e9e et sa date auto-d\u00e9clar\u00e9e r\u00e9trospectivement, m\u00eame si l&rsquo;absence de pr\u00e9-tendances rassure. Le terrain est une unique province chinoise, dans un syst\u00e8me scolaire extr\u00eamement structur\u00e9 et pilot\u00e9 par des examens \u00e0 tr\u00e8s forts enjeux ; la transposition au contexte fran\u00e7ais, o\u00f9 le poids du contr\u00f4le continu et la nature des devoirs diff\u00e8rent, demande de la prudence. Le temps de compl\u00e9tion est l&rsquo;intervalle entre ouverture et soumission du devoir, pas une mesure d&rsquo;attention. Les effets sur les examens d&rsquo;entr\u00e9e reposent sur une identification plus faible. Et le m\u00e9canisme central reste inf\u00e9r\u00e9, faute de logs.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Voici o\u00f9 je place le curseur de confiance, proposition par proposition :<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table class=\"has-fixed-layout\"><thead><tr><th>Proposition<\/th><th>Niveau de preuve<\/th><\/tr><\/thead><tbody><tr><td>L&rsquo;adoption de l&rsquo;IA co\u00efncide avec une rupture devoirs \/ examens<\/td><td>Tr\u00e8s convaincant<\/td><\/tr><tr><td>Cette rupture est causalement li\u00e9e \u00e0 l&rsquo;adoption<\/td><td>Convaincant, non d\u00e9finitif<\/td><\/tr><tr><td>La r\u00e9duction de l&rsquo;effort sur les devoirs est le m\u00e9canisme principal<\/td><td>Plausible, non identifi\u00e9<\/td><\/tr><tr><td>Les \u00e9l\u00e8ves pr\u00e9serv\u00e9s utilisent l&rsquo;IA de fa\u00e7on tutorielle<\/td><td>Suggestif<\/td><\/tr><tr><td>Une \u00ab comp\u00e9tence d&rsquo;usage de l&rsquo;IA \u00bb explique la diff\u00e9rence<\/td><td>Non d\u00e9montr\u00e9<\/td><\/tr><tr><td>L&rsquo;IA ne r\u00e9duit pas la <em>learning efficiency<\/em> du sous-groupe pr\u00e9serv\u00e9<\/td><td>Formulation trop forte pour les mesures disponibles<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Cette hi\u00e9rarchie n&rsquo;enl\u00e8ve rien \u00e0 l&rsquo;\u00e9tude. Elle emp\u00eache simplement de lui faire dire ce qu&rsquo;elle ne dit pas.<\/p>\n\n\n\n<h2 id=\"ce-quil-faut-en-faire\" class=\"wp-block-heading\">Ce qu&rsquo;il faut en faire<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>S\u00fbrement pas interdire l&rsquo;IA : les \u00e9l\u00e8ves \u00e0 usage mod\u00e9r\u00e9 ne pr\u00e9sentent presque aucune p\u00e9nalit\u00e9 d\u00e9tectable, et l&rsquo;exp\u00e9rience de Bastani montre qu&rsquo;un m\u00eame mod\u00e8le produit des effets oppos\u00e9s selon le design d&rsquo;interaction. Le facteur causal int\u00e9ressant n&rsquo;est pas l&rsquo;IA, c&rsquo;est le produit IA \u00d7 forme d&rsquo;usage \u00d7 conception de la t\u00e2che.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Trois leviers concrets se d\u00e9gagent, que je reformule pour un contexte fran\u00e7ais : <\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>r\u00e9augmenter le poids des \u00e9valuations sur table, en pr\u00e9sentiel, pour restaurer le lien entre effort et r\u00e9sultat.<\/li>\n\n\n\n<li>d\u00e9placer le monitoring des parents et des enseignants des outputs (la note du devoir, devenue signal invers\u00e9) vers les inputs (le temps, le processus, la d\u00e9marche). <\/li>\n\n\n\n<li>reconcevoir les devoirs eux-m\u00eames pour que le raisonnement soit observable, n\u00e9cessaire et valoris\u00e9 avec brouillons exig\u00e9s, explicitation orale, t\u00e2ches o\u00f9 l&rsquo;IA est un point de d\u00e9part \u00e0 critiquer plut\u00f4t qu&rsquo;une machine \u00e0 r\u00e9ponses.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">J&rsquo;y ajoute deux demandes. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">\u00c0 la recherche : la prochaine \u00e9tude qui comptera sera celle qui mesurera les s\u00e9quences d&rsquo;interaction avec logs, classification des prompts, tentative avant consultation, demande de solution contre demande d&rsquo;explication, puis testera la m\u00e9diation compl\u00e8te, de l&rsquo;adoption \u00e0 l&rsquo;apprentissage en passant par la strat\u00e9gie d&rsquo;usage. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">\u00c0 ceux qui vulgarisent : distinguer le groupe de comparaison du groupe de contr\u00f4le, l&rsquo;histogramme descriptif de l&rsquo;estimation causale, et l&rsquo;hypoth\u00e8se abductive du r\u00e9sultat \u00e9tabli. C&rsquo;est exactement \u00e0 ce moment l\u00e0 que ce papier, assez remarquable dans la m\u00e9thodologie, a \u00e9t\u00e9 transform\u00e9 en slogan&#8230; m\u00eame si on a envie d&rsquo;y croire ! <\/p>\n","protected":false},"excerpt":{"rendered":"<p>L&rsquo;\u00e9tude la plus comment\u00e9e du moment sur IA et apprentissage vient de Chine. Dans un working paper intitul\u00e9 The Generative AI Learning Penalty: Evidence from Chinese Secondary Education dat\u00e9 de juin 2026 et post\u00e9 sur SSRN en juillet, David Str\u00f6mberg (Universit\u00e9 de Stockholm), Victor Lei et Yanhui Wu (Universit\u00e9 de Hong Kong) suivent 26 811 coll\u00e9giens et lyc\u00e9ens pendant 30 mois. Six mois apr\u00e8s l&rsquo;adoption d&rsquo;une IA g\u00e9n\u00e9rative, les notes de devoirs bondissent de 18 %, le temps de travail chute de 64 \u00e0 45 minutes, et les scores aux examens sur table s&rsquo;effondrent de 20 %.<\/p>\n<p>Le graphique repris par The Economist a fait le tour des r\u00e9seaux (mon image d&rsquo;illustration reprise ci-dessous), souvent r\u00e9sum\u00e9 en une phrase : l&rsquo;IA rend les \u00e9l\u00e8ves moins bons. Ce n&rsquo;est pas ce que l&rsquo;\u00e9tude d\u00e9montre. Et ce que le graphique fait croire n&rsquo;est pas exactement ce que le papier mesure !<\/p>\n","protected":false},"author":1,"featured_media":959,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[2,3],"tags":[105,7,395],"class_list":["post-958","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-education","category-ia-ai","tag-education","tag-ia-generative","tag-scolaire"],"_links":{"self":[{"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/posts\/958","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/comments?post=958"}],"version-history":[{"count":1,"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/posts\/958\/revisions"}],"predecessor-version":[{"id":960,"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/posts\/958\/revisions\/960"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/media\/959"}],"wp:attachment":[{"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/media?parent=958"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/categories?post=958"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/tags?post=958"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}