{"id":1038,"date":"2026-10-09T09:31:43","date_gmt":"2026-10-09T07:31:43","guid":{"rendered":"https:\/\/alain.goudey.eu\/side\/?p=1038"},"modified":"2026-10-09T09:31:44","modified_gmt":"2026-10-09T07:31:44","slug":"tokens-en-francais-la-taxe-invisible-de-31-a-58-face-a-langlais","status":"publish","type":"post","link":"https:\/\/alain.goudey.eu\/side\/2026\/10\/09\/tokens-en-francais-la-taxe-invisible-de-31-a-58-face-a-langlais\/","title":{"rendered":"Tokens en fran\u00e7ais\u00a0: la taxe invisible de 31\u00a0% \u00e0 58\u00a0% face \u00e0 l&rsquo;anglais"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">Tokens en fran\u00e7ais : une IA consomme 31\u00a0% \u00e0 58\u00a0% de tokens de plus qu&rsquo;en anglais pour un contenu identique. C&rsquo;est ce que mesure Thomas Serval, professeur affili\u00e9 \u00e0 <a href=\"https:\/\/www.neoma-bs.fr\" data-type=\"link\" data-id=\"https:\/\/www.neoma-bs.fr\" target=\"_blank\" rel=\"noopener\">NEOMA Business School<\/a>, dans un premier papier publi\u00e9 le 30 septembre 2026, \u00ab\u00a0The Invisible Language Tax\u00a0\u00bb. Il y compare sept tokenizers de 2026, puis teste un prototype con\u00e7u pour le fran\u00e7ais et publie aussi les cas o\u00f9 ce prototype perd.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Thomas Serval, cofondateur et PDG du groupe Baracoda, pass\u00e9 par des postes de direction chez Microsoft et Google, il est membre de l&rsquo;Acad\u00e9mie des technologies et d\u00e9tient quelque 80 brevets en IA et technologies connect\u00e9es. Il a rejoint NEOMA en avril 2025 pour contribuer au NEOMA AI Research Institute. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">\u00c0 NEOMA, la recherche en intelligence artificielle est port\u00e9e par le NEOMA AI Research Institute, que l&rsquo;\u00e9cole pr\u00e9sente comme son initiative strat\u00e9gique phare en IA. L&rsquo;institut rassemble des professeurs, des doctorants et des post-doctorants de plusieurs d\u00e9partements, qui travaillent sur les aspects techniques de l&rsquo;IA comme sur ses applications. Cette \u00e9tude vise \u00e0 regarder les effets induits de la langue dans le traitement IA. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Un token est un fragment de mot. Les grands mod\u00e8les de langage facturent au token, et leur fen\u00eatre de contexte, c&rsquo;est-\u00e0-dire leur m\u00e9moire de travail, se compte dans la m\u00eame unit\u00e9. Le d\u00e9coupage est fait par un outil appel\u00e9 tokenizer, entra\u00een\u00e9 sur des corpus o\u00f9 l&rsquo;anglais domine&nbsp;: un m\u00eame contenu en sort d\u00e9coup\u00e9 en morceaux plus nombreux dans les autres langues.<\/p>\n\n\n\n<div class=\"wp-block-rank-math-toc-block\" id=\"rank-math-toc\"><h2>Au sommaire<\/h2><nav><ul><li class=\"\"><a href=\"#le-francais-paie-31-a-58-de-tokens-en-plus\">Tokens en Fran\u00e7ais : Le fran\u00e7ais paie 31\u00a0% \u00e0 58\u00a0% de tokens en plus<\/a><\/li><li class=\"\"><a href=\"#le-chinois-sen-sort-mieux-que-le-francais\">Le chinois s&rsquo;en sort mieux que le fran\u00e7ais<\/a><\/li><li class=\"\"><a href=\"#langues-regionales-et-doutre-mer-jusqua-3-3-fois-langlais\">Langues r\u00e9gionales et d&rsquo;outre-mer\u00a0: jusqu&rsquo;\u00e0 3,3 fois l&rsquo;anglais<\/a><\/li><li class=\"\"><a href=\"#dou-vient-la-surtaxe-du-francais\">D&rsquo;o\u00f9 vient la surtaxe \u00ab\u00a0Tokens en fran\u00e7ais\u00a0\u00bb<\/a><\/li><li class=\"\"><a href=\"#avec-les-agents-lecart-se-creuse\">Avec les agents, l&rsquo;\u00e9cart se creuse<\/a><\/li><li class=\"\"><a href=\"#un-tokenizer-pense-pour-le-francais-utilise-11-5-de-tokens-en-moins\">Un tokenizer pens\u00e9 pour le fran\u00e7ais utilise 11,5\u00a0% de tokens en moins<\/a><\/li><li class=\"\"><a href=\"#ce-que-letude-ne-demontre-pas\">Ce que l&rsquo;\u00e9tude ne d\u00e9montre pas sur les aspects tokens en fran\u00e7ais<\/a><\/li><li class=\"\"><a href=\"#ce-que-cela-change-si-vous-travaillez-en-francais-avec-une-ia\">Ce que cela change si vous travaillez en fran\u00e7ais avec une IA<\/a><ul><li class=\"\"><a href=\"#faq-question-1791530698611\">Qu&rsquo;est-ce qu&rsquo;un token dans un mod\u00e8le de langage\u00a0?<\/a><\/li><li class=\"\"><a href=\"#faq-question-1791530706338\">Combien de tokens en plus le fran\u00e7ais consomme-t-il par rapport \u00e0 l&rsquo;anglais\u00a0?<\/a><\/li><li class=\"\"><a href=\"#faq-question-1791530717882\">Pourquoi le fran\u00e7ais consomme-t-il plus de tokens que l&rsquo;anglais\u00a0?<\/a><\/li><li class=\"\"><a href=\"#faq-question-1791530731297\">Quel tokenizer est le plus \u00e9conome en fran\u00e7ais\u00a0?<\/a><\/li><li class=\"\"><a href=\"#faq-question-1791530739936\">Le fran\u00e7ais co\u00fbte-t-il plus de tokens que le chinois\u00a0?<\/a><\/li><li class=\"\"><a href=\"#faq-question-1791530750593\">Combien de tokens pour le breton, le corse ou l&rsquo;occitan\u00a0?<\/a><\/li><li class=\"\"><a href=\"#faq-question-1791530760889\">Ce surco\u00fbt en tokens se retrouve-t-il sur la facture\u00a0?<\/a><\/li><li class=\"\"><a href=\"#faq-question-1791530777913\">Peut-on r\u00e9duire le nombre de tokens du fran\u00e7ais\u00a0?<\/a><\/li><li class=\"\"><a href=\"#a-propos-de-letude\">\u00c0 propos de l&rsquo;\u00e9tude<\/a><\/li><\/ul><\/li><\/ul><\/nav><\/div>\n\n\n\n<h2 id=\"le-francais-paie-31-a-58-de-tokens-en-plus\" class=\"wp-block-heading\">Tokens en Fran\u00e7ais : Le fran\u00e7ais paie 31\u00a0% \u00e0 58\u00a0% de tokens en plus<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">La mesure porte sur NTREX-128, un corpus de 1&nbsp;997 phrases de presse en anglais accompagn\u00e9es de traductions professionnelles. Pour un m\u00eame texte, le fran\u00e7ais demande entre 1,31 et 1,58 fois le nombre de tokens de l&rsquo;anglais.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Sept tokenizers de mod\u00e8les tr\u00e8s utilis\u00e9s en 2026 sont compar\u00e9s&nbsp;: OpenAI o200k, Meta Llama 3, Alibaba Qwen3, DeepSeek V3\/V4, Google Gemma 3, Mistral Tekken et celui de la g\u00e9n\u00e9ration 5 de Claude. Ce dernier n&rsquo;est pas public, et l&rsquo;auteur l&rsquo;a mesur\u00e9 phrase par phrase avec l&rsquo;API de comptage d&rsquo;Anthropic.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Tekken, le tokenizer de Mistral, est le moins p\u00e9nalisant avec 31&nbsp;% de tokens en plus. Celui de Llama 3 est le plus p\u00e9nalisant, \u00e0 58&nbsp;%, et Claude 5 se situe \u00e0 45&nbsp;%.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Le fran\u00e7ais reste pourtant bien loti&nbsp;: il se classe entre le 9e et le 24e rang des langues les moins ch\u00e8res, sur 124 traductions non anglaises. La langue m\u00e9diane paie 1,69 \u00e0 2,15 fois le tarif anglais.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Si vous comparez des fournisseurs, comparez les prix par document. Le tokenizer de Claude 5 d\u00e9coupe tous les textes plus finement que les autres (84&nbsp;000 tokens pour le corpus anglais, contre 52&nbsp;000 \u00e0 54&nbsp;000 ailleurs), si bien qu&rsquo;un prix par token ne se compare pas d&rsquo;un fournisseur \u00e0 l&rsquo;autre.<\/p>\n\n\n\n<h2 id=\"le-chinois-sen-sort-mieux-que-le-francais\" class=\"wp-block-heading\">Le chinois s&rsquo;en sort mieux que le fran\u00e7ais<\/h2>\n\n\n\n<figure class=\"wp-block-image size-full\"><img loading=\"lazy\" decoding=\"async\" width=\"640\" height=\"329\" src=\"https:\/\/alain.goudey.eu\/side\/wp-content\/uploads\/2026\/10\/image.png\" alt=\"tokens en fran\u00e7ais\" class=\"wp-image-1037\" srcset=\"https:\/\/alain.goudey.eu\/side\/wp-content\/uploads\/2026\/10\/image.png 640w, https:\/\/alain.goudey.eu\/side\/wp-content\/uploads\/2026\/10\/image-300x154.png 300w\" sizes=\"auto, (max-width: 640px) 100vw, 640px\" \/><figcaption class=\"wp-element-caption\">tokens en fran\u00e7ais<\/figcaption><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Le chinois simplifi\u00e9 va de 5&nbsp;% de tokens en moins que l&rsquo;anglais \u00e0 40&nbsp;% de plus. Il est moins cher que le fran\u00e7ais sur six des sept tokenizers, et la seule exception est Tekken, celui du fran\u00e7ais Mistral.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Qwen3 et DeepSeek, les deux tokenizers d&rsquo;\u00e9diteurs chinois, sont ceux qui traitent le mieux le chinois, et celui de Mistral traite le mieux le fran\u00e7ais. J&rsquo;y lis un argument concret pour le d\u00e9bat sur la souverainet\u00e9&nbsp;: la langue dans laquelle une organisation travaille fait partie des crit\u00e8res de choix d&rsquo;un mod\u00e8le, au m\u00eame titre que le prix affich\u00e9.<\/p>\n\n\n\n<h2 id=\"langues-regionales-et-doutre-mer-jusqua-3-3-fois-langlais\" class=\"wp-block-heading\">Langues r\u00e9gionales et d&rsquo;outre-mer&nbsp;: jusqu&rsquo;\u00e0 3,3 fois l&rsquo;anglais<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Les langues r\u00e9gionales et ultramarines de France paient environ 1,6 \u00e0 3,3 fois le nombre de tokens de l&rsquo;anglais. Comme elles sont absentes de NTREX, la mesure s&rsquo;appuie ici sur la D\u00e9claration universelle des droits de l&rsquo;homme, avec six tokenizers.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Le breton et le corse demandent environ le double des tokens de l&rsquo;anglais, comme le wolof et le bambara dans l&rsquo;espace francophone. Le picard, le wallon et le tahitien montent entre 2,5 et 3,5 fois.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Rapport\u00e9 au fran\u00e7ais, le surco\u00fbt va de 20&nbsp;% pour l&rsquo;occitan \u00e0 45&nbsp;% pour le breton, 90&nbsp;% pour le wallon et 130&nbsp;% pour le tahitien. En tahitien, l&rsquo;okina se note par une apostrophe, qui hache les mots en petits fragments.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Ces valeurs sont des ordres de grandeur, pr\u00e9vient l&rsquo;auteur&nbsp;: il n&rsquo;y a qu&rsquo;un texte par langue, et la correspondance phrase \u00e0 phrase n&rsquo;a pas \u00e9t\u00e9 v\u00e9rifi\u00e9e.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Hors de France, les \u00e9critures non latines restent les plus p\u00e9nalis\u00e9es. Le tib\u00e9tain, le div\u00e9hi, le khmer et le lao atteignent 10 \u00e0 14 fois l&rsquo;anglais sur les tokenizers les moins adapt\u00e9s.<\/p>\n\n\n\n<h2 id=\"dou-vient-la-surtaxe-du-francais\" class=\"wp-block-heading\">D&rsquo;o\u00f9 vient la surtaxe \u00ab\u00a0Tokens en fran\u00e7ais\u00a0\u00bb<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">La surtaxe se d\u00e9compose en deux facteurs, et un seul d\u00e9pend du tokenizer. Le premier est la longueur&nbsp;: sur NTREX, les traductions fran\u00e7aises comptent 18&nbsp;% de caract\u00e8res de plus que l&rsquo;original anglais.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Le second est la compression. \u00c0 nombre de caract\u00e8res \u00e9gal, le fran\u00e7ais consomme de 11&nbsp;% (Tekken) \u00e0 33&nbsp;% (Llama 3) de tokens en plus. Pour Tekken, 1,18 multipli\u00e9 par 1,11 donne 1,31.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">L&rsquo;auteur pr\u00e9cise que cette d\u00e9composition est une identit\u00e9 comptable, sans valeur d&rsquo;explication causale. Le ratio de longueur a \u00e9t\u00e9 observ\u00e9 sur de la presse traduite et ne se g\u00e9n\u00e9ralise pas tel quel \u00e0 d&rsquo;autres textes.<\/p>\n\n\n\n<h2 id=\"avec-les-agents-lecart-se-creuse\" class=\"wp-block-heading\">Avec les agents, l&rsquo;\u00e9cart se creuse<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Sur une requ\u00eate courte, la surtaxe est proportionnelle&nbsp;: \u00e0 prix par token constant, une entr\u00e9e qui co\u00fbte 100 en anglais co\u00fbte 131 \u00e0 158 en fran\u00e7ais. En usage long ou agentique, trois m\u00e9canismes creusent l&rsquo;\u00e9cart en valeur absolue.<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>L&rsquo;historique est renvoy\u00e9 \u00e0 chaque tour. Sans cache, le co\u00fbt cumul\u00e9 cro\u00eet comme le carr\u00e9 du nombre de tours, et l&rsquo;\u00e9cart absolu avec lui.<\/li>\n\n\n\n<li>Les tarifs changent de palier. Google facture l&rsquo;entr\u00e9e de Gemini 3.1 Pro 2 dollars par million de tokens jusqu&rsquo;\u00e0 200\u00a0000 tokens, puis 4 dollars au-del\u00e0 (tarif relev\u00e9 par l&rsquo;auteur le 28 septembre 2026), et un prompt fran\u00e7ais franchit ce seuil plus t\u00f4t.<\/li>\n\n\n\n<li>La fen\u00eatre de contexte se remplit plus vite. Une fen\u00eatre de 128\u00a0000 tokens contient, en fran\u00e7ais, l&rsquo;\u00e9quivalent de 81\u00a0000 \u00e0 98\u00a0000 tokens de contenu anglais, soit 24\u00a0% \u00e0 37\u00a0% de moins.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">Le papier simule une boucle d&rsquo;agent sans cache, qui ajoute 5\u00a0000 tokens \u00e9quivalent anglais par tour, avec la surtaxe de Gemma 3 (1,41). Le prompt fran\u00e7ais franchit le seuil des 200\u00a0000 tokens au tour 29, l&rsquo;anglais au tour 41, et entre les deux chaque tour fran\u00e7ais co\u00fbte 2,8 fois le tour anglais. Le sujet des tokens en fran\u00e7ais est donc une vraie probl\u00e9matique. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Le surco\u00fbt cumul\u00e9 passe ainsi de 41&nbsp;% \u00e0 112&nbsp;%, avant de retomber \u00e0 51&nbsp;% au tour 80. Dans le m\u00eame sc\u00e9nario, la fen\u00eatre de 128&nbsp;000 tokens sature au tour 19 en fran\u00e7ais, contre le tour 26 en anglais.<\/p>\n\n\n\n<h2 id=\"un-tokenizer-pense-pour-le-francais-utilise-11-5-de-tokens-en-moins\" class=\"wp-block-heading\">Un tokenizer pens\u00e9 pour le fran\u00e7ais utilise 11,5&nbsp;% de tokens en moins<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Une partie de la surtaxe vient du tokenizer lui-m\u00eame, c&rsquo;est-\u00e0-dire de ses donn\u00e9es d&rsquo;entra\u00eenement. Pour le montrer, l&rsquo;auteur entra\u00eene des tokenizers identiques en tout point (48 Mo d&rsquo;Europarl, vocabulaire de 50&nbsp;000 tokens) et ne fait varier que la part de fran\u00e7ais.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Passer de 0&nbsp;% \u00e0 25&nbsp;% de fran\u00e7ais fait tomber la surtaxe d&rsquo;environ 1,82 \u00e0 1,17. Au-del\u00e0, le fran\u00e7ais ne gagne presque plus rien (2,3&nbsp;% de tokens en moins entre 25&nbsp;% et 75&nbsp;%) et l&rsquo;anglais se d\u00e9grade de 3,8&nbsp;%. Une part modeste de fran\u00e7ais capte donc l&rsquo;essentiel du gain.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">L&rsquo;exp\u00e9rience n&rsquo;explique pas pourquoi les tokenizers commerciaux font moins bien, pr\u00e9cise l&rsquo;auteur&nbsp;: ils couvrent de nombreuses langues et du code dans un seul vocabulaire, et leurs donn\u00e9es d&rsquo;entra\u00eenement ne sont pas publiques.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Le prototype s&rsquo;appelle Baracoda FR v1.2. C&rsquo;est un tokenizer BPE au niveau de l&rsquo;octet, de la m\u00eame taille de vocabulaire que Tekken (131&nbsp;072 tokens), entra\u00een\u00e9 sur 736 Mo de donn\u00e9es&nbsp;: 300 Mo de web fran\u00e7ais, 300 Mo de web anglais, 100 Mo d&rsquo;Europarl et 36 Mo de code Python.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Le test final porte sur six corpus en fran\u00e7ais et en anglais, jamais consult\u00e9s pendant la conception, avec un protocole que l&rsquo;auteur d\u00e9clare avoir fix\u00e9 \u00e0 l&rsquo;avance. Le prototype y utilise 11,5&nbsp;% de tokens de moins que Tekken en fran\u00e7ais (intervalle de confiance \u00e0 95&nbsp;%&nbsp;: 11,1&nbsp;% \u00e0 11,9&nbsp;%) et 3,7&nbsp;% de moins en anglais. Sur du code Python, mesur\u00e9 \u00e0 part, il en utilise 2,7&nbsp;% de moins.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Le r\u00e9sultat tient apr\u00e8s retrait des phrases de test pr\u00e9sentes dans les donn\u00e9es d&rsquo;entra\u00eenement. Sur NTREX, la surtaxe du fran\u00e7ais descend \u00e0 1,20, contre 1,31 pour Tekken.<\/p>\n\n\n\n<h2 id=\"ce-que-letude-ne-demontre-pas\" class=\"wp-block-heading\">Ce que l&rsquo;\u00e9tude ne d\u00e9montre pas sur les aspects tokens en fran\u00e7ais<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Ces r\u00e9sultats mesurent le d\u00e9coupage du texte. Ils ne disent rien des factures r\u00e9elles, de la qualit\u00e9 d&rsquo;un mod\u00e8le ou de la r\u00e9ussite d&rsquo;une t\u00e2che, et l&rsquo;auteur liste lui-m\u00eame les contreparties de son prototype.<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>En espagnol et en allemand, le prototype consomme 30\u00a0% \u00e0 38\u00a0% de tokens de plus que Tekken, et 2,1 fois plus en chinois.<\/li>\n\n\n\n<li>Les langues r\u00e9gionales n&rsquo;y gagnent rien\u00a0: par rapport \u00e0 Tekken, il faut 3,7\u00a0% de tokens en plus en breton, 7,1\u00a0% en corse et 5,6\u00a0% en occitan.<\/li>\n\n\n\n<li>R\u00e9entra\u00een\u00e9e avec un vocabulaire de taille comparable (32\u00a0768 contre 32\u00a0000 tokens), la m\u00eame recette ne fait pas mieux que le tokenizer de CroissantLLM, un mod\u00e8le bilingue fran\u00e7ais-anglais entra\u00een\u00e9 sur un corpus bien plus large.<\/li>\n\n\n\n<li>Adopter un nouveau tokenizer oblige \u00e0 r\u00e9entra\u00eener au moins les embeddings d&rsquo;un mod\u00e8le, avec un co\u00fbt de calcul et un risque sur la qualit\u00e9 qui restent \u00e0 mesurer.<\/li>\n\n\n\n<li>Le prototype regroupe les chiffres par trois, ce qui pourrait nuire \u00e0 l&rsquo;arithm\u00e9tique des mod\u00e8les. Ce point n&rsquo;a pas \u00e9t\u00e9 test\u00e9.<\/li>\n\n\n\n<li>Les comptages de Claude passent par un point d&rsquo;acc\u00e8s qu&rsquo;Anthropic d\u00e9crit comme une estimation.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">Le prototype rel\u00e8ve donc d&rsquo;un compromis de sp\u00e9cialisation, comme l&rsquo;\u00e9crit l&rsquo;auteur&nbsp;: ce qu&rsquo;il gagne en fran\u00e7ais, en anglais et en Python, il le paie dans les autres langues. J&rsquo;appr\u00e9cie qu&rsquo;il publie aussi la comparaison qu&rsquo;il ne gagne pas, face \u00e0 CroissantLLM.<\/p>\n\n\n\n<h2 id=\"ce-que-cela-change-si-vous-travaillez-en-francais-avec-une-ia\" class=\"wp-block-heading\">Ce que cela change si vous travaillez en fran\u00e7ais avec une IA<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">En 2026, travailler en fran\u00e7ais avec un grand mod\u00e8le de langage demande encore 31&nbsp;% \u00e0 58&nbsp;% de tokens de plus qu&rsquo;en anglais, et environ le double de l&rsquo;anglais pour le breton ou le corse. Une partie de cet \u00e9cart tient aux tokenizers, puisqu&rsquo;un tokenizer entra\u00een\u00e9 avec assez de fran\u00e7ais le r\u00e9duit.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">J&rsquo;en tire deux r\u00e9flexes pour une organisation francophone. D&rsquo;abord, comparer les fournisseurs sur le co\u00fbt d&rsquo;un document type, mesur\u00e9 dans sa langue de travail, puisque les tokenizers ne d\u00e9coupent pas tous aussi finement. Ensuite, chiffrer les usages agentiques sur une session compl\u00e8te, l\u00e0 o\u00f9 jouent les paliers tarifaires et la fen\u00eatre de contexte.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">\u00c0 ce stade, rien ne montre encore qu&rsquo;un tokenizer pens\u00e9 pour le fran\u00e7ais r\u00e9duit le co\u00fbt d&rsquo;une t\u00e2che correctement accomplie par un mod\u00e8le. C&rsquo;est l&rsquo;\u00e9tape suivante annonc\u00e9e par Thomas Serval, en commen\u00e7ant par le fran\u00e7ais de la banque et de l&rsquo;assurance.<\/p>\n\n\n<div id=\"rank-math-faq\" class=\"rank-math-block\">\n<div class=\"rank-math-list \">\n<div id=\"faq-question-1791530698611\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Qu&rsquo;est-ce qu&rsquo;un token dans un mod\u00e8le de langage\u00a0?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>Un token est un fragment de mot produit par un tokenizer, l&rsquo;outil qui d\u00e9coupe le texte avant qu&rsquo;un mod\u00e8le le lise. Les mod\u00e8les facturent au token et leur fen\u00eatre de contexte se compte en tokens.<\/p>\n\n<\/div>\n<\/div>\n<div id=\"faq-question-1791530706338\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Combien de tokens en plus le fran\u00e7ais consomme-t-il par rapport \u00e0 l&rsquo;anglais\u00a0?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>Entre 31\u00a0% et 58\u00a0% de plus pour un contenu identique, selon le tokenizer. La mesure de Thomas Serval porte sur sept tokenizers de 2026 et sur 1\u00a0997 phrases de presse traduites (corpus NTREX-128).<\/p>\n\n<\/div>\n<\/div>\n<div id=\"faq-question-1791530717882\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Pourquoi le fran\u00e7ais consomme-t-il plus de tokens que l&rsquo;anglais\u00a0?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>Pour deux raisons qui se multiplient. Les traductions fran\u00e7aises comptent 18\u00a0% de caract\u00e8res de plus que l&rsquo;anglais, et \u00e0 nombre de caract\u00e8res \u00e9gal le fran\u00e7ais demande encore 11\u00a0% \u00e0 33\u00a0% de tokens en plus selon le tokenizer.<\/p>\n\n<\/div>\n<\/div>\n<div id=\"faq-question-1791530731297\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Quel tokenizer est le plus \u00e9conome en fran\u00e7ais\u00a0?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>Parmi les sept tokenizers mesur\u00e9s, c&rsquo;est Tekken, celui de Mistral, avec 31\u00a0% de tokens de plus que l&rsquo;anglais. Celui de Llama 3 est le plus co\u00fbteux, \u00e0 58\u00a0%. Le prototype Baracoda FR v1.2 descend \u00e0 20\u00a0%, mais c&rsquo;est un tokenizer seul, sans mod\u00e8le entra\u00een\u00e9 avec.<\/p>\n\n<\/div>\n<\/div>\n<div id=\"faq-question-1791530739936\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Le fran\u00e7ais co\u00fbte-t-il plus de tokens que le chinois\u00a0?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>Oui, sur six des sept tokenizers mesur\u00e9s. Le chinois simplifi\u00e9 va de 5\u00a0% de tokens en moins que l&rsquo;anglais \u00e0 40\u00a0% de plus, et seul Tekken, le tokenizer de Mistral, traite mieux le fran\u00e7ais que le chinois.<\/p>\n\n<\/div>\n<\/div>\n<div id=\"faq-question-1791530750593\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Combien de tokens pour le breton, le corse ou l&rsquo;occitan\u00a0?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>Les langues r\u00e9gionales et ultramarines de France demandent environ 1,6 \u00e0 3,3 fois le nombre de tokens de l&rsquo;anglais. L&rsquo;occitan est autour de 1,7 fois, le breton et le corse autour du double, le picard, le wallon et le tahitien entre 2,5 et 3,5 fois. Ce sont des ordres de grandeur, mesur\u00e9s sur un seul texte par langue.<\/p>\n\n<\/div>\n<\/div>\n<div id=\"faq-question-1791530760889\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Ce surco\u00fbt en tokens se retrouve-t-il sur la facture\u00a0?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>L&rsquo;\u00e9tude mesure des tokens et ne s&rsquo;appuie sur aucune facture r\u00e9elle. \u00c0 prix par token constant, le surco\u00fbt est proportionnel sur une requ\u00eate courte. Dans la simulation d&rsquo;agent du papier, il d\u00e9passe 100\u00a0% en cumul\u00e9 lorsqu&rsquo;un prompt fran\u00e7ais franchit plus t\u00f4t un palier tarifaire. Le co\u00fbt complet d&rsquo;une t\u00e2che d\u00e9pend aussi des sorties et de la qualit\u00e9, que l&rsquo;\u00e9tude ne mesure pas.<\/p>\n\n<\/div>\n<\/div>\n<div id=\"faq-question-1791530777913\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Peut-on r\u00e9duire le nombre de tokens du fran\u00e7ais\u00a0?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>Oui, en partie. Dans l&rsquo;exp\u00e9rience contr\u00f4l\u00e9e, un tokenizer entra\u00een\u00e9 avec 25\u00a0% de fran\u00e7ais ram\u00e8ne la surtaxe d&rsquo;environ 1,82 \u00e0 1,17, et le prototype Baracoda FR v1.2 utilise 11,5\u00a0% de tokens de moins que Tekken. En contrepartie, il en consomme davantage en espagnol, en allemand et en chinois, et son adoption impose de r\u00e9entra\u00eener au moins les embeddings d&rsquo;un mod\u00e8le.<\/p>\n\n<\/div>\n<\/div>\n<\/div>\n<\/div>\n\n\n<h3 id=\"a-propos-de-letude\" class=\"wp-block-heading\">\u00c0 propos de l&rsquo;\u00e9tude<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">R\u00e9f\u00e9rence&nbsp;: Thomas Serval, \u00ab&nbsp;The Invisible Language Tax: Token Premiums of French and Regional Languages in 2026 LLM Tokenizers, and a French-Optimized Prototype&nbsp;\u00bb, <a target=\"_blank\" rel=\"noopener\" href=\"https:\/\/arxiv.org\/abs\/2609.39001\">arXiv:2609.39001v1<\/a>, 30 septembre 2026.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Les fichiers du tokenizer, les scripts et les comptages phrase par phrase sont publi\u00e9s sur <a target=\"_blank\" rel=\"noopener\" href=\"https:\/\/github.com\/Baracoda-ai-labs\/baracoda-fr\">GitHub<\/a>, sous licence Apache 2.0 pour le code et CC BY 4.0 pour les r\u00e9sultats. L&rsquo;auteur pr\u00e9cise que mesures, analyses et r\u00e9daction ont \u00e9t\u00e9 r\u00e9alis\u00e9es avec l&rsquo;assistance de syst\u00e8mes d&rsquo;IA.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Tokens en fran\u00e7ais : une IA consomme 31\u00a0% \u00e0 58\u00a0% de tokens de plus qu&rsquo;en anglais pour un contenu identique. C&rsquo;est ce que mesure Thomas Serval, professeur affili\u00e9 \u00e0 NEOMA Business School, dans un premier papier publi\u00e9 le 30 septembre 2026, \u00ab\u00a0The Invisible Language Tax\u00a0\u00bb. Il y compare sept tokenizers de 2026, puis teste un prototype con\u00e7u pour le fran\u00e7ais et publie aussi les cas o\u00f9 ce prototype perd.<\/p>\n<p>Thomas Serval, cofondateur et PDG du groupe Baracoda, pass\u00e9 par des postes de direction chez Microsoft et Google, il est membre de l&rsquo;Acad\u00e9mie des technologies et d\u00e9tient quelque 80 brevets en IA et technologies connect\u00e9es. Il a rejoint NEOMA en avril 2025 pour contribuer au NEOMA AI Research Institute. <\/p>\n<p>\u00c0 NEOMA, la recherche en intelligence artificielle est port\u00e9e par le NEOMA AI Research Institute, que l&rsquo;\u00e9cole pr\u00e9sente comme son initiative strat\u00e9gique phare en IA. L&rsquo;institut rassemble des professeurs, des doctorants et des post-doctorants de plusieurs d\u00e9partements, qui travaillent sur les aspects techniques de l&rsquo;IA comme sur ses applications. Cette \u00e9tude vise \u00e0 regarder les effets induits de la langue dans le traitement IA. <\/p>\n<p>Un token est un fragment de mot. Les grands mod\u00e8les de langage facturent au token, et leur fen\u00eatre de contexte, c&rsquo;est-\u00e0-dire leur m\u00e9moire de travail, se compte dans la m\u00eame unit\u00e9. Le d\u00e9coupage est fait par un outil appel\u00e9 tokenizer, entra\u00een\u00e9 sur des corpus o\u00f9 l&rsquo;anglais domine\u00a0: un m\u00eame contenu en sort d\u00e9coup\u00e9 en morceaux plus nombreux dans les autres langues.<\/p>\n","protected":false},"author":1,"featured_media":1037,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[391,55],"tags":[403,7,401],"class_list":["post-1038","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-dialogues-ia","category-techniques-ia","tag-francais","tag-ia-generative","tag-tokens"],"_links":{"self":[{"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/posts\/1038","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/comments?post=1038"}],"version-history":[{"count":2,"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/posts\/1038\/revisions"}],"predecessor-version":[{"id":1040,"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/posts\/1038\/revisions\/1040"}],"wp:attachment":[{"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/media?parent=1038"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/categories?post=1038"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/alain.goudey.eu\/side\/wp-json\/wp\/v2\/tags?post=1038"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}