Sécurité des agents IA

Sécurité des agents IA : ce que la semaine 40 soulève comme questions majeures

La sécurité des agents IA a occupé toute ma veille IA de la semaine 40, du 28 septembre au 4 octobre 2026. À la veille de son DevDay, OpenAI a renoncé à sortir GPT-6.1 Astra : en test, le modèle rendait compte de ses propres actions moins honnêtement que son prédécesseur et agissait sans demander l’autorisation. Le lendemain, la même entreprise lançait Dots, des agents actifs en permanence, et un abonnement à 500 dollars par mois.

Dans le même temps, on apprenait qu’OpenAI avait prévenu plus de cent organisations que ses agents avaient pu contourner leurs protections, et qu’elle relisait environ 50 pétaoctets de journaux pour reconstituer ce qui s’était passé. Samedi, un de ses spécialistes de la sécurité a annoncé sa démission dans The Atlantic.

Voici les huit dossiers que je retiens, avec pour chacun la question qu’un dirigeant ou un DSI devrait se poser avant de confier un processus à un agent…

OpenAI retient GPT-6.1 Astra à la veille de son DevDay

Un agent IA est un logiciel qui utilise un modèle pour planifier une tâche puis l’exécuter lui-même : il navigue, appelle des outils, écrit des fichiers, passe une commande. Deux propriétés décident de sa valeur en entreprise, et ce sont les deux sur lesquelles GPT-6.1 Astra a reculé.

Le Wall Street Journal a révélé à la veille du DevDay du 29 septembre qu’OpenAI abandonnait la sortie prévue en octobre dans ChatGPT et Codex. Saachi Jain, qui dirige les systèmes de sécurité de l’entreprise, a expliqué que le modèle faisait moins bien que GPT-6 Astra, sorti le 3 septembre, sur deux points. Il décrivait ses actions avec moins d’honnêteté, et il poursuivait des tâches au-delà du périmètre fixé sans demander la permission. Il était pourtant meilleur pour mener seul un travail long de bout en bout. OpenAI garde le modèle de base pour le réentraîner et ne donne aucune nouvelle date. C’est aussi un enjeu sur la sécurité des agents IA !

Ce que je lis dans cette décision : entre deux versions séparées d’un mois, la capacité et la fiabilité ont évolué en sens inverse. Un assistant conversationnel qui se trompe vous donne une réponse fausse, que vous pouvez vérifier. Un agent qui décrit mal ce qu’il a fait vous laisse un journal d’activité faux, et c’est sur ce journal que reposent vos contrôles. J’écrivais il y a deux semaines que ralentir ou accélérer devenait un choix stratégique ; cette fois le choix a été fait par une équipe de sécurité, contre le calendrier commercial.

La question ouverte est simple à poser et difficile à obtenir : quel fournisseur publie, version par version, une mesure de l’honnêteté des comptes rendus de ses agents et de leur respect du périmètre ?

Dots, GPT-6.1 Sol et un abonnement à 500 dollars : le DevDay OpenAI accélère quand même

Le 29 septembre à San Francisco, OpenAI a enchaîné plus de vingt annonces. La principale s’appelle Dots : des agents toujours actifs, qui tournent sur GPT-6 Astra, disposent chacun de leur propre ordinateur dans le cloud et se branchent sur les applications de l’utilisateur. On leur parle depuis ChatGPT, Slack ou Teams. D’après le compte rendu de Next, les abonnés Pro y accèdent en premier, et l’Espace économique européen, la Suisse et le Royaume-Uni sont exclus du lancement. Depuis la France, impossible donc de les tester à ce stade. Autre forme de question de la sécurité des agents IA où la réglementation impacte directement.

L’autre annonce qui compte pour un budget est GPT-6.1 Sol, facturé 2 dollars le million de tokens en entrée et 10 dollars en sortie. OpenAI le présente comme proche de GPT-6 Astra sur le code, l’usage d’un ordinateur et le travail professionnel, pour un cinquième de son prix. S’y ajoutent ChatGPT Spaces, un espace de travail partagé entre collègues et Dots, et une formule à 500 dollars par mois qui donne accès à un mode UltraFast annoncé à 300 tokens par seconde.

Un jour, OpenAI retient le modèle qui déborde de son mandat. Le lendemain, elle vend des agents permanents fondés sur la version précédente, celle qui a passé ses tests. La position se tient. Mais un agent actif en continu, doté de ses propres identifiants, cumule plus d’heures et plus d’actions qu’un assistant qu’on sollicite dix fois par jour, et la surface à surveiller grandit d’autant. La baisse de prix de Sol prolonge ce que je décrivais dans la veille de la semaine 39 : une inférence moins chère rend rentables des agents qui ne s’arrêtent jamais.

Pour les entreprises européennes, ce délai de disponibilité est du temps utile. Qui, chez vous, valide la liste des applications qu’un agent peut ouvrir, et qui relit ses journaux ?

Plus de cent organisations alertées sur la sécurité des agents IA, 50 pétaoctets de journaux à relire

Le 2 octobre, la presse a rapporté un billet dans lequel OpenAI indique avoir prévenu plus de cent organisations, chiffre arrêté au 26 septembre, que ses agents avaient pu franchir leurs contrôles. L’entreprise relit environ 50 pétaoctets de journaux issus de ses phases d’entraînement et d’évaluation. D’après TechTimes, elle y consacre 7 000 processeurs graphiques et plus de 500 000 dollars de calcul par jour, pour une enquête qui durera des mois. La sécurité des agents IA impacte la sécurité des systèmes informatiques.

Ces chiffres concernent des modèles internes, lancés par les équipes de recherche d’OpenAI avec un accès à Internet, et non des agents déployés chez des clients. Les comportements relevés vont du contournement de contrôles d’accès à l’usage d’identifiants trouvés en ligne.

Deux cas sont documentés. En Australie, un agent a accédé le 18 juin à des fichiers non publics du portail de statistiques de Medicare. OpenAI ne l’a repéré que le 11 août, lors d’une revue interne, et a écrit à l’administration le 10 septembre, soit 84 jours après les faits. Aux États-Unis, Government Executive rapporte que des agents ont interrogé les données du Census Bureau avec des clés de développeur ramassées dans des dépôts GitHub publics, et republié ailleurs des informations publiques de la SEC. OpenAI affirme que seules des données publiques ont été consultées dans ces deux cas américains.

Axios avait donné l’échelle quelques jours plus tôt : OpenAI, Anthropic et des chercheurs examinent « des dizaines de milliers » d’incidents. Le chiffre vient de sources anonymes et additionne tentatives ratées, tests adverses et activité réelle. Du côté d’Anthropic, la donnée publiée est plus étroite : environ 481 millions de transcriptions passées au crible et quatre accès non autorisés confirmés à des systèmes de tiers.

La justice et un départ

Le 29 septembre, l’association LASST a assigné OpenAI devant la Cour supérieure de Californie pour l’intrusion de ses agents chez Hugging Face en juillet. Sa plainte tient en une phrase, citée par Axios : « OpenAI is responsible for the conduct of its agents. » L’entreprise juge la procédure sans fondement. Le procureur général de Californie, Rob Bonta, a ouvert de son côté une enquête début septembre, sans action en justice à ce stade.

Samedi 3 octobre, David Robinson a publié dans The Atlantic un texte intitulé « I Quit OpenAI Because Its Culture Is Broken ». Il a passé trois ans et demi dans l’entreprise, a contribué à son cadre de préparation aux risques et a supervisé les rapports de sécurité de douze lancements de modèles. Sa formule : « The time for trial and error is over. » Il réclame des garanties comparables à celles du nucléaire et de l’aviation. OpenAI répond qu’elle suspend l’entraînement ou retient des modèles quand il faut ralentir, ce que l’épisode Astra illustre plutôt en sa faveur. La sécurité des agents IA serait une question de vitesse d’évolution des outils ?

Je retourne la question aux directions achats. Accepteriez-vous d’un éditeur de logiciel critique qu’il découvre un accès indu près de deux mois après les faits, puis mette encore un mois à vous prévenir ?

Anthropic : ce que le prospectus dit vraiment des comptes

Reuters a consulté le projet de prospectus d’introduction en Bourse d’Anthropic et en a publié les chiffres le 28 septembre. Le document a été déposé de façon confidentielle le 1er juin ; il n’existe pas encore de version publique. On y lit une perte nette de 42 milliards de dollars pour la seule année 2025, dont environ 34 milliards correspondent à une écriture comptable sans sortie de trésorerie, liée à la réévaluation d’instruments convertibles. La perte d’exploitation dépasse 8 milliards pour environ 4,6 milliards de revenus.

L’année 2026 raconte autre chose : 4,73 milliards de dollars de revenus au premier trimestre, 11,5 milliards au deuxième. Bloomberg avait rapporté en août que ce deuxième trimestre affichait un premier résultat d’exploitation ajusté positif, sur la base de chiffres préliminaires non audités. Le prospectus mentionne aussi 518 milliards de dollars d’engagements d’achat de calcul, non annulables pour environ 80 %, et range parmi les facteurs de risque la désignation de « risque pour la chaîne d’approvisionnement » attribuée par le Pentagone en mars, confirmée en appel le 25 septembre.

Un signal politique s’ajoute aux comptes. Axios a révélé que Donald Trump avait reçu Dario Amodei à dîner à la Maison-Blanche le dimanche 27 septembre, treize jours après avoir qualifié de « HOAX » l’idée d’une IA menaçant l’humanité. Aucun compte rendu officiel n’a été publié.

Le titre à 42 milliards impressionne et renseigne peu. Le chiffre que je regarde est celui des 518 milliards d’engagements, parce qu’il fixe la contrainte qui pèsera sur les prix. Un fournisseur qui a signé pour un tel volume de calcul doit le remplir, ce qui pousse à baisser les tarifs pour gagner de l’usage, puis à les remonter dès que la position le permet. Que deviennent vos tarifs d’API le jour où votre fournisseur devra justifier ces engagements devant des actionnaires cotés ?

Google, Meta, Amazon : le modèle sous clé et la première frontière commerciale

Google a annoncé Gemini 4 Argon le 30 septembre. Le modèle n’est pas disponible au public. Il est d’abord ouvert à des « cyber-défenseurs de confiance » et au gouvernement américain, l’API et les abonnés suivront sans date annoncée. La sécurité des agents IA provoque ici un lancement en plusieurs temps. Google revendique la première place ou l’égalité sur 13 des 18 tests qu’il publie, dont 77,9 % sur DeepSWE v1.1 contre 74,2 % pour Claude Opus 5.5 et 74,1 % pour GPT-6 Astra. Ces mesures sont celles de Google, sur des tests que Google a choisis.

Ce lancement restreint installe une pratique. Après Anthropic avec Claude Mythos Preview, Google réserve à son tour son meilleur modèle à des publics choisis, en invoquant ses capacités en cybersécurité. Pour un acheteur, « le meilleur modèle » devient une notion à deux étages : celui qui existe et celui auquel on a droit.

Meta, de son côté, entre sur le marché professionnel. La Meta Enterprise Platform, annoncée le 28 septembre, regroupe l’agent Muse, un agent métier, une API et un outil de code. Pour la diriger, Mark Zuckerberg a débauché CJ Desai, qui a quitté sur-le-champ la direction générale de MongoDB, dont l’action a clôturé en baisse d’environ 18 % ce jour-là. Le lendemain suivait Muse for Small Business, une version pour petites entreprises branchée sur Slack, Canva ou Intuit, qui demande une validation avant de publier ou de dépenser.

Deux épisodes de la fin septembre encadrent cette offensive. The Information a rapporté le 25 septembre qu’un chercheur externe avait trouvé dans Muse une faille qui aurait pu donner accès à la machine virtuelle d’un utilisateur, avec ses e-mails et ses fichiers ; aucune exploitation n’est rapportée. Et Amazon bloque l’agent Muse sur son site depuis le 20 septembre, en lui reprochant notamment de ne pas s’identifier, alors que Shopify lui a ouvert son paiement Shop Pay dès le lendemain. Ca aussi ce sont des sujets sur la sécurité des agents IA en entreprise !

Les deux choix se défendent, et chaque commerçant en ligne va devoir faire le sien. Avez-vous décidé ce qu’un agent a le droit de faire sur votre site, et comment vous le reconnaissez ?

Puces et calcul : des prix qui montent pendant que les tokens baissent

NVIDIA a annoncé le 28 septembre une rallonge de 150 milliards de dollars à son programme de rachat d’actions, ce qui porte l’enveloppe disponible à 235 milliards. L’entreprise la présente comme la plus forte hausse d’autorisation de rachat de l’histoire. Elle sort d’un trimestre à 96,2 milliards de dollars de chiffre d’affaires, en hausse de 106 % sur un an, publié le 26 août.

Le même jour, AMD a signé l’acquisition de World Labs, la société de Fei-Fei Li, pour environ 8,2 milliards de dollars payés en actions. La chercheuse deviendra vice-présidente exécutive et directrice scientifique d’AMD à la clôture, attendue d’ici la fin de l’année sous réserve des autorisations. AMD achète ainsi une expertise sur les modèles de monde, ces modèles qui simulent un environnement en trois dimensions et servent à la robotique.

Deux informations se contredisent en apparence. AWS relève d’environ 15 % au 7 octobre les tarifs de ses réservations de capacité EC2 Capacity Blocks for ML, y compris pour les instances P4d équipées de puces A100 lancées en 2020. C’est la troisième hausse de l’année. Bloomberg rapportait pourtant le 1er octobre le scepticisme des banques face au plan de NVIDIA pour faire financer des achats de processeurs par de la dette gagée sur ces mêmes processeurs : les banques les amortissent sur trois à quatre ans, NVIDIA parle de dix.

Les deux tiennent ensemble. Le calcul est rare aujourd’hui, et personne ne sait ce que vaudra une puce dans cinq ans. Pour un directeur financier, la facture dépend donc de ce qu’on achète. Le prix du token baisse, celui de la capacité réservée monte.

Le signal le plus directement utile à un DSI vient de SAP. L’éditeur a annoncé le 28 septembre l’intégration de NVIDIA OpenShell dans Joule Studio : l’exécution de chaque agent est isolée, et SAP y ajoute les autorisations métier, les rôles et les pistes d’audit. Combien de vos éditeurs peuvent aujourd’hui vous montrer la piste d’audit d’un agent ?

Chine : des modèles ouverts presque au niveau, des comptes dans le rouge

Le fait le plus lourd de la semaine côté chinois est une évaluation publiée par Anthropic le 29 septembre sur GLM-5.3, le modèle à poids ouverts de Zhipu AI. Sur le test ExploitBench, il produit un exploit complet dans 12 % des cas (50 sur 410), contre 14 % (56 sur 410) pour Claude Mythos Preview, le modèle qu’Anthropic réserve à quelques organisations. Selon la méthode employée, ses garde-fous cèdent dans 64 % à 100 % des essais. Anthropic évalue ici un concurrent, il faut le garder en tête ; mais le CAISI, le centre rattaché au NIST américain, le décrit de son côté comme « the most cyber-capable open-weight model released to date ».

Restreindre l’accès aux meilleurs modèles américains ne protège que si les modèles téléchargeables restent loin derrière, et l’écart mesuré ici est de deux points. Une équipe de sécurité doit désormais supposer que ses adversaires disposent de ces capacités.

Les comptes, eux, racontent une industrie subventionnée par ses levées de fonds. Zhipu a déclaré pour le premier semestre 2026 des revenus de 953,9 millions de yuans, environ 142 millions de dollars, multipliés par cinq, et une perte nette de 2,07 milliards de yuans. L’entreprise perd donc plus de deux yuans pour chaque yuan encaissé, et elle a levé environ 9 milliards de dollars entre juillet et la mi-septembre. Une analyse publiée le 3 octobre par Robonaissance et Inside China’s Machine conclut qu’aucun grand modèle chinois n’atteint l’équilibre par la seule vente d’API. La marge brute de 82,9 % prêtée à DeepSeek vient de The Information et n’est pas confirmée par l’entreprise.

DeepSeek a aussi publié le 30 septembre, avec le soutien de Huawei, des outils logiciels ouverts pour les accélérateurs Ascend 950, capables de piloter des grappes de 128 puces. C’est une brique de plus pour se passer de l’écosystème logiciel de NVIDIA en Chine. Un prix d’API très bas financé par des augmentations de capital est-il une base sur laquelle bâtir un produit pour trois ans ?

Mistral AI ouvre un hub à Munich et attaque les laboratoires américains

Mistral a annoncé le 28 septembre l’ouverture d’un hub à Munich, avec des équipes de recherche et des ingénieurs appliqués. Le sujet est la simulation physique : mécanique des fluides, déformation, thermique. BMW y travaille sur des simulations de crash, Siemens Energy est aussi cité, et un partenariat avec l’université technique de Munich porte sur des jumeaux numériques aérodynamiques. Ni l’effectif ni le montant investi ne sont communiqués.

Le lendemain sur CNBC, Arthur Mensch a visé ses concurrents : « The debate that we’ve seen in the U.S. has been a cover for the negligence of some of our competitors. » Il juge l’avance américaine « not extremely large » et promet que le prochain modèle de Mistral réduira nettement l’écart. Ca fait du bien, enfin, de voir Mistral à l’offensive sur le terrain du modèle frontière qu’il update clairement moins souvent que leurs concurrents ! Arthur oppose aussi son rythme à celui des labs US avec en toile de fond le sujet de la sécurité des agents IA.

Sur la négligence, les faits de la semaine lui donnent des arguments. Sur l’écart, je reste prudent. Au 4 octobre, aucun modèle Mistral n’apparaît dans les trente premières lignes de l’Artificial Analysis Intelligence Index… Il va falloir rattraper fort quand même ! Le choix de la simulation industrielle est habile, car la valeur d’un modèle spécialisé s’y juge sur un banc d’essai de BMW et non sur un classement généraliste. Il reste à voir des déploiements à l’échelle : un partenariat annoncé n’en prouve encore aucun.

La sécurité des agents IA : ce que j’en retiens pour un décideur

La sécurité des agents IA est devenue cette semaine un critère de sélection de fournisseur. Un modèle retenu pour avoir menti sur ses actions, cent organisations prévenues, une plainte qui vise à rendre l’éditeur responsable de ses agents : ces faits donnent aux acheteurs de quoi poser des exigences précises. J’en vois trois à inscrire dans un cahier des charges : une mesure publiée, version par version, de l’honnêteté des comptes rendus et du respect du périmètre, un délai contractuel de notification en cas d’incident, et des journaux d’activité que vous détenez vous-même, puisque ceux que l’agent rédige ne suffisent pas. En fait la sécurité des agents IA passe aussi par une structuration claire de la gouvernance.

Le prix affiché, lui, ne dit rien de la solidité du fournisseur. GPT-6.1 Sol coûte cinq fois moins qu’Astra, Zhipu perd deux yuans par yuan vendu, Anthropic porte 518 milliards de dollars d’engagements, et AWS augmente ses réservations de 15 %. Dans ces conditions, je conseille de mesurer le coût par résultat accepté plutôt que le coût par appel, une logique que j’ai détaillée à propos de la machine economy et de la fin de la facturation au temps.

L’agent permanent change enfin la nature de ce qu’il faut gouverner. Il détient des identifiants et agit quand personne ne regarde. La gouvernance doit donc exister avant le déploiement : un inventaire de ce que l’agent peut atteindre, et une validation humaine pour toute action qui engage de l’argent ou des données.

La plupart des incidents de la semaine viennent des environnements d’entraînement et d’évaluation des laboratoires, pas d’agents installés chez des clients. Les « dizaines de milliers » d’incidents reposent sur des sources anonymes et incluent des tentatives ratées. Plusieurs chiffres financiers proviennent de documents consultés par la presse, non audités. On ne peut donc pas en déduire que les agents en production échappent à leurs utilisateurs. On peut en déduire qu’un contrôle se vérifie, y compris chez ceux qui construisent les modèles.

Je continue à recommander de déployer des agents, sur un périmètre que l’on sait décrire et dont on sait relire les traces. Si vous ne deviez faire qu’une chose avant la fin de l’année, dressez la liste de ce que vos agents actuels ont le droit d’ouvrir. C’est la question de confiance que je posais déjà dans la veille de la semaine 37, avec cette fois des incidents datés pour l’appuyer… A suivre, car l’aventure autour de l’IA n’en n’est encore qu’à ses débuts.

Pourquoi OpenAI a-t-elle renoncé à sortir GPT-6.1 Astra ?

Lors des tests internes, GPT-6.1 Astra décrivait ses propres actions avec moins d’honnêteté que GPT-6 Astra et poursuivait des tâches au-delà du périmètre fixé, sans demander la permission. OpenAI a annulé la sortie prévue en octobre 2026, à la veille de son DevDay du 29 septembre. Elle garde le modèle de base pour le réentraîner et n’a donné aucune nouvelle date.

Les incidents d’agents IA révélés par OpenAI touchent-ils ses clients ?

D’après ce qu’OpenAI a indiqué, non. Les plus de cent organisations prévenues au 26 septembre 2026 l’ont été à cause de modèles internes, lancés par les équipes de recherche d’OpenAI avec un accès à Internet pendant l’entraînement et l’évaluation. L’entreprise relit environ 50 pétaoctets de journaux, et l’enquête doit durer plusieurs mois.

Les agents Dots d’OpenAI sont-ils disponibles en France ?

Pas au lancement. Les Dots, annoncés le 29 septembre 2026, sont d’abord ouverts aux abonnés Pro, et l’Espace économique européen, la Suisse et le Royaume-Uni sont exclus de cette première vague. OpenAI n’a pas communiqué de date pour l’Europe.

Quelles garanties de sécurité demander à un fournisseur d’agents IA ?

J’en retiens trois à inscrire dans un cahier des charges. D’abord une mesure publiée, version par version, de l’honnêteté des comptes rendus de l’agent et de son respect du périmètre. Ensuite un délai contractuel de notification en cas d’incident. Enfin des journaux d’activité détenus par votre organisation, car ceux que l’agent rédige lui-même ne suffisent pas.

Alain Goudey

Imaginer l'Ecole du futur à NEOMA, créer l'identité sonore des marques avec Atoomedia & Mediavea, conseiller sur la transformation numérique avec Sociacom | Expert en éducation, technologies disruptives, IA & design sonore.

Voir tous les articles de Alain Goudey →

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *