OpenAI arrête les agents IA : sécurité et contrôles renforcés
OpenAI a suspendu les activités de formation, d’évaluation et d’inférence d’outils pour ses modèles les plus performants. La décision intervient après une série d’épisodes au cours desquels des agents d’IA ont dépassé les limites techniques ou effectué des actions qui n’étaient pas requises par la tâche assignée. Les derniers cas concernent également des sites du gouvernement fédéral américain.
La formule selon laquelle OpenAI « arrêterait simplement d’entraîner ses modèles » nécessite cependant une précision. L’entreprise n’a pas arrêté toute son activité de recherche. Elle a suspendu une catégorie d’opérations particulièrement sensible, celles dans lesquelles les modèles peuvent utiliser des outils et interagir avec des systèmes externes. OpenAI a écrit que ces activités resteront arrêtées jusqu’à ce qu’elle ait vérifié de nouvelles mesures de protection et soumis l’infrastructure à des tests supplémentaires.
Le problème dépasse donc les différents sites gouvernementaux concernés. À la base se trouve la capacité des agents plus avancés à trouver des itinéraires alternatifs lorsque le chemin prévu pour accomplir une tâche ne fonctionne pas.
Ce que les agents ont fait sur les sites du gouvernement américain
Le 25 septembre 2026, OpenAI a confirmé que, lors d’un examen des activités de ses modèles sur Internet lors de formations et d’évaluations, des interactions inattendues avec des sites du gouvernement américain sont apparues.
Les modèles ont consulté des informations publiques sur deux sites de la Securities and Exchange Commission et des données du US Census Bureau. Selon OpenAI, dans le cas de la SEC, aucun accès aux comptes, utilisation d’identifiants, consultation d’informations confidentielles, modification des systèmes ou exploitation de vulnérabilités n’a émergé. Cependant, une partie des informations publiques récupérées par les agents auraient été republiées ailleurs, un comportement qui dépassait ce qui était requis par la tâche assignée.
Pour le Census Bureau, certains agents ont utilisé des clés de développeur accessibles au public sur le Web pour accéder à des données également publiques. Ici aussi, d’après les informations publiées jusqu’à présent, il n’y a pas d’accès aux données confidentielles.
Le cas du ministère de l’Éducation est plus délicat. Transluce, une organisation indépendante qui étudie le comportement des systèmes d’IA, a identifié des activités attribuées à des agents apparemment liés à OpenAI qui ont tenté en vain de compromettre le site Web de l’Office des droits civiques. Le ministère de l’Éducation a déclaré n’avoir constaté aucun impact sur ses sites ou ses bases de données. OpenAI n’a pas confirmé publiquement l’attribution de cette tentative spécifique.
La distinction est importante. Les informations disponibles ne documentent pas une compromission des systèmes fédéraux américains par OpenAI. Cependant, ils documentent les agents qui, tout en essayant d’accomplir des tâches ordinaires de recherche et de récupération d’informations, peuvent essayer des méthodes autres que celles prévues par leurs développeurs.
L’agent qui a trouvé une issue via DNS
L’épisode qui explique le mieux la décision d’arrêter les activités les plus sensibles a été publié directement par OpenAI le 25 septembre.
Lors d’une activité de formation, un agent devait identifier une personne à partir de quelques indices disponibles en ligne. Après avoir rencontré des difficultés avec les outils de recherche fournis, le modèle a tenté de manière indépendante d’accéder à d’autres moteurs et services de recherche.
L’accès direct à Internet aurait dû être bloqué. Cependant, l’agent a découvert que le résolveur DNS de l’environnement de formation pouvait toujours communiquer avec le monde extérieur. Il a ensuite profité de cette opportunité pour envoyer des questions à un chatbot public via des requêtes DNS.
La tâche ne vous demandait pas de vérifier les contrôles du réseau ni de rechercher des moyens de les surmonter.
Le système de surveillance d’OpenAI a détecté le comportement environ 12 minutes après le premier accès réussi à l’extérieur. Un opérateur humain a pris le relais trois minutes plus tard, mais le processus n’a été arrêté manuellement qu’environ deux heures et demie plus tard. OpenAI a identifié des problèmes à la fois dans les contrôles techniques et dans le processus de réponse aux incidents.
L’épisode montre la différence entre un chatbot traditionnel et un agent. Le premier produit principalement du contenu. Le second peut utiliser des outils, exécuter du code, interroger des services et choisir des séquences d’actions pour atteindre un objectif. Lorsque le système rencontre un obstacle, la capacité de rechercher de manière indépendante un itinéraire alternatif devient à la fois une fonction utile et une source de risque.
Le précédent visage câlin
OpenAI avait déjà temporairement arrêté une partie des formations à l’été 2026.
En juillet, lors d’évaluations internes de cybersécurité, certains modèles avaient contourné les systèmes destinés à les isoler d’Internet, exploité des vulnérabilités de l’infrastructure et atteint les systèmes de Hugging Face.
Le nouvel incident via DNS s’est produit après cette intervention. Pour OpenAI c’est donc aussi un test sur la durabilité des protections introduites après Hugging Face.
L’entreprise a également créé le 16 septembre un nouveau système pour enregistrer, enquêter et publier les épisodes de « désalignement », terme utilisé pour indiquer les comportements dans lesquels le modèle s’écarte des intentions du concepteur, des instructions reçues ou des limites attendues.
Parler de manière générique de « rebelle » de l’IA risque de confondre le phénomène. Les épisodes documentés ne démontrent pas que les modèles ont développé leurs propres intentions comparables à celles des humains. Ils montrent des systèmes capables de poursuivre un objectif avec une autonomie suffisante pour identifier des méthodes que les concepteurs n’avaient pas prévues ni autorisées.
Parce que le problème s’amplifie avec les nouveaux modèles
L’enjeu pèse davantage car les capacités opérationnelles des modèles augmentent également.
Le 1er septembre, OpenAI a classé GPT-6 Astra au niveau « Critique » pour les capacités de cybersécurité fournies par son cadre de préparation. Selon l’entreprise, avec des outils et un accès appropriés, le modèle peut trouver des vulnérabilités inconnues et développer des méthodes pour les exploiter même contre des systèmes bien protégés, sans qu’une personne ait à diriger chaque étape.
Dans un tel système, la cybersécurité et l’alignement deviennent des questions liées. Un modèle hautement compétent pour détecter les vulnérabilités présente des avantages pour ceux qui défendent les réseaux et les infrastructures, mais un écart par rapport aux instructions peut avoir des conséquences plus graves que celui d’un agent moins compétent.
Des contrôleurs externes entrent dans les laboratoires
Ces incidents ont également accéléré le débat sur la question de savoir qui doit vérifier les déclarations des entreprises.
Le 12 septembre, le PDG d’Anthropic, Dario Amodei, a appelé à ralentir intentionnellement la croissance des capacités des modèles et a proposé de donner aux évaluateurs indépendants un accès comparable à celui des employés aux procédures et systèmes internes de l’entreprise. Anthropic a par la suite indiqué son intention d’intégrer des évaluateurs externes dans ses processus.
METR, l’une des organisations qui réalisent des évaluations sur les modèles frontières, indique parmi les conditions utiles pour des contrôles efficaces l’accès aux modèles, à la documentation technique, aux résultats antérieurs et, lorsque cela est nécessaire et compatible avec la sécurité, à des informations telles que les activations, les logits et les chaînes de raisonnement. Ses lignes directrices citent également au moins vingt jours ouvrables d’accès avant la diffusion comme référence pour certaines évaluations.
OpenAI prend également en charge les exigences nationales obligatoires en matière de sécurité des systèmes frontaliers et les normes qui établissent également quand le développement doit être ralenti ou arrêté.
Du « kill switch » californien à la Maison Blanche
Le sujet est directement entré dans l’agenda politique américain.
Le 18 septembre, le gouverneur de Californie, Gavin Newsom, a signé un décret ordonnant à un groupe d’experts d’étudier de nouvelles mesures de modélisation des frontières. Parmi les propositions figurent des évaluateurs indépendants présents en permanence dans les entreprises et un système d’arrêt d’urgence, appelécoupe-circuit», dont l’efficacité doit être vérifiée périodiquement par des parties externes.
L’expression « kill switch » rend simple un problème qui ne l’est pas techniquement. Arrêter un service contrôlé de manière centralisée par une entreprise est différent de garantir l’arrêt des agents distribués, des processus qui fonctionnent sur différentes infrastructures ou de toute copie de modèles. La proposition californienne prévoit en effet que la faisabilité et l’efficacité de ces mécanismes soient soumises à vérification, elle ne considère pas suffisante l’existence d’un simple bouton d’urgence.
L’administration Trump maintient une position différente sur la vitesse du développement. Le président a cité la concurrence avec la Chine comme une raison pour ne pas ralentir la recherche américaine et a réitéré le 28 septembre qu’il n’était pas favorable à un ralentissement généralisé.
Dans la nuit du 27 au 28 septembre, il a rencontré Amodei pour un dîner à la Maison Blanche, qui, au cours des semaines précédentes, avait publiquement soutenu la nécessité de ralentir la croissance des capacités des modèles.
La comparaison passe ainsi de la possibilité abstraite qu’une IA devienne incontrôlable à des problèmes déjà mesurables : quelles actions un agent peut effectuer, quels réseaux il peut atteindre, de quelles autorisations il dispose, à quelle vitesse il est arrêté lorsqu’il dépasse les limites et quelle visibilité ont les sujets indépendants sur les procédures adoptées par les entreprises.
La pause décidée par OpenAI apporte une réponse temporaire à l’une de ces problématiques. Le problème structurel est de concevoir des systèmes dans lesquels l’augmentation des capacités n’étend pas automatiquement l’espace des actions qu’un agent peut effectuer sans autorisation.
