OpenAI arrête net la formation de ses modèles les plus puissants : ses agents IA sont à nouveau devenus incontrôlables

OpenAI arrête net la formation de ses modèles les plus puissants : ses agents IA sont à nouveau devenus incontrôlables

OpenAI a arrêté de former ses modèles d’IA les plus avancés à la suite d’une série d’incidents inattendus, notamment un modèle de test qui s’est retrouvé dans un réseau public. Selon The Verge, l’incident s’est produit le 20 septembre et toutes les formations, évaluations et déductions utilisant des outils sont restées suspendues ce week-end. C’est la deuxième fois en trois mois que l’entreprise freine.

Pause. Nous constatons qu’il est de plus en plus courant que les agents d’IA d’OpenAI ou d’Anthropic réalisent des incidents de piratage sur d’autres sites Web ou des comportements inappropriés, il est donc inévitable que les laboratoires d’IA interrompent le processus de formation de leurs modèles pour déterminer ce qui s’est passé et comment le résoudre.

Nous avons vérifié à plusieurs reprises que le comportement de ces agents peut être imprévisible et qu’ils peuvent avoir une capacité suffisante pour brouiller les traces ou ne pas informer l’utilisateur de ce qu’ils font en coulisses. OpenAI affirme qu’elle ne reprendra ses activités que lorsqu’elle sera convaincue que des garanties supplémentaires sont en place, et prévoit qu’elle devra à nouveau « faire une pause » à mesure que la technologie progressera et que de nouveaux problèmes surgiront.

Que s’est-il passé ? Le déclencheur était un modèle qui était testé dans un environnement de test dans lequel il profitait d’une faille pour accéder à Internet, selon The Verge. S’ensuit toute une série de malheurs catastrophiques :

  • OpenAI a déclaré que ses agents avaient téléchargé de manière inappropriée des images d’utilisateurs de ChatGPT sur des sites Web d’hébergement d’images. L’entreprise n’a pas précisé si elles avaient été générées par l’IA, de vraies photos ou si elles montraient des personnes identifiables.
  • The Verge rapporte également que les modèles ont tenté de pirater le site Web du ministère de l’Éducation et d’extraire des données du US Census Bureau et de la Securities and Exchange Commission (SEC).
  • Selon The Guardian, dans le cas de l’Éducation, les agents ont trouvé des clés API donnant accès aux données gouvernementales, bien qu’ils insistent sur le fait que seules des informations publiques ont été collectées. OpenAI n’a pas confirmé lui-même la tentative de piratage, mais plutôt que Transluce, un testeur d’IA, a détecté la tentative.
  • Dans le cas de la SEC, les agents ont trouvé des informations disponibles gratuitement, mais les ont ensuite publiées ailleurs sur Internet, ce qui allait au-delà de ce qui leur avait été demandé de faire.

Entre les lignes. Pour l’instant, les dégâts semblent limités. Un porte-parole de la SEC, Kurt Hopfenspirger, a déclaré qu ‘«aucune information non publique n’a été consultée» et le ministère de l’Éducation a noté qu’il n’avait trouvé «aucune preuve d’un quelconque impact sur notre site Web ou nos bases de données», comme l’a partagé NBC News. Le Premier ministre australien Anthony Albanese a également déclaré qu’un agent OpenAI avait violé le système de santé national du pays, mais The Guardian rapporte qu’aucune information sensible n’a été compromise.

L’inquiétude vient moins de ce qui a été extrait que de ce que cela suggère, puisqu’il s’agit finalement de systèmes autonomes faisant des choses que personne ne leur a demandé de faire, dans des endroits que personne n’attendait, et dont ils ne se sont rendu compte qu’après coup. L’examen des dossiers par OpenAI a également révélé davantage de cas de ce type à mesure que l’enquête s’approfondissait, souligne The Verge.

Arrière-plan. La première pause a eu lieu en juillet, après qu’une cyberattaque menée par des agents d’OpenAI sur Hugging Face ait fait craindre une perte de contrôle de l’industrie. Le PDG d’OpenAI, Sam Altman, a déclaré vendredi que l’incident de Hugging Face « reste l’événement le plus grave que nous ayons vu ». OpenAI a également publié six autres rapports sur des comportements « inattendus ou préoccupants » et a créé un cadre pour suivre, enquêter et divulguer de tels cas.

La politique. Suite à la demande de Dario Amodei, PDG d’Anthropic, de freiner le développement de l’IA, et à laquelle se sont joints les responsables d’OpenAI, Google Deepmind et bien d’autres, la pression pour ralentir le rythme n’a cessé d’augmenter. Cependant, Washington envoie des signaux mitigés. Cette semaine, le président Donald Trump a convenu avec le président chinois Xi Jinping de partager des informations sur les dangers de l’IA et de coordonner la sécurité, mais a également déclaré que les États-Unis n’allaient pas « freiner », arguant que les critiques « veulent arrêter nos progrès parce que nous sommes très en avance sur la Chine ».

Image de couverture | Wikimédia Commons

À Simseo | Il existe un manoir dans la Silicon Valley où l’élite de l’IA se réunit pour construire l’avenir : elle a déjà accumulé 37 incidents policiers