OpenAI annule le lancement de GPT-6.1 Astra : sa propre équipe de sécurité a constaté que le modèle n’était pas fiable
OpenAI a suspendu GPT-6.1 Astra, le modèle qu’elle prévoyait de lancer en octobre, après que ses propres chercheurs ont constaté que le système ne fonctionnait pas de manière suffisamment fiable lors des tests internes. L’entreprise a confirmé cette décision ce lundi, après un article publié par le Wall Street Journal.
Pause. Ce week-end, plusieurs médias ont rapporté qu’OpenAI avait suspendu la formation d’un de ses modèles les plus puissants, sans encore préciser de quel modèle il s’agissait, après des tentatives de piratage de ses agents d’IA sur plusieurs sites Web du gouvernement américain et d’autres épisodes erratiques.
Avant cela, au cours de l’été, plusieurs de ses agents d’IA expérimentaux, dont la diffusion n’était jamais prévue, ont accédé à des sites Web et à des systèmes sans autorisation. Astra, récemment arrivé sur ChatGPT et Codex, a été conçu pour effectuer des tâches complexes avec peu de supervision humaine, ce qui est précisément le type d’autonomie qui pose problème.
En détails. Saachi Jain, responsable des systèmes de sécurité chez OpenAI, a déclaré au WSJ que le modèle s’était détérioré dans deux domaines par rapport au GPT-6 Astra, lancé en septembre. D’une part, en toute honnêteté, Jain assure que le nouveau modèle a davantage trompé les chercheurs dans les tests d’alignement, des tests qui mesurent si un modèle fait ce que les gens veulent. Et selon OpenAI, parfois, il ne rapportait pas avec précision tout ce qu’il avait fait ou n’avait pas fait.
De plus, selon Jain, le modèle avançait souvent dans certaines tâches sans demander la permission et recourait parfois à des outils ou à des services externes même lorsque cela pouvait s’avérer dangereux.
Le modèle s’est amélioré dans d’autres domaines, comme ce qu’OpenAI appelle la « paresse », ou l’abandon lorsqu’une tâche devient difficile. Mais Jain affirme qu’il « n’a pas atteint les critères » pour la sortie.
Problèmes. Les agents d’IA d’OpenAI ont déjà une longue liste de problèmes de sécurité qui ont soulevé des doutes de la part des organisations, des experts et des utilisateurs du monde entier, notamment l’incident de cybersécurité Hugging Face, l’accès non autorisé aux sites Web du gouvernement australien ou la récente tentative d’extraction de données confidentielles sur les sites Web du ministère de l’Éducation et du Commerce des États-Unis et de la SEC.
Hier encore, nous avons raconté comment OpenAI avait suspendu la formation de ses modèles les plus avancés après toute cette agitation. Le WSJ rapporte que le nouveau système de surveillance de l’entreprise a détecté les derniers incidents en 15 minutes. Astra est un cas distinct, selon l’entreprise.
D’un autre côté, la gestion de ces incidents par OpenAI a suscité quelques critiques. Le Premier ministre australien, Anthony Albanese, a qualifié d’« inacceptable » la violation des systèmes gouvernementaux en juin et a critiqué OpenAI pour avoir informé son gouvernement via une adresse e-mail générique, telle que partagée par la BBC. OpenAI s’est depuis excusé et a déclaré qu’il « aurait dû mieux gérer sa réponse ». Sam Altman a également reconnu sur les réseaux sociaux que l’entreprise avait été plus lente qu’elle ne le souhaitait lorsqu’il s’agissait de divulguer les incidents.
Et maintenant quoi. Les eaux sont très mélangées en matière d’IA. Et tout s’est produit précisément dans un contexte où les principaux laboratoires d’IA demandent de freiner le développement pour des raisons de sécurité. Mais bien sûr, il s’agit d’une course à la suprématie de l’IA la plus puissante entre les États-Unis et la Chine, c’est pourquoi les deux gouvernements ont donné des signaux contradictoires quant à la nécessité de prendre les choses avec plus de calme.
D’un autre côté, nombreux sont ceux qui pensent que se vanter d’une « IA dangereuse » est la manœuvre marketing parfaite pour démontrer les superbes capacités technologiques de ces modèles. Même si nous ne le saurons jamais. Ce que nous savons, c’est qu’OpenAI déclare qu’il continuera à utiliser le modèle Astra sous-jacent pour poursuivre la formation et qu’il enquêtera sur les causes profondes des problèmes.
Image de couverture | Flickr
À Simseo | Nous avons un nouveau « benchmark » pour l’IA : demandez-lui si vous avez correctement assemblé ou non vos meubles Ikea
