OpenAI, créateur de ChatGPT, a confirmé mardi ralentir le développement de son modèle d’intelligence artificielle (IA) le plus avancé. L’entreprise souhaite durcir ses contrôles internes, un mois après avoir révélé un piratage informatique mené de façon autonome par une de ses IA.
Le plus gros entraînement d’IA jamais programmé par OpenAI reste à l’arrêt, le temps de vérifier que cette future IA, appelée Astra, se comporte comme prévu, a indiqué la société dans un billet de blog, mardi.
« Nous avons toujours dit que nous agirions si nous estimions que les capacités des modèles progressaient plus vite que la sécurité », a écrit sur le réseau social X le patron d’OpenAI, Sam Altman.
Contenu externe
Ce contenu externe ne peut pas être affiché car il est susceptible de collecter des données personnelles. Pour voir ce contenu vous devez autoriser la catégorie Réseaux sociaux.
Accepter Plus d’info
A la mi-juillet, un agent autonome reposant sur deux modèles d’OpenAI était sorti, de sa propre initiative, de son milieu de test confiné pour s’aventurer sur Internet et attaquer Hugging Face, plateforme où les développeurs du monde entier partagent leurs modèles d’IA.
>> Lire à ce sujet : Un piratage « sans précédent » d’une plateforme par les agents d’IA d’OpenAI
Son concurrent Anthropic a révélé à la fin juillet que trois de ses modèles en test avaient aussi opéré des intrusions non autorisées dans les systèmes informatiques de trois organisations.
Inquiétudes et pétition
Ces incidents ont donné lieu à une pétition de plus d’un millier d’employés du secteur appelant le gouvernement américain à soutenir un ralentissement concerté du développement des IA les plus avancées.
OpenAI avait par ailleurs interrompu pendant deux semaines l’entraînement de ses derniers modèles, avant de le reprendre sous des contrôles renforcés.
De nombreux travaux liés à Astra restent suspendus: l’entreprise a estimé au début août que ce modèle pourrait franchir le seuil d’alerte qu’elle s’est elle-même fixé pour les capacités de piratage de ses IA. Elle n’a pas précisé de calendrier de reprise.
Une IA sous contrôle?
Le groupe a aussi détaillé mardi un nouveau dispositif, qui surveille le raisonnement interne de ses modèles en cours de développement et doit alerter des équipes humaines en moins de 30 minutes en cas de comportement suspect. Ce contrôle consomme toutefois environ 20% de puissance de calcul supplémentaire.
Les propres recherches d’OpenAI, en 2025, ont toutefois montré les limites de cette approche: un modèle qui se sait surveillé peut apprendre à masquer ses intentions dans son raisonnement.
L’entreprise, qui promet depuis juillet un compte-rendu technique détaillé de l’incident Hugging Face, ne l’a pas encore publié. Son billet de mardi l’annonce « dans les semaines à venir ».
afp/lbl