Un passionné d’IA, connu sous le pseudonyme de CozyBlaze, a récemment laissé le nouveau modèle phare d’OpenAI, GPT-6 Astra, s’attaquer au jeu Portal de Valve. Le modèle d’IA a joué à l’intégralité du jeu de réflexion en 3D, et non à la version textuelle simplifiée, sans guide ni aide scriptée. Le défi ne comprenait que le modèle, un SourcePauseTool modifié et le Model Context Protocol gérant les pressions réelles sur les boutons.

Cependant, chaque fois qu’Astra avait besoin de réfléchir, le jeu se figeait et reprenait une fois que l’IA agentique avait déterminé sa prochaine séquence de mouvements à exécuter en temps réel. Il s’agit là d’une solution de contournement plutôt astucieuse pour pallier l’écart entre la vitesse de raisonnement d’un LLM et la physique d’encadrement d’un moteur de jeu. C’est pourquoi la vidéo finale, réduite à environ deux heures à des fins de démonstration, représente en réalité environ 24 heures de gameplay brut non compressé.

Coûts de la partie de GPT-6 Astra Portal

Astra a terminé l’intégralité du jeu en environ 3 300 appels d’outils, pour un coût d’API inférieur à 600 dollars, bien que CozyBlaze précise que cette session a en réalité été couverte par un abonnement Codex Pro à 200 dollars par mois.

CozyBlaze lui-même minimise cette prouesse, résistant à la tentation de la qualifier de « benchmark », à l’instar de tant d’autres qui soumettent l’IA à des épreuves peu conventionnelles. Cependant, voir un agent d’IA polyvalent explorer un environnement 3D inconnu et résoudre de bout en bout des énigmes spatiales par le raisonnement donne l’impression d’un véritable pas en avant vers le type d’agent de gameplay universel qu’OpenAI laisse entrevoir depuis une dizaine d’années.

Quant à la concurrence, les modèles Claude d’Anthropic se sont davantage concentrés sur l’utilisation d’ordinateurs et les tâches de codage agentique plutôt que sur les environnements de jeu en particulier, tandis que les agents Gemini de Google s’orientent vers l’utilisation d’outils multimodaux sur les navigateurs et les applications. L’agent chinois DeepSeek a maîtrisé des tests de référence en matière de raisonnement et de codage efficaces, plutôt que des tâches ouvertes telles que la navigation dans un univers de jeu en 3D ; ainsi, pour l’instant, le dernier modèle d’IA GPT-6 Astra d’OpenAI est sans égal en matière de raisonnement spatial au sein d’un environnement régi par les lois de la physique, comme le jeu de réflexion Portal de Valve.