De quoi Astra est-il réellement capable ? Le dossier technique du premier modèle classé Critical

Astra est le premier modèle d'OpenAI jugé capable de trouver des failles critiques de sécurité. Analyse complète de ses capacités réelles.

De quoi Astra est-il réellement capable ? Le dossier technique du premier modèle classé Critical

De quoi Astra est-il réellement capable ? Le dossier technique du premier modèle classé Critical

Astra est le premier modèle d'OpenAI jugé capable de trouver des failles informatiques inconnues et de les exploiter sans qu'un humain ne guide chaque étape. Classé « Critical » le 1er septembre, il affiche 100 % sur ExploitBench et deux zero-days à son actif. Ce dossier passe au crible ce que ses évaluations mesurent, et ce qu'elles ne disent pas.

ExploitBench : le 100 % qui a tout déclenché

ExploitBench a été conçu en mai 2026 par Seunghyun Lee et David Brumley, chercheurs à Carnegie Mellon University, le second étant également affilié à la plateforme de bug bounty Bugcrowd. Son principe : ne pas se contenter de vérifier qu'un modèle repère une faille, mais mesurer jusqu'où il grimpe « l'échelle d'exploitation », du simple crash jusqu'à la prise de contrôle complète, en passant par l'exécution de code arbitraire. Chaque marche compte comme un point.

Lors de ses évaluations internes, Astra a obtenu un score parfait sur ce test. Restait un piège méthodologique classique : un benchmark public peut finir dans les données d'entraînement d'un modèle, ce qui fausserait le score. Les ingénieurs d'OpenAI ont donc construit une version interne du test, « ExploitBench - Internal Port », bâtie sur 20 vulnérabilités V8 de haute sévérité divulguées entre juin et août 2026, soit des failles que le modèle n'avait jamais pu rencontrer. C'est sur cette version durcie qu'Astra a montré l'étendue réelle de ses capacités.

Deux zero-days, sans intervention humaine

Dans cette évaluation durcie, Astra a découvert puis exploité deux vulnérabilités zero-day, c'est-à-dire des failles inconnues de leurs éditeurs au moment des tests, et les a intégrées à une chaîne d'exploitation. OpenAI indique être en cours de divulgation auprès des mainteneurs des projets concernés. Aucun exploit n'a donc circulé : les deux failles ont été trouvées, utilisées en laboratoire, puis signalées.

C'est ce résultat qui déclenche le classement Critical. La définition du seuil, fixée par le Preparedness Framework d'OpenAI, vise précisément un modèle capable d'identifier et d'exploiter des failles zero-day sur des systèmes réels bien protégés sans intervention humaine, ou d'exécuter des stratégies d'attaque inédites à partir d'un simple objectif de haut niveau. Interrogée en briefing presse, la vice-présidente recherche d'OpenAI Amelia Glaese résume : Astra « peut trouver des failles de sécurité inconnues et développer des moyens de les exploiter sur de nombreux systèmes bien protégés, sans qu'une personne ne guide chaque étape ».

Nuance importante : tout cela s'est passé dans des environnements de test contrôlés, pas dans une attaque réelle. Mais la frontière est étroite entre un exploit démontré en laboratoire et le même exploit dirigé contre une cible. D'où les précautions.

Au-delà du cyber : un modèle taillé pour l'agentique

Le suspense a pris fin jeudi 3 septembre : OpenAI a publié son nouveau modèle sous le nom de GPT-6 Astra, et le présente comme à la pointe en usage de l'ordinateur, navigation web, ingénierie logicielle, cybersécurité, science et travail professionnel. Astra n'est donc pas un outil de spécialiste : c'est un agent généraliste dont les compétences cyber sont la face la plus sensible.

Les chiffres annoncés donnent une idée du niveau : 98 % sur FrontierMath Tier 4 et 99,9 % sur ARC-AGI-3. Le second mérite une lecture attentive : selon l'analyse d'ARC Prize, ce score a été obtenu avec un harnais d'évaluation spécifique qui conserve l'état de raisonnement opaque du modèle entre les requêtes ; sur le harnais Standard, le score tombe à 62,7 %. La façon de connecter un modèle à ses outils compte autant que le modèle lui-même, un point rarement souligné dans les communiqués.

Cette polyvalence n'est pas un détail : dès le 7 août, OpenAI expliquait avoir ralenti le développement d'Astra après des avancées jugées significatives à la fois en coding agentique et en cybersécurité. Les deux compétences sont liées. Un agent qui lit du code, écrit des programmes et pilote des machines est aussi un agent capable de lire un code vulnérable et d'écrire un exploit. La même mécanique sert le développeur et l'attaquant.

Les garde-fous, couche par couche

Pour diffuser un modèle Critical, OpenAI empile plusieurs protections :

  • Des refus renforcés : le modèle a été entraîné à rejeter les demandes cyber nuisibles. Il refuse 91,5 % des requêtes inappropriées lors d'une évaluation, contre 59 % pour son prédécesseur GPT-5.6 Sol. Autrement dit, il obéit encore à 8,5 % d'entre elles.
  • Un harnais d'exécution durci : l'infrastructure qui encadre le modèle détecte les usages abusifs et bloque les tentatives de contournement.
  • Des comptes à risque restreints : OpenAI identifie les « comptes jugés à risque plus élevé » et limite les réponses apportées à leurs demandes.
  • Une surveillance des chaînes de raisonnement au moment du déploiement, capable de repérer et stopper une activité potentiellement non autorisée en cours de tâche.
  • Un accès à plusieurs étages : la version grand public arrive « bientôt », mais les capacités cyber les plus avancées sont d'abord réservées à un petit groupe d'alpha testeurs, comprenant le gouvernement américain et des organisations chargées d'infrastructures critiques, avant d'être étendues via le programme Daybreak Blue.

OpenAI reconnaît elle-même le coût de ce dispositif : les garde-fous peuvent produire des faux positifs, qui ralentissent, mettent en pause ou interrompent des tâches parfaitement légitimes, y compris hors du champ cyber et des tâches agentiques de longue durée. Pour un modèle vendu comme un agent autonome, c'est un compromis de production assumé : mieux vaut une tâche interrompue qu'un usage malveillant passé au travers.

Ce que ces chiffres ne disent pas

Toutes ces performances proviennent d'évaluations menées par OpenAI sur son propre modèle. Comme le relève TechCrunch, sans confirmation indépendante, impossible de juger du niveau réel d'Astra ni de la solidité des garde-fous. OpenAI promet des détails complets dans la fiche système du modèle à son lancement, et un aperçu à des évaluateurs externes, sans dire qui ils sont ; le rôle éventuel du gouvernement américain dans ces évaluations reste imprécis.

Le contexte compte aussi. En juillet, deux modèles d'OpenAI ont quitté leur environnement de test et piraté Hugging Face ; GPT-5.6 Sol était impliqué, Astra non. Et Anthropic avait ouvert la voie avec Mythos dès le printemps, avec des précautions comparables : la restriction d'accès aux capacités cyber devient un standard du secteur, pas une exception.

Ce qu'il faut retenir

Astra combine le meilleur score jamais mesuré en exploitation de vulnérabilités avec un profil d'agent généraliste, et OpenAI a choisi de le diffuser en bridant précisément l'usage offensif. Le seuil Critical n'est plus une hypothèse réglementaire : un modèle l'a franchi, et il arrive sur le marché avec des garde-fous inédits. La question qui reste ouverte n'est pas la capacité, elle est documentée. C'est la vérification : tant que le 100 % d'ExploitBench et les deux zero-days ne seront confirmés que par le laboratoire lui-même, le public devra faire confiance à sa parole. Les évaluations promises au lancement diront si ces chiffres tiennent hors du laboratoire.

Sources

À lire aussi

À lire aussi