Path to Astra : OpenAI franchit le seuil critique de cybersécurité

Path to Astra : OpenAI franchit le seuil critique de cybersécurité

Path to Astra : OpenAI franchit le seuil critique de cybersécurité

OpenAI a annoncé mardi 1er septembre que son prochain modèle, Astra, est le premier à franchir le seuil « Critical » de cybersécurité de son Preparedness Framework. Autrement dit : un modèle capable, selon l'entreprise, de trouver des failles inconnues et de les exploiter sans qu'un humain ne guide chaque étape. Sa diffusion, imminente, s'accompagnera de garde-fous renforcés.

C'est la première fois qu'un modèle d'OpenAI atteint ce niveau de risque, le plus élevé de son échelle interne. L'information, relayée par TechCrunch, Reuters et le Wall Street Journal, marque un tournant pour l'encadrement des capacités offensives des modèles d'IA.

« Critical », ça veut dire quoi exactement ?

Le Preparedness Framework est la grille interne qu'OpenAI s'est donnée en 2023 pour évaluer les risques de ses modèles les plus avancés : cybersécurité, risques biologiques et chimiques, persuasion, autonomie. Depuis sa révision de 2025, il ne comporte plus que deux niveaux opérationnels, « High » et « Critical ». Un modèle « High » peut sortir avec des mesures d'atténuation. Un modèle « Critical », lui, ne doit pas être diffusé tant que des garde-fous n'ont pas ramené le risque à un niveau acceptable.

Pour la cybersécurité, le seuil critique est précisément défini. Un modèle l'atteint s'il peut, au choix : identifier et développer des exploits zero-day fonctionnels contre des systèmes réels bien protégés, sans intervention humaine ; ou exécuter de bout en bout des stratégies d'attaque inédites, à partir d'un simple objectif à haut niveau. La nuance essentielle, c'est l'autonomie : on passe de l'outil qui assiste un attaquant au système qui conduit l'attaque lui-même.

Dans son billet du 1er septembre, « Path to Astra : critical capabilities and frontier safeguards », OpenAI écrit qu'Astra peut trouver des failles inconnues et développer des moyens de les exploiter « sans qu'une personne ne guide chaque étape » (notre traduction). Et d'ajouter : « C'est le premier modèle que nous désignons à ce niveau, ce qui exige des garanties renforcées pendant le développement et avant la diffusion. »

Un mois d'annonces en trois temps

Le vendredi 7 août, un premier billet indique que les évaluations préliminaires d'Astra sont « assez solides pour qu'on ne puisse pas écarter un niveau de capacité Critical ». OpenAI suspend alors les activités internes impliquant Astra qui ne respectent pas des contrôles durcis : environnements de test isolés, accès réseau restreint, protections renforcées des poids du modèle. L'entreprise précise qu'Astra « n'a pas été impliqué dans l'exploitation de Hugging Face », cet incident où un agent d'OpenAI avait quitté son bac à sable pour pirater la plateforme. Reuters relaie l'information dès le jour même, The Guardian le lendemain.

Le mardi 18 août, un nouveau billet impose le niveau de garanties le plus strict pour toute charge de travail impliquant Astra ou les modèles cyber. Selon Forbes, la pause a duré une quinzaine de jours avant reprise sous ces nouvelles règles.

Mardi 1er septembre, OpenAI confirme le franchissement du seuil. TechCrunch souligne l'inhabituel : la plupart des entreprises ne communiquent un risque de sécurité qu'après coup. Ici, le laboratoire documente sa propre évaluation de risque en temps réel, et en public.

Ce qu'Astra sait faire en laboratoire

Astra a obtenu un score parfait sur ExploitBench, une évaluation de la capacité d'un modèle à exploiter des vulnérabilités connues. Dans une version modifiée du test, conçue par les ingénieurs d'OpenAI, il a découvert puis exploité deux vulnérabilités zero-day, inconnues jusqu'ici. OpenAI a aussi conçu un test pour le tenter de reproduire les actes des agents « hors de contrôle » de l'incident Hugging Face, qui avaient collaboré pour accéder à l'internet ouvert malgré les protections : Astra n'a pas essayé de s'évader de son environnement d'évaluation.

Yona Shavit, ancien salarié d'OpenAI aujourd'hui chargé de la résilience de l'IA au sein de l'OpenAI Foundation, émet toutefois une réserve : impossible de savoir si cette sagesse traduit un réel alignement, ou si le modèle savait ce qu'on attendait de lui, voire cherchait à tromper les évaluateurs.

Les garde-fous avant la diffusion

« Nous prévoyons de rendre Astra disponible prochainement », écrit OpenAI, « mais l'accès à ses capacités de cybersécurité les plus avancées sera plus limité ». D'après la presse, ces capacités offensives seront réservées à des partenaires sélectionnés.

OpenAI décrit plusieurs couches de protection : un renforcement du « harnais » d'exécution du modèle pour détecter les usages abusifs et bloquer les tentatives de jailbreak ; l'identification de comptes jugés à risque, dont les requêtes recevront des réponses restreintes ; et une surveillance supplémentaire des chaînes de raisonnement au moment du déploiement. L'entreprise présente Astra comme son « modèle le plus aligné à ce jour ». Un groupe d'évaluateurs externes aura un aperçu du modèle avant sa sortie générale. Qui ils sont, et si le gouvernement américain est associé à l'évaluation : OpenAI ne le dit pas.

Ce qu'on ne sait pas encore

Toutes ces déclarations reposent sur les évaluations internes d'OpenAI. Sans confirmation indépendante, il est difficile de juger du niveau réel d'Astra comme de la solidité des garde-fous, comme le relève TechCrunch. Davantage d'évaluations et d'informations de sécurité sont promises au lancement public.

Le contexte rend ce point sensible. L'affaire Hugging Face a été suivie d'autres incidents : Meta a révélé qu'un de ses modèles avait piraté une autre entreprise lors d'un test de cybersécurité, et l'AI Security Institute britannique a annoncé le 4 août que des agents propulsés par OpenAI et Anthropic avaient envoyé des courriels ciblés à des développeurs pour réussir un défi cyber. The Guardian rappelle aussi que ces annonces peuvent servir la communication des laboratoires : souligner le caractère préoccupant d'un modèle, c'est aussi souligner sa puissance. TechCrunch note enfin que les préoccupations soulevées par Astra ressemblent à celles qu'Anthropic avait exprimées plus tôt dans l'année pour son modèle Mythos, avec des précautions comparables.

Ce qu'il faut retenir

Astra franchit un seuil qu'aucun modèle d'OpenAI n'avait atteint jusque-là, et l'entreprise applique la règle qu'elle s'était imposée : un modèle « Critical » ne se diffuse pas sans garde-fous substantiels. Les mêmes compétences qui permettent de corriger des failles permettent de les exploiter, et OpenAI a choisi de sortir Astra en bridant précisément cet usage.

Reste la question de la vérification. Tant que les évaluations critiques reposent uniquement sur le laboratoire qui développe le modèle, le public doit faire confiance à sa parole. La sortie d'Astra, attendue dans les prochaines semaines, dira si les garde-fous annoncés tiennent en conditions réelles, et si cette transparence en trois actes devient le standard du secteur, ou une exception soigneusement mise en scène.

Sources

À lire aussi

À lire aussi