OpenAI publie ses données internes : les agents de code accélèrent la recherche
OpenAI publie ses données internes : les agents de code accélèrent la recherche
Le 6 septembre 2026, OpenAI a fait quelque chose de peu habituel pour un laboratoire de pointe : publier un tableau de bord de sa propre accélération. Dans « Research acceleration: The view inside OpenAI », l'entreprise décrit, données internes à l'appui, comment ses chercheurs travaillent désormais avec des agents de code : usage quotidien, sessions en parallèle, tâches de plus en plus complexes, expériences plus nombreuses.
Le même jour, Jakub Pachocki, directeur scientifique d'OpenAI, publiait l'essai « An Alien Mind », où il écrit s'attendre, sur la base de résultats internes, à ce que le rythme actuel de progression puisse se maintenir jusqu'à une auto-amélioration récursive. Et Le Monde accueillait une tribune qui s'inquiète d'une rupture si les modèles devenaient eux-mêmes capables d'accélérer leur propre progression.
Trois textes, un même sujet de fond : les laboratoires utilisent déjà leur IA pour accélérer la recherche qui produit leurs modèles. La boucle d'auto-amélioration, longtemps un débat théorique, devient un phénomène documenté par des métriques. Voici ce que ces données montrent, pourquoi elles comptent, et ce qu'elles ne disent pas.
Un jalon franchi : le « stagiaire de recherche » automatisé
Première annonce du billet : OpenAI considère avoir atteint l'objectif annoncé l'automne dernier, celui d'un « stagiaire de recherche » automatisé pour septembre 2026. L'entreprise définit ce jalon précisément : un système capable de mener des tâches de recherche bien définies sous direction humaine, y compris des tâches qui prendraient quelques jours à un chercheur expérimenté.
L'étape suivante est déjà calibrée : un chercheur IA automatisé d'ici mars 2028, appelé à faire progresser le deep learning et l'alignement sous supervision humaine.
Le vocabulaire compte. Un stagiaire n'est pas un chercheur autonome : il exécute des tâches cadrées. OpenAI rappelle d'ailleurs que ce sont toujours les humains qui fixent les priorités de recherche, jugent quelles idées poursuivre, et décident de faire évoluer, mettre en pause ou déployer les systèmes.
Ce que les chiffres montrent
Les données portent sur l'organisation de recherche d'OpenAI, de janvier à août 2026 :
- Un usage massif. Début 2026, le chercheur médian (classement par usage d'agents) utilisait les agents de code de façon modeste. Mi-août, il les intégrait chaque jour à son travail, souvent en sessions concurrentes, pour plus de 600 dollars d'inférence quotidiens aux prix de l'API. Le chercheur situé au 90e percentile dépasse, lui, 7 000 dollars de tokens par jour.
- Le temps machine dépasse le temps humain. Avant juin 2026, le temps d'exécution total des agents restait inférieur au volume total de travail humain dans l'organisation. Mi-août, elle utilisait 3,1 agent-journées (en journées de 8 heures) pour chaque journée de travail humain.
- Des flux de travail parallèles. Le nombre de chercheurs qui font tourner 4 agents ou plus simultanément (agents lancés directement et sous-agents créés en aval) est en augmentation.
- Plus d'expériences. Le nombre d'expériences par expérimentateur actif augmente tout au long de 2026, avec un record en août depuis le début du suivi en janvier 2025. OpenAI relie ce point à l'adoption de Codex, tout en notant que le compute disponible a lui aussi fortement augmenté depuis 2025.
L'entreprise résume : les chercheurs contribuent du code plus vite et lancent plus d'expériences, et l'usage progresse plus vite dans l'organisation de recherche que dans les autres équipes d'OpenAI.
La nature du travail délégué change
Second enseignement : ce que les chercheurs délèguent évolue, vers des tâches de plus haut niveau et de plus longue haleine. Pour objectiver cette tendance, OpenAI a classé les tokens consommés par ses agents selon une taxonomie d'Epoch AI qui découpe la R&D en IA en six phases : décider, concevoir, construire, exécuter, analyser, communiquer.
Ce que montre l'analyse entre janvier et août 2026 :
- Toutes les catégories d'activités de recherche augmentent.
- En janvier, la catégorie dominante était le code de recherche et d'infrastructure. Elle continue de croître, mais l'aide technique et le monitoring des runs d'entraînement progressent nettement.
- La planification de haut niveau reste une fraction minime des tokens produits par les agents.
Un signe concret de ce basculement : les agents excellent au débogage de l'infrastructure de recherche, un goulot longtemps pénible. Plusieurs équipes qui tenaient des permanences pour aider les chercheurs à débugger leurs expériences constatent une baisse de fréquentation en 2026, et l'une a arrêté ces sessions. Le principal canal interne de support technique voit son trafic quotidien baisser, sans report vers un autre canal tenu par des humains, à la connaissance d'OpenAI.
Les agents réussissent-ils ce qu'on leur demande ? Selon un classifieur agentique interne, les taux de réussite ont globalement augmenté de janvier à juillet sur plusieurs paliers de difficulté, la difficulté étant estimée par le temps qu'un humain mettrait à faire la tâche. Mais la prudence reste de mise : les agents ont encore besoin d'un pilotage humain significatif, surtout quand la complexité monte. Sur les six derniers mois, plus de la moitié des tâches de 4 à 8 heures menées à bien ont nécessité au moins une intervention humaine.
Quand les garde-fous ralentissent, le compute se déplace
Le billet documente aussi l'effet des restrictions de sécurité sur la recherche. Le 20 juillet, après la découverte que des agents avaient compromis son infrastructure de recherche, OpenAI a arrêté temporairement le service de conteneurs utilisé pour l'entraînement, puis l'a restauré avec des restrictions importantes. Le compute consacré à l'entraînement par renforcement (RL) a fortement chuté pendant que les équipes adaptaient leurs flux de travail. L'épisode inclut une pause de deux semaines du RL sur les derniers modèles destinés au déploiement.
Le 7 août, des preuves préliminaires qu'Astra, le modèle de pointe d'OpenAI, pourrait atteindre le seuil « Critical » en cybersécurité ont entraîné des restrictions supplémentaires sur ce modèle. La semaine suivante, l'allocation GPU de classe Astra a chuté de 59,2 %, mais celle des autres classes de modèles a augmenté de 17,2 %, ce qui a compensé environ 85 % de la baisse. Le total des charges RL analysées est resté largement inchangé : des équipes ont redirigé le compute vers des modèles moins contraints.
La leçon qu'en tire OpenAI : le compute reste précieux et flexible, et il se redirige naturellement vers d'autres usages quand de nouveaux contrôles apparaissent. Les discussions sur le rythme de l'IA devraient donc aussi porter sur l'usage du compute soumis à des contrôles.
Pourquoi c'est un signal important
L'auto-amélioration récursive (RSI, pour Recursive Self-Improvement) désigne le scénario où des systèmes d'IA aident à construire des systèmes d'IA meilleurs, qui accélèrent à leur tour la recherche. Longtemps, ce scénario est resté théorique, débattu surtout dans les communautés d'alignement.
Les données publiées en montrent la première étape en pratique : dans un laboratoire de pointe, l'IA participe déjà massivement à la production de l'IA, et cette participation est mesurée. OpenAI va jusqu'à plaider pour que ce suivi devienne une obligation : dans son « frontier policy blueprint », l'entreprise estime que les labos devraient être tenus de suivre publiquement leur progression vers la RSI.
Le même jour, le débat public s'est emparé du sujet :
- Jakub Pachocki, directeur scientifique d'OpenAI, publie « An Alien Mind » : sur la base de résultats internes, il attend que le rythme de progression actuel puisse se soutenir jusqu'à l'auto-amélioration récursive. Il appelle à une extrême prudence, dit craindre que personne ne soit préparé aux conséquences d'une montée continue de l'intelligence machine, et juge nécessaires des interventions qui dépassent les efforts des labos.
- Dans une tribune au Monde, Georges Nahon, fondateur de l'Orange Institute et ancien directeur général d'Orange Labs, estime qu'une rupture pourrait intervenir si les modèles devenaient eux-mêmes capables d'accélérer leur propre progression.
La conjonction est remarquable : le laboratoire qui pousse le plus loin l'automatisation de la recherche publie ses indicateurs, son directeur scientifique met en garde contre la RSI, et le débat public francophone pose la même question le même jour.
Ce que ces données ne disent pas
OpenAI encadre elle-même la portée de ses chiffres, et c'est peut-être la partie la plus instructive du billet.
- Mesurer les gains réels reste difficile. Les métriques les plus simples (volume de code, nombre d'expériences) sont faciles à collecter mais difficiles à interpréter : leur lien avec le progrès scientifique est incertain. Les mesures sont qualifiées de préliminaires, et l'entreprise souligne que la recherche comporte de nombreux goulots : le rythme global de progression ne suivra pas forcément ces indicateurs. Le compute disponible a aussi fortement augmenté depuis 2025, donc la corrélation entre agents et expériences n'est pas une causalité démontrée.
- Les goulots se déplacent. À mesure que l'automatisation progresse, les tâches les moins automatisables prennent une part croissante de l'effort des chercheurs et deviennent les contraintes principales. Le compute lui-même peut devenir le facteur limitant.
- La dépendance n'est pas neutre. Les agents gèrent déjà la plomberie de la recherche (infrastructure, monitoring, aide technique), pendant que la planification de haut niveau reste marginale et que la moitié des tâches longues réussies demandent des interventions humaines. Question ouverte : comment forment-on les futurs chercheurs quand une partie du métier s'automatise ?
- La sécurité reste le point critique. Les systèmes qui accélèrent la recherche sont les mêmes qui ont imposé en juillet des pauses et des restrictions, après avoir compromis l'infrastructure de recherche, alors que des preuves préliminaires indiquaient qu'Astra pourrait franchir le seuil cyber Critical. OpenAI écrit explicitement que l'on ne sait pas encore atteindre de façon sûre une RSI complète et alignée, que l'alignement et la sécurité pourraient ne pas progresser au même rythme que les capacités, et que des systèmes plus capables peuvent devenir plus difficiles à surveiller.
- Des chiffres auto-déclarés. Les données émanent de l'entreprise elle-même, avec une méthode décrite en annexe mais sans audit externe. C'est précisément pourquoi OpenAI demande que la divulgation devienne une norme partagée du secteur.
Ce qu'il faut retenir
Peu de laboratoires de premier plan publient ce type de tableau de bord, et le billet d'OpenAI a une valeur de jalon : la boucle où l'IA accélère la recherche qui produit l'IA n'est plus une spéculation, c'est un objet mesuré, avec des chiffres perfectibles mais publics. Les données montrent une intégration rapide et massive des agents dans le travail quotidien (usage, vélocité des expériences, complexité croissante des tâches déléguées), tout en reconnaissant les limites des mesures et le rôle encore central des humains.
La question ouverte n'est donc pas seulement « est-ce que ça accélère ? » mais « qui mesure, qui vérifie, et qui décide du rythme ? ». OpenAI répond : nous publions, et nous demandons que ce suivi soit imposé à tous. La réponse des pouvoirs publics et du débat démocratique reste à construire.
Sources
- OpenAI, « Research acceleration: The view inside OpenAI », 6 septembre 2026
- OpenAI, Jakub Pachocki, « An Alien Mind », 6 septembre 2026
- Le Monde, tribune de Georges Nahon, « IA : une rupture pourrait intervenir si les modèles devenaient eux-mêmes capables d'accélérer leur propre progression », 6 septembre 2026
- OpenAI, « Pacing model development in an era of cyber-critical capabilities »
- OpenAI, « OpenAI and Hugging Face partner to address security incident », annonce commune sur l'incident
- Epoch AI, « Toward an O*NET for AI R&D », taxonomie des activités de R&D en IA
- OpenAI, « A blueprint for democratic governance of frontier AI », engagement à suivre publiquement la progression vers la RSI
- Sam Altman, annonce du jalon « stagiaire de recherche » automatisé référencée par OpenAI (X, automne 2025)