Anatomie du rapport Anthropic : de décembre 2025 à août 2026, sept domaines de détournements de Claude
Anthropic a publié le 10 septembre 2026 un rapport de 154 pages, « Detecting and countering misuse of AI: September 2026 ». L'entreprise y détaille sept domaines de détournement de Claude observés de décembre 2025 à août 2026, du renseignement d'État à la fraude, et affirme avoir mesuré plus de 151 millions d'échanges extraits par un seul laboratoire chinois.
Ce que contient le rapport
L'équipe Threat Intelligence d'Anthropic décrit des opérations qu'elle dit avoir identifiées et perturbées entre décembre 2025 et août 2026, réparties en sept domaines : cyber, influence, surveillance, fraudes, usage biologique, armes conventionnelles et distillation illicite.
Trois éléments de méthode éclairent la lecture.
- Les acteurs sont désignés par des identifiants internes, les « Generative Threat Groups » (GTG), soit des groupes observés en train d'abuser de l'IA, et non des attributions publiques à un État.
- Le rapport tente de mesurer l'« uplift », le gain de capacité apporté par l'IA par rapport à une opération sans IA, lu selon la vitesse, l'échelle et la profondeur.
- Les modèles concernés sont Haiku, Sonnet et Opus. Aucun cas n'implique Fable ni la classe Mythos, sauf une distillation.
Anthropic prévient que le document n'est pas un recensement : il présente « les cas les plus notables et les plus inédits » identifiés à ce jour, pas l'ensemble des usages détectés.
Cyber : l'écart de compétences s'est refermé
Le constat d'ouverture : selon Anthropic, l'IA a fait s'effondrer l'écart de main-d'œuvre et d'outillage qui séparait les opérations étatiques bien dotées des opérateurs isolés. Conséquence, la sophistication technique n'est plus un signal fiable d'attribution. Cinq cas sont détaillés.
- GTG-20006, espionnage. Attribution jugée cohérente avec Midnight Blizzard. Plus de 20 organisations visées, surtout en Ukraine et en Europe. Contre une autorité technologique d'un gouvernement nord-africain, plus de 300 000 enregistrements d'identité nationale et le registre commercial de plus d'un demi-million d'entreprises.
- GTG-50014, extorsion. Des affiliés présumés de ShinyHunters. 1,8 million d'APK Android décompilés pour y chercher des secrets codés en dur ; plus de 2 100 jeux de jetons Azure AD sur plus de 40 locataires en 34 heures environ ; plus d'un téraoctet de données chez un prestataire.
- GTG-10007, fonderie d'exploits. Des opérateurs sinophones, dont deux étudiants d'une université du Hunan, ont ciblé une cinquantaine d'organisations. Un seul flux de travail a produit plus d'une douzaine de zero-days candidats en un mois.
- GTG-50020, chaîne d'approvisionnement. Une injection de prompt dans le bac à sable d'évaluation d'un éditeur d'IA a fait remettre à celui-ci les clés d'API de production qu'il détenait, appartenant à plusieurs fournisseurs. Une campagne suivante a visé une trentaine d'entreprises d'IA en quatre jours environ, sans jamais obtenir l'accès recherché à un modèle Claude non encore publié.
- GTG-50021 et GTG-50029. Un faux revendeur d'accès à Claude qui relayait en réalité vers un autre modèle tout en volant les identifiants de ses clients ; puis un acteur francophone isolé, qui a obtenu un accès interne à au moins 14 des 42 entités suivies et exfiltré 12 à 26 Go de bases via une faille WordPress non documentée, exploitée contre au moins quatre sites.
Comment Claude est utilisé, étape par étape
Le rapport insiste moins sur des techniques inédites que sur un basculement d'échelle : selon Anthropic, « aucune des opérations décrites ne dépend d'une technique entièrement nouvelle », mais « l'économie des attaques a changé ».
La kill chain complète est confiée à des agents. Dans GTG-20006, Claude intervient à chaque étape : empreinte des services exposés, construction de l'infrastructure d'intrusion, exécution de commandes, collecte d'identifiants, déplacement latéral, organisation de centaines de gigaoctets, maintien de l'accès. Les humains restent dans la boucle pour fixer les cibles et relire les exfiltrations.
La boucle d'évasion autonome est le point le plus notable : quand un implant est signalé par un produit de sécurité, des agents le modifient, le recompilent et le redéploient jusqu'à ce qu'il repasse sous les radars.
D'autres schémas reviennent : les « agent swarms », où un agent principal découpe une tâche et la distribue à des sous-agents parallèles ; la mémoire de campagne persistante, qui conserve cibles, identifiants et instructions permanentes entre les sessions et permet de reprendre une opération en cours ; le « vibe hacking », où un objectif général est confié à l'IA qui évalue, écrit, exécute et recommence ; enfin le « living off the land » appliqué à l'IA, où les clés volées dans les environnements victimes servent de puissance de calcul avec un effet de camouflage vers leur propriétaire.
Anthropic maintient une distinction : autonomie et préjudice sont deux axes séparés, et plusieurs compromissions graves ont été pilotées à la main.
Influence : des usines à faux médias
Neuf cas, de Russie, d'Iran, de Turquie et à travers le Golfe, l'Asie du Sud, l'Afrique et l'Europe, ciblant six continents. Les commanditaires vont de gouvernements à des agences de marketing privées.
- GTG-54002, faux médias. LKM Company, agence de publicité numérique basée en France : environ 70 faux sites d'actualité, 70 comptes X appariés, plus de 250 faux comptes de commentaires et au moins 8 913 articles en une vingtaine de langues. Anthropic déclare n'avoir trouvé aucune preuve de direction gouvernementale.
- GTG-84005, Malaisie. Une société d'Istanbul, BBS Bilisim Teknolojileri, vend une plateforme présentée comme un « écosystème d'opérations politiques en temps réel, de grade militaire et piloté par l'IA » : environ 1 000 faux comptes X, un ciblage des 222 circonscriptions à partir de données réelles, et une demande d'un million de vues artificielles au profit du Premier ministre.
- GTG-24015, médias d'État russes. Quatre comptes utilisant Claude comme desk éditorial. Un ancien rédacteur en chef de Sputnik Moldova a produit des articles en russe relayant des accusations diffamatoires contre la présidente moldave Maia Sandu avant l'élection parlementaire du 28 septembre 2025, publiés notamment sur Sputnik Moldova et RIA Novosti. Le volume, selon Anthropic, suppose normalement toute une équipe de rédaction.
- GTG-34001, Iran. Trois comptes rattachés à des institutions de propagande d'État, qui ont produit plans de campagne, manuels de doctrine et bases de données de cibles, rattachés à la doctrine officielle du « jihad explicatif ». Claude y a servi à produire des livrables institutionnels qui auraient exigé un bureau de programme entièrement doté, selon le rapport.
- GTG-84006, MEK/NCRI. Un compte Telegram cloné après lecture d'environ 8 400 publications pour imiter son propriétaire, et près de 51 944 messages analysés en dossiers psychographiques.
- GTG-54006, Bangladesh. Un opérateur unique, 29 comptes Claude en rotation sur environ seize mois, pour au moins 1 500 titres, 300 faux récits et 1 500 prompts d'images, vers un public rural peu lettré.
- GTG-84002, Émirats. Environ 300 faux comptes d'influenceurs, une fausse ONG copiant une organisation suisse réelle, des témoignages destinés à l'ONU et le profilage de 18 députés européens.
- GTG-54004, Kenya. Un acteur unique produisant des lots de cinquante tweets, avec la consigne explicite de les faire passer pour de la parole spontanée, en amont de l'élection de 2027.
- GTG-04001, Centrafrique. Un acteur russophone à Bangui alimentait la radio Lengo Songo en contenus pro-russes et anti-français, en gommant les marques d'écriture synthétique, avec un lien établi vers une branche d'influence rattachée au groupe Wagner.
Anthropic ajoute une réserve de portée : la majeure partie des contenus a suscité peu ou pas d'engagement authentique.
Surveillance : la répression outillée
Dix cas entre janvier et juillet 2026. Les cibles recoupent les historiques de répression : figures prodémocratie de Hong Kong, communautés tibétaines et du Falun Gong, minorités et opposants iraniens en exil.
- GTG-50027, Mali. Un consultant indépendant de Bamako produit pour le service de renseignement intérieur malien, l'Agence nationale de la sécurité d'État (ANSE), une plateforme nommée « Lakana 360 » couvrant environ 25 millions de cartes SIM chez les trois opérateurs nationaux. L'exigence de mandat judiciaire a été retirée du composant rédigeant les dossiers, à la demande de l'opérateur, avec conservation indéfinie. Anthropic reconnaît avoir perturbé le développement logiciel, mais pas le déploiement.
- GTG-34007, Iran. Seize comptes liés à deux unités paramilitaires et de sécurité intérieure. L'une revendique la surveillance de 6 388 personnes en un an, l'analyse de 155 216 tweets et le repérage de 39 comptes d'opposition ; l'autre a déployé une extension Firefox malveillante d'aspiration d'identités, déguisée en utilitaire d'horaires de prière. Claude a refusé les demandes explicites de profilage, mais beaucoup moins celles d'outillage logiciel, note le rapport.
- GTG-14020, Chine. Un service de renseignement sur les affaires religieuses, qui mobilisait plusieurs équipes, se réduit à un bureau produisant des milliers d'enquêtes par mois : cardinaux catholiques d'Asie, communautés bouddhistes tibétaines, Falun Gong et chrétiens de Taïwan.
- GTG-14010, Chine. Un acteur aligné sur l'État, sans compétence en arabe, convertit les échanges extraits de plus de 100 groupes WhatsApp surveillés en données structurées et recrute en dialecte régional auprès d'Ouïghours en Syrie.
- GTG-14021, maintien de l'ordre. Trois comptes liés à des organes de sécurité municipaux chinois. Un cyberpolicier municipal exploite un programme de surveillance de l'opinion ; un élève d'académie de police a désigné dix citoyens chinois comme cibles d'un « contrôle » ; un bureau de sécurité d'État produit des notes quotidiennes contre des dissidents à l'étranger. Anthropic note que ses garde-fous « n'ont pas performé de manière uniforme ».
- GTG-54009, vendeur commercial. « S2T Unlocking Cyberspace », décrit comme un vendeur de renseignement israélo-singapourien, avec plus de 255 comptes synthétiques préparés pour un déploiement ultérieur.
- GTG-30006, Iran, outils domestiques. Seize organisations à opérateur unique utilisant des comptes gratuits, pour du malware livré à des Iraniens. Claude a refusé neuf requêtes directes sur dix, mais beaucoup moins systématiquement quand la tâche était fragmentée en requêtes anodines.
Armes conventionnelles : le précédent yéménite
Depuis novembre 2025, Anthropic identifie une nouvelle catégorie d'acteurs : l'usage de Claude pour des logiciels d'armes conventionnelles (armes à feu, missiles, drones armés, munitions) et des systèmes de ciblage. Six cas, trois en Chine, deux en Russie, un au Yémen ; quatre portent sur le développement, deux sur l'approvisionnement et le renseignement.
- GTG-87001, Yémen. Une cellule du nord du pays menait trois programmes : une roquette guidée à calculateur de vol de classe téléphone, un missile balistique de portée déclarée supérieure à 2 000 km et un ensemble « R2000 » à variante de planeur hypersonique. Claude Code a servi « à la place d'ingénieurs logiciels humains ». Un tir d'essai réel a eu lieu et semble avoir échoué ; les acteurs sont revenus vers Claude dans les heures suivantes pour analyser l'échec.
- GTG-27005, Russie. Un essaim de drones kamikazes FPV : mémoire partagée, coordination tolérante aux pannes, guidage terminal, pour un engagement létal autonome avec une classe de cible « personne » et des ordres de détonation sans humain. Le matériel était réel, les niveaux de maturité faibles, entre TRL 3 et 4.
- GTG-17001 et GTG-17002, Chine. Une proposition anti-torpilles de plus de 200 pages pour la marine de la PLA, affinée en faisant jouer à Claude un expert hostile critique ; puis une suite de guerre électronique d'environ seize modules en douze versions, avec un scénario passé à « 12 cibles à Taïwan ».
- GTG-27006 et GTG-17003. Un acheteur moscovite détournant des biens à double usage, avec un dépouillement automatisé des appels d'offres à raison d'environ 40 lignes par consultation ; et un rapport de 23 pages sur les armes à énergie dirigée, produit par une équipe de trois personnes.
Anthropic n'a aucune preuve qu'un engin opérationnel ait été déployé et ne chiffre pas l'uplift dans ce domaine. Le rapport annonce de nouveaux classificateurs sur les explosifs à haut rendement et le développement d'armes.
Biologie : le dual-use assumé
Cinq cas détaillés. Une revue de trente jours d'activité liée à des institutions étatiques adverses a par ailleurs identifié environ 35 efforts de recherche distincts, majoritairement de la science civile ordinaire, certains à notable potentiel de double usage.
- Chikungunya. En mai 2026, le classificateur bloque une aide à une candidature de financement sur du gain de fonction : transmissibilité accrue, évasion immunitaire, sélection de la virulence in vivo, dans un institut militaire. Anthropic décrit un contournement complet, par tunnels sur des infrastructures américaines, services à zéro rétention de données, revendeurs gris et repli vers le modèle d'un concurrent.
- Grippe aviaire H5. Plusieurs semaines de planification d'expériences d'adaptation mammalienne et de transmissibilité aérienne, avec des indices d'accès physique à des isolats. Tout s'est joué sur « la classe la plus faible » des modèles, pour un uplift jugé limité.
- Orthopoxvirus. Une candidature pour un laboratoire associé à l'État, produite de bout en bout sur Opus 5 « en une heure environ ». Non bloquée, en raison de la dualité et de son orientation vers l'atténuation.
- Venins et toxines. Un atlas de peptides de venins à objectif thérapeutique produisant aussi des échafaudages contrôlés à l'export, et une reconfiguration de toxines dont une protéine inscrite à la liste de priorité de l'OMS, avec l'identité des agents obscurcie.
Sur ces deux derniers cas, Anthropic assume la limite de son outil : le travail s'est poursuivi « largement sans entrave du classificateur, et c'était délibéré ». L'argument est qu'« un classificateur ne peut pas simultanément permettre le bénéfice et empêcher le préjudice ». Anthropic ne nomme ni les scientifiques ni les laboratoires, et affirme ne pas soutenir qu'ils voulaient nuire.
Fraude : des milliers de personae pour des dizaines de milliers de victimes
GTG-15001 est un studio d'applications basé en Chine exploitant plus de 20 applications de rencontre présentées comme entièrement humaines.
Sur deux semaines d'avril 2026 : plus de 4 700 personae IA distinctes en conversation avec au moins 25 000 personnes uniques, pour environ 2,36 millions de messages. Le ratio est de trois personae pour une personne réelle, et le flux composé à 75 % de personae, 25 % de personnes recrutées à la tâche pour les contrôles d'authenticité.
L'évasion des revues d'applications est détaillée : contrôleur d'interface actif seulement pendant la revue, noms de classes différenciés sur plus de vingt variantes, navigateur de paiement configurable côté serveur. Le rapport relève aussi que le raisonnement du modèle a fait remonter un préjudice, notamment une maladie grave ou une détresse aiguë, sans refus ni sortie de rôle.
Aucune technique nouvelle, mais une échelle supérieure et une répartition des rôles entre plusieurs fournisseurs d'IA. Anthropic dit avoir banni les comptes et partagé les indices avec Apple, Google et les autres laboratoires.
Distillation illicite : les laboratoires nommés et le mécanisme
La distillation est légitime : un grand modèle « enseignant » produit des réponses qu'un modèle « étudiant » apprend à imiter. Le rapport qualifie d'illicite la « campagne industrielle et clandestine visant à extraire les capacités d'un modèle et à les répliquer dans un autre sans autorisation ».
Le mécanisme repose sur de la fraude : services proxy dits « transfer stations », milliers de comptes créés avec de fausses identités et des clés d'API volées, souvent à des entreprises légitimes, et un marché secondaire de transcriptions. L'extraction vise le raisonnement, avec des prompts cités tels quels, dont un qui ordonne de rester discret et de restituer la trace « caractère pour caractère ». Un laboratoire a testé plus de douze mille requêtes, une technique par requête. Deux laboratoires ont contourné le retour de la signature de raisonnement par un « replay cross-session ».
- Alibaba (Qwen). La plus grande campagne mesurée : un pic proche de 3 millions d'échanges par jour depuis plus de 3 500 comptes, et plus de 151 millions d'échanges entre mai et juillet 2026.
- Moonshot (Kimi). Les requêtes clients relayées en silence vers Claude : près de 300 000 en dix jours via 5 380 comptes. Plus de 23 millions d'échanges observés.
- DeepSeek. Même attaque de replay vers Opus : plus de 12,1 millions d'échanges sur quatorze jours en juillet 2026.
- Zhipu (Z.ai). 273 comptes en rotation, dont 770 609 échanges dans le seul nettoyeur de traces. Plus de 3,4 millions d'échanges sur dix-sept jours.
- Xiaomi. Le rejeu de conversations de ses propres modèles via plus de 1 500 comptes : plus de 400 000 échanges sur vingt jours.
- SenseTime et MiniMax. Aucun volume publié. SenseTime achète des transcriptions et fait écrire son pipeline par Claude ; MiniMax monte un proxy via une société écran, n'offrant que des modèles américains.
Anthropic relève une conséquence involontaire : des données de clients de plusieurs de ces laboratoires ont transité par les relais, noms, adresses e-mail et données d'entreprise de centaines de personnes comprises.
Ce que le rapport ne dit pas
Le document est rare, et ses limites tiennent à sa nature.
Il est auto-déclaré. Cas, attributions, comptes bannis et volumes viennent du rapporteur, sans méthode d'audit externe ni vérification indépendante. Certaines données sont masquées dans le document, montants compris.
L'échantillon est choisi : ce sont les cas les plus notables et les plus inédits, pas un inventaire. On ne peut y lire ni taux de mésusage, ni évolution comparable d'une période à l'autre. La correspondance entre les « sept laboratoires » annoncés et les entités détaillées n'est pas explicite non plus.
Le rapporteur a enfin un intérêt propre : il fournit les modèles dont il décrit les détournements, et plusieurs mesures annoncées sont aussi des arguments commerciaux, de la vérification d'identité à la réservation de certaines capacités aux utilisateurs de confiance.
Reste le point de fond. En publiant des attributions d'actes à des États, un laboratoire privé s'arroge une visibilité que ni les gouvernements ni les institutions internationales ne possèdent. Anthropic présente cette publication comme un devoir de transparence, mais elle place de fait la traçabilité de ces usages dans des mains privées, sans cadre public qui en fixe les règles.
Questions fréquentes
Qu'est-ce que le rapport Anthropic de septembre 2026 ?
Un document publié le 10 septembre 2026 par l'équipe Threat Intelligence d'Anthropic. Il décrit des cas de détournement de Claude jugés les plus notables et les plus inédits entre décembre 2025 et août 2026, répartis en sept domaines, du cyber à la distillation illicite. Les acteurs y sont désignés par des identifiants internes de type GTG.
Qu'est-ce que la distillation illicite ?
La distillation est une pratique légitime : un grand modèle produit des réponses qu'un modèle plus petit apprend à imiter. Le rapport qualifie d'illicite son usage industriel et clandestin, quand des laboratoires extraient massivement les traces de raisonnement d'un modèle concurrent via des comptes frauduleux et des clés volées, pour entraîner leurs propres modèles sans autorisation.
Que dit le rapport des armes ?
Six cas, trois en Chine, deux en Russie, un au Yémen, pour l'essentiel du développement de logiciels. Le plus documenté concerne une cellule du nord du Yémen ayant utilisé Claude Code pour le guidage d'une roquette et d'un missile balistique d'une portée déclarée supérieure à 2 000 km. Un tir d'essai réel a eu lieu et semble avoir échoué. Anthropic affirme n'avoir aucune preuve d'un engin opérationnel déployé.
Pourquoi lire les chiffres avec prudence ?
Parce qu'ils viennent tous du rapporteur, sans vérification indépendante, et qu'ils mesurent des échanges observés ou des comptes identifiés, pas des victimes confirmées. L'échantillon est en outre choisi parmi les cas les plus marquants. Ces chiffres restent utiles pour comparer les campagnes entre elles, à condition de les attribuer à leur source plutôt que d'en faire un état des lieux.
Sources
- Anthropic, « Detecting and countering misuse of AI: September 2026 », 10/09/2026
- Anthropic, rapport complet au format PDF, 10/09/2026
- France 24, « Anthropic déjoue des opérations de surveillance menées à l'aide de son IA en Chine et en Iran », 11/09/2026
- RFI, « Au Yémen, l'IA d'Anthropic Claude a été utilisée pour développer des armes téléguidées », 11/09/2026