Lire dans les pensées : une IA reconstruit ce que vous regardez à partir d'un scanner cérébral

Lire dans les pensées : une IA reconstruit ce que vous regardez à partir d'un scanner cérébral

Une IA développée à l'Institut Weizmann (Israël) reconstruit avec une précision remarquable l'image vue par une personne, à partir de son scanner cérébral. Elle fait aussi le chemin inverse : prédire l'activité cérébrale provoquée par une image. Les détails sont publiés dans un papier accepté à ICLR 2026.

Ce que la machine reconstruit, exactement

Le MIT Technology Review illustre le système avec des grilles d'images : à gauche ce que la personne regardait, à droite la recréation du modèle depuis son scan. La fidélité surprend, sans être parfaite : Michal Irani a montré en visio un gâteau devenu « une pile de trois sandwichs », et un chien dans une baignoire recréé en une chèvre de teinte similaire. Des échecs assumés, mais la méthode représente l'état de l'art : en test comparatif, elle surpassait nettement les outils précédents.

Comment ça marche : un transformer qui parle le langage du cerveau

La méthode, baptisée Brain-IT, repose sur le Brain Interaction Transformer (BIT), un transformer inspiré de l'organisation du cerveau. Contrairement aux modèles précédents, qui s'en remettaient à la capacité des modèles de diffusion à produire des images réalistes même avec un guidage cérébral limité, le BIT fait circuler l'information directement depuis des groupes de voxels cérébraux (les petits cubes de tissu mesurés par l'IRMf) vers des zones localisées de l'image.

Deux branches complémentaires

Le système analyse le scan sous deux angles à la fois : - une branche sémantique : le BIT prédit des caractéristiques de haut niveau qui orientent un modèle de diffusion (Stable Diffusion XL, selon le papier) vers le bon contenu, par exemple « un léopard qui court » ; - une branche structurelle : un second BIT prédit des caractéristiques visuelles de bas niveau (couleurs, orientations, disposition spatiale), puis un module appelé Deep Image Prior en tire une esquisse grossière de l'image : la mise en page générale, les zones de couleur.

À la génération, l'esquisse sert de point de départ au modèle de diffusion, qui l'affine sous guidance sémantique. L'image finale respecte à la fois la structure indiquée par le scan et le contenu. C'est ce qui manquait aux décodeurs précédents, capables de produire une belle image de banane sans la même position ni la même disposition.

Un encodeur universel qui entraîne les deux outils ensemble

La deuxième astuce est une boucle inverse : un encodeur « universel » prédit l'activité cérébrale attendue à partir d'une image, sans scanner réel. Les deux outils sont entraînés ensemble : on prédit le scan d'une image, on reconstruit l'image depuis ce scan prédit, et on corrige. La boucle permet d'entraîner le système sur des images jamais présentées à un humain dans un scanner : selon le MIT Technology Review, environ 70 % des données d'entraînement viennent d'images sans scan.

Chiffres : une heure de scan au lieu de quarante

La calibration freinait historiquement le décodage cérébral : environ 40 heures de données IRMf d'une même personne avant de prédire ce qu'elle voit. Le système de Weizmann se contente d'une heure de scan d'un nouveau sujet, avec des résultats comparables, et le papier décrit des reconstructions de qualité avec 30 minutes, voire 15 minutes, une première selon les auteurs.

Cette économie n'est pas un détail : un scan IRMf coûte entre 600 et 1 000 dollars l'heure, selon Tommy Sprague, neuroscientifique à l'UC Santa Barbara interrogé par le MIT Technology Review. Peu de laboratoires peuvent se payer 40 heures de scan par nouveau sujet ; avec une heure requise, la barrière s'effondre.

La matière première : la base Natural Scenes Dataset

Les données viennent de la base publique Natural Scenes Dataset (NSD), sur un IRM à 7 Tesla : 8 sujets, environ 73 000 paires image-IRMf, avec environ 9 000 images uniques par sujet, dont 1 000 partagées par tous (le jeu de test). S'y ajoutent environ 120 000 images naturelles sans scan, utilisées via l'encodeur pour enrichir l'entraînement.

Ces données ont aussi une valeur pour la neuroscience : les chercheurs ont identifié des régions aux fonctions partagées chez tous les individus. Une région répondrait aux images de nourriture, une autre aux images de sport. Michal Irani, informaticienne, travaille désormais avec des neuroscientifiques pour explorer la recherche en IA appliquée au cerveau.

Les limites : un scanner, un volontaire, des échecs

Trois limites cadrent ce que la méthode sait faire :

  • Un IRMf, appareil lourd et coûteux, la personne allongée à l'intérieur. Impossible dans la rue.
  • Un volontaire coopératif : la calibration suppose un sujet qui regarde activement des images en étant scanné, une barrière pratique à l'usage coercitif.
  • La reconstruction n'est pas parfaite : gâteau en sandwichs, chien-chèvre, et un SSIM de 0,486 en moyenne sur les sujets évalués, des images fidèles mais pas photoréalistes.

La suite préoccupe les chercheurs interrogés par le MIT Technology Review : des outils décodant l'EEG (l'activité électrique du cerveau, via casque d'électrodes ou écouteurs) progressent, et leurs modèles s'amélioreront en s'appuyant sur des travaux comme celui-ci. Marcello Ienca, neuroscientifique et philosophe à l'Université technique de Munich, parle d'un potentiel « game changer ».

L'enjeu : la vie privée mentale

Pour Judy Illes, neuroéthicienne à l'Université de Colombie-Britannique, l'application thérapeutique est « formidablement excitante » : aider les personnes « locked-in », paralysées, à communiquer via leur activité cérébrale. Une voie déjà ouverte quand une IA a guidé une opération du cerveau en direct pour préserver la vue d'un patient. L'article du MIT Technology Review évoque aussi l'étude des rêves et des flashbacks du SSPT (stress post-traumatique), un objectif que les chercheurs n'ont pas encore atteint.

Mais l'autre visage alarme. Tommy Sprague prévient : « Si on peut extraire en douce des informations sur vos pensées, alors 150 ans de science-fiction peuvent devenir réalité à tout moment ». Ienca imagine des entreprises qui extraient des données cérébrales sans consentement une fois le matériel EEG calibré, et des tribunaux admettant ces reconstructions comme preuve.

L'ambivalence est assumée : Irani balaie l'inquiétude (« Je ne pense qu'aux bonnes choses »), d'autres chercheurs jugent urgent de traiter l'éthique.

Questions fréquentes

Une IA peut-elle vraiment lire dans les pensées ?

Pas au sens fort : elle reconstruit l'image regardée à partir de l'IRMf, avec une fidélité que des chercheurs independants jugent remarquable, sans y parvenir parfois (un gâteau devient une pile de sandwichs). Prédire l'imagination ou les rêves reste non atteint.

Quelle est la précision de la reconstruction ?

Les métriques standard (SSIM de 0,486 en moyenne sur quatre sujets) montrent des reconstructions fidèles mais imparfaites, nettement au-dessus des outils précédents en test comparatif, sur la structure comme sur le contenu. Calibrer le modèle demande environ une heure de scan IRM, contre 40 heures auparavant.

Faut-il être dans un scanner pour être décodé ?

Oui, pour l'instant : un volontaire allongé dans un aimant lourd et coûteux. Les travaux sur l'EEG progressent, et c'est le scénario qui inquiète les neuroéthiciens : un casque calibré pourrait un jour être exploité sans consentement.

À quoi pourrait servir cette technologie ?

À aider les personnes « locked-in » à communiquer, à étudier les rêves ou les flashbacks du SSPT, et à comprendre le cerveau. Irani vise ensuite la vidéo et l'audio. Des chercheurs préviennent toutefois que des usages commerciaux ou judiciaires problématiques sont possibles sans garde-fous.

Conclusion

L'équipe de Weizmann pousse le décodage visuel du cerveau à un niveau inédit : structure et sens de l'image vue reconstruits ensemble, une heure de calibration au lieu de quarante. Les applications médicales fascinent, mais cette mécanique, portée par des capteurs de plus en plus portables, alimente des questions sans réponse sur la vie privée mentale. Comme le résume Tommy Sprague : « On doit être un peu plus sérieux au sujet des considérations éthiques ».

Sources

À lire aussi

À lire aussi