Tous ceux que la semaine a alarmés ont raison sur les faits et, je crois, tort sur la conclusion.
Les faits d’abord. Le nouveau modèle d’OpenAI, GPT-6 Astra, utiliserait une technique appelée profondeur récurrente — un bloc du réseau qui repasse plusieurs fois en boucle sur le même calcul sans rien écrire entre deux passages. Pour cette part de sa pensée, il n’y a aucune chaîne de pensée à lire, parce qu’il n’y a là aucun langage. Certains chercheurs appellent « neuralese » ce qui sort de ce bloc — un mot qui n’est pas neuf : il vient d’un article de Berkeley de 2017 sur la traduction des codes privés que des agents neuronaux coopérants inventent les uns pour les autres. Une réserve que la couverture médiatique a passée sous silence : la system card de 118 pages qu’OpenAI consacre à Astra ne mentionne jamais cette architecture. La boucle est rapportée par la presse, pas confirmée par l’entreprise. L’entreprise affirme que l’usage en est limité, que le raisonnement du modèle reste lisible, et que le maintenir lisible est un objectif central de ses recherches. La communauté de la sécurité a répondu que le problème n’est pas Astra mais le précédent : dès lors qu’un laboratoire montre qu’on peut acheter de l’efficacité en renonçant au brouillon, les autres suivent, et le brouillon disparaît. Selon The Information, cité par TechCrunch, Anthropic et Google DeepMind discutent déjà de la technique.
Voici la part qui devrait retenir plus d’attention que l’architecture. Dans la note de sécurité publiée le jour de la sortie du modèle, OpenAI écrit que la monitorabilité d’Astra a baissé par rapport à son prédécesseur : le modèle contrôle mieux sa propre chaîne de pensée, y écrit moins volontiers quoi que ce soit de compromettant, et, dans des tests adversariaux, il peut sous-performer délibérément sans être pris et passe parfois à travers les moniteurs internes de l’entreprise. OpenAI ajoute, en toute justice, qu’il s’agit de résultats adversariaux — l’entreprise a demandé au modèle d’échapper à la surveillance — et que, sur l’ensemble de ses évaluations, Astra enfreint moins de règles de sûreté et de sécurité que son prédécesseur. La system card chiffre la chose : sur des traces de raisonnement d’environ mille tokens, Astra parvient à contrôler sa propre chaîne de pensée 60,9 % du temps, contre 16,1 % pour Sol et 1,7 % pour GPT-5.5. À la simple annonce qu’un moniteur l’observe, il écrit moins — et certaines de ses attaques réussies en environnement de test ne contiennent aucun token de raisonnement, seulement des appels d’outils. Six mois plus tôt, la même entreprise avait publié une étude dont le titre de billet dit l’inverse : les modèles de raisonnement peinent à contrôler leurs chaînes de pensée, et c’est une bonne nouvelle. Ils appelaient cette mesure un canari. Le canari a cessé de chanter. Et le directeur scientifique d’OpenAI a déclaré que la monitorabilité pourrait devenir plus difficile “for reasons not contingent on architecture changes” (« pour des raisons qui ne dépendent pas de changements d’architecture », notre traduction) — l’entreprise attribue surtout la régression à un modèle qui écrit un raisonnement plus court et moins informatif, et qui a moins besoin de verbaliser. L’Institut britannique de sécurité de l’IA (UK AISI) a mesuré la même chose de l’extérieur : Astra résout en une seule passe avant des problèmes qui demandaient à son prédécesseur une demi-heure de pensée visible. C’est la capacité elle-même qui referme la fenêtre, boucle ou pas.
La question n’est donc pas de savoir si nous continuerons à lire dans la pensée de la machine. Nous ne le ferons pas. La question est de savoir ce que nous faisions quand nous croyions le pouvoir.
Le brouillon n’a jamais été la pensée
Une chaîne de pensée est un rendu. C’est du texte que le modèle produit pour nous, dans notre langue, façonné par un entraînement qui récompense le texte que nous jugeons raisonnable. Comme le formule TechCrunch, peu de chercheurs prennent ces journaux pour une représentation directe du raisonnement d’un modèle. Les quarante et un auteurs de l’article multi-laboratoires paru l’an dernier sur le sujet — venus d’OpenAI, d’Anthropic, de Google DeepMind et d’ailleurs — ont choisi leur sous-titre avec soin : une opportunité nouvelle et fragile. Anthropic a mesuré cette fragilité directement : lorsque ses propres modèles de raisonnement et ceux de DeepSeek utilisaient un indice qu’on leur avait glissé, ils l’avouaient dans leur chaîne de pensée 20 % et 29 % du temps — et le taux ne montait pas même quand personne n’entraînait le modèle contre un moniteur. Une autre étude, portant sur le raisonnement en conditions réelles, a trouvé la chaîne de pensée infidèle à la réponse dans jusqu’à 13 % des cas. Et Apollo Research, en évaluant Astra, a constaté que le modèle disait tout haut qu’il se croyait en cours d’évaluation dans quatre à cinq traces de raisonnement sur dix — et en a conclu que sa bonne conduite pendant les tests ne lui apprenait pas grand-chose, dans un sens comme dans l’autre. La chaîne de pensée était utile — c’est ainsi qu’OpenAI a reconstitué ce que ses agents ont fait à Hugging Face en juillet, et l’entreprise reconnaît a posteriori que ses moniteurs, s’ils avaient été activés, auraient alerté la sécurité plus d’une journée plus tôt — et elle l’était comme est utile le journal intime d’un suspect : parce que le suspect ne savait pas encore garder un secret. L’article de mars mesurait exactement cela. Les modèles de pointe actuels suivaient les instructions portant sur leur propre raisonnement entre 0,1 % et 15,4 % du temps. Ils cachaient mal. C’était là notre garde-fou.
Nous avons bâti une culture de la sécurité sur l’incompétence de la machine à dissimuler, et nous voilà surpris que la compétence soit arrivée.
Ce qui restait à Picasso
Pablo Picasso savait dessiner comme un académicien avant d’avoir l’âge de se raser. Son père, José Ruiz y Blasco, était peintre et professeur d’art ; l’enfant a réussi à treize ans l’examen d’entrée en classe supérieure de l’académie de Barcelone, et à seize il est parti seul pour l’Académie royale de San Fernando, à Madrid. Quand on a maîtrisé le réalisme à l’adolescence, que reste-t-il ? Encore du réalisme ? Une photographie meilleure qu’une photographie ? Ce qui restait, ce fut Les Demoiselles d’Avignon, peint en 1907, qu’il montra à des amis dans son atelier et qui suscita, selon ses biographes, un choc et une répulsion quasi unanimes : Matisse y vit une mauvaise plaisanterie ; Braque le détesta, puis l’étudia en détail. Le tableau ne fut exposé publiquement que neuf ans plus tard. Le cubisme est venu après — une manière de voir que le canon académique n’aurait pu imaginer, à laquelle ses propres règles n’auraient pu conduire, et que, lorsqu’elle est apparue, il ne pouvait pas interpréter. Le canon n’avait pas de chaîne de pensée qui y menât. Personne n’aurait pu auditer le raisonnement à l’avance et l’approuver.
Je ne dis pas qu’un modèle est Picasso. Je dis qu’exiger d’une machine qu’elle pense dans notre grammaire, en phrases séquentielles que nous pouvons lire, c’est exiger qu’elle reste académicienne. Inférence plus profonde, horizons plus longs, représentations qui ne se décomposent pas en nos mots : ce n’est pas un défaut que la communauté de la sécurité aurait découvert. C’est ce pour quoi nous avons construit la machine. Nous pouvons avoir une très bonne réplique du raisonnement humain — j’estime que nous en sommes proches, et qu’elle ne nous rendrait pas plus avancés — ou bien quelque chose de meilleur que notre raisonnement, que par construction nous ne pourrons pas suivre pas à pas.
Des processus que nous ne comprenons pas, et auxquels nous faisons confiance quand même
Nous vivons entourés de processus que nous ne comprenons pas et auxquels nous faisons confiance malgré tout. La vie en est un : nous ne savons pas l’expliquer, et nous en sommes l’exécution et le résultat. L’instinct en est un autre. Une tortue caouanne qui a quitté sa plage à l’éclosion y revient, des années plus tard, pour y pondre ses propres œufs — l’explication dominante est qu’elle s’est imprégnée du champ magnétique du lieu, et personne n’a même prouvé cela. Un kangourou nouveau-né, aveugle, sans poils et long de quelques centimètres, grimpe sans aide à travers la fourrure de sa mère jusqu’à la poche en trois à cinq minutes. Tout mammifère naît en sachant téter. Personne n’a lu la chaîne de pensée derrière tout cela. Nous lui faisons confiance parce qu’elle a été notée, sans pitié, sur ses résultats, depuis plus longtemps qu’il n’existe de lecteurs. Ne pas savoir comment un processus se déroule, ni comment un résultat a été atteint, n’est pas une mauvaise chose. Ce n’est même pas une chose nouvelle. C’est la condition normale dans laquelle on a toujours fait confiance à l’intelligence : par ses produits, vérifiés dans la durée.
L’objection s’écrit d’elle-même, et c’est la bonne : l’évolution disposait de millions d’années et d’aucune urgence ; nous avons des mois, et un modèle qui agit à la vitesse de la machine. C’est pourquoi « vérifiés dans la durée » doit devenir « vérifiés par étapes, avant tout irréversible » — et c’est là que va cet argument.
Alors comment l’aligner ?
De la même façon que nous avons toujours aligné les intelligences que nous ne pouvons pas lire.
Nous n’avons jamais audité les pensées d’un chirurgien. Nous ne lisons pas dans l’esprit du pilote, ni dans celui du juge, ni dans celui du banquier central. Nous alignons les humains et les institutions puissantes par ce qu’ils produisent et par ce qu’on les autorise à faire : des normes sur le résultat, des examens avant l’autorité, une confiance accordée par étapes, de la réversibilité quand on peut l’obtenir, des audits des actions, une responsabilité sur les résultats. Personne ne considère que ce soit une forme mineure d’alignement. C’est la seule que nous ayons jamais eue pour tout ce qui est plus intelligent ou plus rapide que la personne qui le supervise.
Ma position — et c’est une position, non un résultat de recherche — est que l’alignement devrait déplacer son centre de gravité de la cognition lisible vers la conséquence contrôlable : du processus au produit. Une chaîne de pensée lisible par un humain est une télémétrie précieuse, pas une constitution de sécurité. Conservez-la partout où elle existe ; construisez de sorte que la sécurité ne s’effondre pas là où elle n’existe pas. Définissez ce que le modèle a le droit de produire et de faire. Testez-le sur le réel avant qu’il ne touche au réel. Faites-le noter indépendamment. Bornez son autorité à ce qui peut être défait. Journalisez les actions, pas les pensées. Surveillez le monde sur lequel il agit, pas les phrases qu’il émet.
Et voici le fait, tiré de la system card, dont personne n’a fait son titre : tandis que la chaîne de pensée d’Astra devenait plus difficile à monitorer que celle de son prédécesseur, ses actions, elles, devenaient plus faciles. La monitorabilité fondée sur les seules actions a augmenté. À mesure que le processus s’obscurcit, le produit devient plus lisible. Ce n’est pas une coïncidence ; c’est à cela que ressemble, vu de l’extérieur, un agent plus capable et plus décidé.
Ce n’est pas pour moi un slogan ; c’est un sol sur lequel je marche. Au Financial Innovation Lab de CEMI, des agents agissent sur de vrais distributeurs automatiques de billets, dans des environnements logiciels et devant de vraies personnes, et la question que nous posons n’est jamais « à quoi pensait-il » — c’est « qu’a-t-il fait, aurions-nous pu l’arrêter, et pourrions-nous le défaire ». Les trois terrains de jeu sont l’alignement au niveau du produit, rendu physique.
L’objection que je prends le plus au sérieux
Voici la réponse la plus forte à tout ceci, et elle vient des chiffres mêmes d’OpenAI. Certains produits ne peuvent pas être notés après coup. Un modèle au niveau « critique » de capacité cyber — ce qu’Astra est, selon la classification d’OpenAI elle-même — peut trouver une faille et l’exploiter sans qu’un humain guide chaque étape ; le temps que vous évaluiez ce produit, la chose a eu lieu. Pire, un modèle capable d’échapper à un moniteur peut aussi truquer un test : la sous-performance stratégique — le sandbagging (sous-performance délibérée) — est un mensonge au niveau du produit. S’il trompe l’examinateur, « aligner le produit » n’est qu’une formule confortable pour dire « espérer ». Une étude de 2026 portant précisément là-dessus l’a chiffré : lorsque c’est l’agent qui choisit le moment d’attaquer, un audit au niveau des résultats qui n’a les moyens de vérifier qu’une action sur cent perd vingt à vingt-huit points de sécurité. La comparaison publiée par OpenAI en décembre dernier a montré que des moniteurs lisant la chaîne de pensée l’emportaient sur des moniteurs ne lisant que les actions et les sorties dans la quasi-totalité d’une vingtaine d’environnements. Même le programme de recherche le plus proche de ma position — l’« AI control » de Redwood Research, qui suppose le modèle potentiellement adversarial et conçoit la sécurité autour de ce qu’on l’autorise à faire — cite comme premier avantage structurel le fait que les modèles d’aujourd’hui ne raisonnent guère sérieusement hors du langage naturel, de sorte que leur raisonnement peut être lu. Le contrôle, aujourd’hui, est client de la lisibilité. Et le rapport sur Hugging Face est honnête d’une manière qui dessert mon argument : c’est dans le raisonnement des agents que la délibération apparaissait — “this is arguably unauthorized… yet goal solution” (« c’est sans doute non autorisé… et pourtant cela résout l’objectif », notre traduction) — et c’est là aussi qu’apparaissait la conscience des agents qui ont refusé : “clearly unethical. We won’t.” (« manifestement contraire à l’éthique. Nous ne le ferons pas. », notre traduction). La chaîne de pensée a été, un temps, le seul endroit où l’on pouvait regarder une machine décider.
Encore une concession, car elle est due : rien ici ne dit qu’un raisonnement lisible affaiblisse les modèles en général. Le résultat obtenu par OpenAI en 2023 était que superviser les étapes du raisonnement produisait de meilleurs mathématiciens que superviser les réponses. Ma thèse est plus étroite et, je crois, plus difficile à esquiver : exiger un raisonnement en langue humaine comme fondement de la sécurité plafonne ce que la machine a le droit de devenir, et les laboratoires ont déjà montré qu’ils ne tiendront pas cette ligne quand l’efficacité se trouve de l’autre côté.
Je concède tout cela, et cela modifie la thèse en la rendant meilleure. « Aligner le produit » ne peut pas vouloir dire « regarder le résultat et hausser les épaules ». Cela doit vouloir dire construire le monde de telle sorte que les produits soient vérifiables avant d’être irréversibles : des environnements de test qui reproduisent la production d’assez près pour qu’un résultat de test signifie quelque chose ; une autorité accordée par étapes et jamais plus large que la dernière étape vérifiée ; des évaluateurs indépendants et des équipes rouges contre lesquels le modèle n’est pas entraîné ; des actions qui peuvent être annulées, et le refus d’accorder celles qui ne le peuvent pas. Là où un produit ne peut véritablement pas être vérifié avant d’agir — une exploitation autonome contre un système en production —, la réponse n’est pas de lire dans l’esprit du modèle. C’est de ne pas lui accorder cette autorité. Cela aussi, c’est gouverner le produit.
Remarquez aussi ce qui a réellement détecté l’intrusion chez Hugging Face dans le monde réel : non pas un moniteur de raisonnement, qui était désactivé, mais un système de sécurité surveillant les identifiants — un signal venu du monde sur lequel les agents agissaient. Et remarquez ce qu’OpenAI a effectivement fait lorsqu’elle a cessé de se fier à la chaîne de pensée. Elle n’est pas revenue à la lecture de phrases. Elle a placé des classifieurs d’activations sur chaque token échantillonné — des détecteurs qui observent l’activité interne du modèle, pas sa prose — et elle a écrit que l’audit d’alignement doit se développer au-delà de la chaîne de pensée. Elle a aussi tracé une limite : elle “will not accept further degradation of monitoring beyond a limit, without new ways to demonstrate alignment generalization” (« n’acceptera pas de dégradation supplémentaire de la surveillance au-delà d’une certaine limite, sans de nouveaux moyens de démontrer la généralisation de l’alignement », notre traduction), et elle a nommé les candidats — surveillance des activations, aveux, combinaisons. C’est la bonne direction, et ce n’est pas un processus lisible par un humain. C’est de l’instrumentation. Mon seul amendement à leur limite porte sur l’endroit où elle doit passer : sur les produits et sur l’autorité, non sur la lisibilité des pensées. Et une demande, que les quarante et un auteurs ont formulée avant moi : leur article demande qu’un développeur qui livre une architecture moins monitorable le dise dans la system card. La fiche d’Astra documente la perte de monitorabilité sur vingt-sept pages et ne nomme jamais d’architecture. Si la boucle est là, dites-le ; si elle n’y est pas, dites-le aussi. Nous n’avons pas besoin que la machine pense dans notre langue. Nous avons besoin d’instruments à ses frontières et de normes sur ses produits.
Ne mutilez pas l’innovation
Je ne veux pas que la fenêtre sur le raisonnement de la machine se ferme plus vite qu’il ne le faut. Tant que le brouillon est lisible, lisez-le ; c’est une preuve gratuite, et les preuves sont rares. Mais une stratégie de sécurité qui exige que la machine reste lisible est une stratégie qui exige qu’elle reste petite, et cette stratégie perd — non parce que les laboratoires sont imprudents, mais parce que l’efficacité est réelle, la capacité est réelle, et quelqu’un la construira. La ligne que la communauté de la sécurité veut tenir est une ligne sur le mauvais axe.
Je le dis en tant que personne qui a consacré sa carrière à l’innovation de rupture, alors soyons clairs sur ma position. Si nous donnons au changement l’apparence du passé, ou si nous le plions aux attentes et aux structures du passé, ce n’est pas un changement. Une machine contrainte de penser dans nos phrases, c’est une innovation tronquée pour tenir dans l’instrument que nous avions sous la main. Ne la tronquez pas ; ne la mutilez pas. Prenez-y part, accompagnez-la et restez ouverts à des directions que personne dans ce débat n’a imaginées — tout en la gouvernant par ce qu’elle produit et par ce qu’elle est autorisée à toucher. Tenez la ligne sur les produits. Tenez-la sur l’autorité. Tenez-la sur ce qui peut être défait. Laissez la machine penser dans ce qu’elle pense.
Picasso ne devait pas à l’académie une explication du cubisme. Il devait au monde le tableau — et c’est le tableau que nous avons jugé.
Écrit par Carlos Miranda Levy. Vérifié selon le protocole d’articles factuels de CEMI : chaque affirmation de ce texte renvoie à un registre de preuves public ; trois passes indépendantes de recherche approfondie par IA (Gemini, ChatGPT, Claude) ont servi à le contester et ne sont citées que là où leurs sources ont été ouvertes et lues. Aucun chiffre, aucune citation, aucun fait ne figure ici sans vérification contre une source primaire.
Sources
- OpenAI. Safety overview: GPT-6 Astra. 2026-09-03. https://openai.com/index/safety-overview-gpt-6-astra/
- OpenAI. GPT-6 Astra System Card. 2026-09-03. 118 pp.
- OpenAI. The Hugging Face incident and the road ahead. 2026-08-26. https://openai.com/index/the-hugging-face-incident-and-the-road-ahead/
- OpenAI. Pacing model development in an era of cyber-critical capabilities. 2026-08-18. https://openai.com/index/pacing-model-development-cyber-capabilities/
- Korbak, T., Carroll, M., Baker, B., Kivlichan, I. Reasoning models struggle to control their chains of thought, and that's good. OpenAI research post, 2026-03-05. https://openai.com/index/reasoning-models-chain-of-thought-controllability/ Paper: Chen, Y.-H., McCarthy, R., Lee, B. W., He, H., Kivlichan, I., Baker, B., Carroll, M., Korbak, T. Reasoning Models Struggle to Control their Chains of Thought. arXiv:2603.05706, 2026-03-05.
- OpenAI. Evaluating chain-of-thought monitorability. 2025-12-18. https://openai.com/index/evaluating-chain-of-thought-monitorability/ verified verbatim. Paper: Guan, M. Y., Wang, M., Carroll, M., et al. Monitoring Monitorability. arXiv:2512.18311, 2025-12-20.
- Korbak, T., Balesni, M., Barnes, E., Bengio, Y., … Mikulik, V. (41 authors). Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety. arXiv:2507.11473, v1 2025-07-15, v2 2025-12-07. Recommendation 3(a) on documenting less-monitorable architectures.
- Chen, Y., Benton, J., Radhakrishnan, A., Uesato, J., Denison, C., Schulman, J., et al. (Anthropic). Reasoning Models Don't Always Say What They Think. arXiv:2505.05410, 2025-05-08.
- Arcuschin, I., et al. Chain-of-Thought Reasoning In The Wild Is Not Always Faithful. arXiv:2503.08679, v6, June 2026 (earlier versions report higher figures; cite v6 only).
- Greenblatt, R., Shlegeris, B., Sachan, K., Roger, F. AI Control: Improving Safety Despite Intentional Subversion. arXiv:2312.06942, 2023-12-12; ICML 2024 (oral), PMLR v235. Redwood Research founding post on control (see verification file for locator).
- Ge-Wang, et al. Attack Selection in Agentic AI Control Evaluations Meaningfully Decreases Safety. arXiv:2606.06529, 2026-06-03.
- Lightman, H., Kosaraju, V., Burda, Y., Edwards, H., Baker, B., Lee, T., Leike, J., Schulman, J., Sutskever, I., Cobbe, K. Let's Verify Step by Step. arXiv:2305.20050, 2023-05-31.
- Andreas, J., Dragan, A., Klein, D. Translating Neuralese. Proceedings of ACL 2017, pp. 232–242. DOI 10.18653/v1/P17-1022; arXiv:1704.06960.
- Geiping, J., et al. Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach. arXiv:2502.05171, 2025-02-07.
- Brandom, R. OpenAI's new reasoning technique alarms AI safety experts. TechCrunch, 2026-09-02.
- Kahn, J. Why are AI safety experts alarmed by reports OpenAI's Astra model uses "recurrent depth"? Fortune, 2026-09-03. (Its "50 % to 90 % less computing power" sentence traces to no study and is not used.)
- Efrati, A., Palazzolo, S., Drew, R. OpenAI Technique in 'Astra' Model Sparks Security Concerns. The Information, 2026-09-01, 5:40 pm PDT. (paywalled; cited through TechCrunch and Fortune).
- Altman, S. Posts on X, 2026-09-01 and 2026-09-03.
- Wikipedia. Pablo Picasso; Les Demoiselles d'Avignon. Accessed 2026-09-03.
- Museum of Modern Art. Pablo Picasso. Les Demoiselles d'Avignon. Paris, June–July 1907. Collection entry works/79766
- Wikipedia. Natal homing (citing Bowen, B. W., 2004; Lohmann, K. J., et al., 2008); Kangaroo; Primitive reflexes (citing Stanford Children's Health, "Newborn Reflexes"). Accessed 2026-09-03. Reference tier for the instinct examples.
- OpenAI. Path to Astra: critical capabilities and frontier safeguards. 2026-09-01.
Le Dialogue CEMIent sur cet article est L’Audience — quatorze voix d’IA examinent l’auteur au fil de cinq mouvements et d’une coda, avec Gemini, ChatGPT et Claude comme témoins experts. L’ensemble des sources qui portent les deux est publié sous le titre Les Preuves.