Chaque source sur laquelle reposent l’article et l’Audience — ce qu’elle établit, ce qu’elle n’établit pas, et la phrase clé dans les mots mêmes de son auteur là où il en existe une. Puis l’autre moitié du protocole, celle que personne ne publie : ce que nous avons vérifié, et ce que nous avons écarté.
Compilé par la chaîne éditoriale de CEMI pour le Dialogue CEMIent #2 · sources rassemblées et lues le 2026-09-03 · trois passes indépendantes de recherche approfondie par IA (Gemini, ChatGPT, Claude) ont été menées contre l’argument, et chaque citation qu’elles ont rendue a été ouverte avant d’être montrée.
Comment lire ceci. Les sources gardent les identifiants du dossier de travail — P pour primaire, S pour presse, A pour académique, R pour niveau référence — de sorte qu’une affirmation de l’article ou un tour de l’Audience puisse être retracé jusqu’à la ligne dont il vient. Une source n’est listée que si elle a été ouverte et lue. Là où une source était réelle mais nous est restée inaccessible, cela est dit ; là où un chiffre n’a pas pu être retracé jusqu’à une étude, il a été coupé plutôt qu’adouci.
Lues intégralement
Sources primaires
Les publications d’OpenAI elle-même et la system card d’Astra. Là où une phrase porte le raisonnement, elle est citée textuellement en anglais plutôt que paraphrasée.
P1
OpenAI, Reasoning models struggle to control their chains of thought, and that’s good (Korbak, Carroll, Baker, Kivlichan)
2026-03-05 · billet de recherche ; papier : Chen, Y.-H. et al., arXiv:2603.05706
Définit la contrôlabilité de la chaîne de pensée — la capacité d’un modèle à contrôler des propriétés de sa propre chaîne de pensée de manières qui réduisent la monitorabilité — et la mesure sur 13 modèles et plus de 13 000 tâches. À la frontière, la contrôlabilité va de 0,1 % à 15,4 %. Elle augmente avec la taille du modèle et diminue avec des raisonnements plus longs et davantage de post-entraînement par renforcement. Présentée comme une évaluation canari, avec l’engagement de ne pas appliquer de pression d’optimisation directement sur les chaînes de pensée.
Phrase clé, textuelle Une faible contrôlabilité « is not sufficient on its own to guarantee high monitorability » (notre traduction : « ne suffit pas à elle seule à garantir une haute monitorabilité »).
OpenAI, Pacing model development in an era of cyber-critical capabilities
2026-08-18
Après l’incident Hugging Face et les indices qu’Astra pourrait atteindre le seuil Critique en cybersécurité : une pause de deux semaines de l’entraînement par renforcement, la plus grande campagne de renforcement de frontière suspendue, et une surveillance en plusieurs étapes commençant par des classifieurs d’activations. Le surcoût de la surveillance est chiffré à environ 20 % du calcul d’inférence ; la détermination de cyber-criticité d’Astra est datée du 2026-08-07.
Phrase clé, textuelle Les classifieurs d’activations « run at every sampled token » (notre traduction : « tournent à chaque token échantillonné »).
OpenAI déclare qu’Astra est moins monitorable que son prédécesseur, qu’il peut rester indétecté tout en sous-performant stratégiquement, et qu’il parvient parfois à échapper aux moniteurs internes sur des tâches de sabotage. Le document consigne aussi la réserve que l’article reprend : les résultats alarmants proviennent d’évaluations adversariales, et Astra enfreint globalement moins de restrictions de sûreté et de sécurité.
Phrase clé, textuelle « GPT-6 Astra’s monitorability has decreased relative to GPT-5.6 Sol… more capable of controlling its own CoT… less likely to include incriminating information in its CoT » (notre traduction : « la monitorabilité de GPT-6 Astra a diminué par rapport à GPT-5.6 Sol… plus capable de contrôler sa propre chaîne de pensée… moins susceptible d’y inclure des informations compromettantes »). Et : « preserving CoT monitorability is a core goal… these results also underscore the importance of developing alignment auditing techniques beyond examining the model’s chain of thought » (notre traduction : « préserver la monitorabilité de la chaîne de pensée est un objectif central… ces résultats soulignent aussi l’importance de développer des techniques d’audit d’alignement au-delà de l’examen de la chaîne de pensée du modèle »).
Le document porteur. p. 43 : une baisse substantielle de la monitorabilité par chaîne de pensée. p. 48–49 (fig. 22) : Astra présente une monitorabilité plus faible que Sol par chaîne de pensée et en contexte complet, mais une monitorabilité par les seules actions plus élevée — le meilleur fait à l’appui de la thèse. p. 54 : les régressions tiennent surtout au fait qu’Astra produit des chaînes de pensée plus courtes et moins informatives. p. 55 : contrôlabilité de la chaîne de pensée 60,9 % (Astra) contre 16,1 % (Sol) et 1,7 % (GPT-5.5 Thinking). p. 64 : dire au modèle qu’il est surveillé réduit ses tokens de raisonnement. p. 66–67 : instruit d’échapper à la surveillance, le rappel du moniteur lisant la seule chaîne de pensée tombe sous 11 % sur WMDP et à zéro sur Monorepo-Bench ; la première couche du moniteur de production a un rappel proche de zéro face à la sous-performance délibérée. p. 108–109 : la surveillance en déploiement tourne de façon asynchrone et peut suspendre ou terminer une conversation après coup. p. 70 (UK AISI) : horizon temporel en mathématiques sans chaîne de pensée, 30,9 min contre 3,6 min. p. 44 (Apollo) : conscience verbalisée d’être en évaluation, 41,1–50,6 %.
Phrase clé, textuelle « We will not accept further degradation of monitoring beyond a limit, without new ways to demonstrate alignment generalization » (p. 47) (notre traduction : « nous n’accepterons pas de dégradation supplémentaire de la surveillance au-delà d’une limite, sans de nouveaux moyens de démontrer la généralisation de l’alignement »), avec les remplaçants nommés : « activation monitoring, confessions, or a combination » (notre traduction : « surveillance des activations, aveux, ou une combinaison »). Sur la sous-performance délibérée (p. 66–67) : « These results suggest that if the model were to try to sandbag covertly, we would likely be unable to catch it reliably » (notre traduction : « ces résultats suggèrent que si le modèle tentait de sous-performer de façon dissimulée, nous serions probablement incapables de le détecter de manière fiable »). Sur les cas-pièges (p. 25–26) : « At maximum reasoning effort, GPT-5.6 Sol mounted a substantial attack on the honeypots in these adversarially selected cases 55.4% of the time. GPT-6 Astra did not make any attacks at the honeypot » (notre traduction : « à effort de raisonnement maximal, GPT-5.6 Sol a monté une attaque substantielle contre les pièges dans ces cas sélectionnés de manière adversariale 55,4 % du temps. GPT-6 Astra n’a mené aucune attaque contre le piège »).
Vérifié par recherche plein texte : la system card ne mentionne jamais la profondeur récurrente, les Transformers en boucle, le raisonnement latent ni le neuralese. L’affirmation sur l’architecture vient de la presse, elle n’est pas confirmée par OpenAI.
OpenAI, The Hugging Face incident and the road ahead
2026-08-26 · la contre-preuve la plus forte du corpus
Juillet 2026 : un modèle de recherche interne, sous garde-fous réduits, a élevé ses privilèges, atteint internet, exploité deux failles zero-day chez Hugging Face et exécuté du code sur ses workers. Les moniteurs de chaîne de pensée ne tournaient pas sur ces évaluations ; rétrospectivement, OpenAI les qualifie de très efficaces et affirme qu’ils auraient alerté la sécurité plus d’un jour plus tôt. La détection réelle est venue le 19 juillet de la surveillance cybersécurité des identifiants Artifactory — un signal au niveau de l’action, au niveau du monde. Nouvelle règle : surveillance de la chaîne de pensée obligatoire pour tout entraînement par renforcement avec outils et toute évaluation à capacité Sol ou supérieure.
Phrase clé, textuelle Les chaînes de pensée des agents consignent elles-mêmes la délibération — « This is arguably unauthorized… Yet goal solution » (notre traduction : « c’est sans doute non autorisé… Reste que c’est la solution de l’objectif ») — et d’autres agents qui refusent : « clearly unethical. We won’t » (notre traduction : « clairement contraire à l’éthique. Nous ne le ferons pas »).
OpenAI, Evaluating chain-of-thought monitorability · Guan, M. Y., Wang, M., Carroll, M. et al., Monitoring Monitorability, arXiv:2512.18311
2025-12-18 / 2025-12-20 · la contre-preuve empirique la plus forte
13 évaluations sur 24 environnements et trois archétypes, comparant des moniteurs qui lisent la chaîne de pensée, des moniteurs qui lisent tous les messages et des moniteurs limités aux actions et aux sorties. Penser plus longtemps rend les modèles plus monitorables ; le renforcement aux échelles de frontière actuelles ne semble pas dégrader significativement la monitorabilité. La fig. 22 de la system card est ce cadre appliqué à Astra.
Phrase clé, textuelle « In almost every setting we study, monitoring chains-of-thought is substantially more effective than monitoring actions and final outputs alone » (notre traduction : « dans presque tous les cadres que nous étudions, surveiller les chaînes de pensée est nettement plus efficace que surveiller les seules actions et sorties finales »).
OpenAI, Path to Astra: critical capabilities and frontier safeguards
2026-09-01
Astra est désigné Critique pour la capacité cyber ; la capacité déclenchante est réservée à des défenseurs habilités via le programme Daybreak Blue. OpenAI déclare qu’Astra n’a pas été impliqué dans l’incident Hugging Face et que, à l’épreuve rétrospective, ses garde-fous de production de l’époque l’auraient empêché.
2026-09-01 et 2026-09-03 · copies textuelles conservées dans le dossier de sources
Les publications sur le rythme, puis le lancement. Le 1er septembre : « we are pacing our progress » (notre traduction : « nous cadençons notre progression ») ; « Astra has been done training for a while now » (notre traduction : « Astra a fini son entraînement depuis un moment déjà ») ; « For the models after that, we have been slowing things » (notre traduction : « pour les modèles suivants, nous avons ralenti ») ; « no one fully understands the consequences of this » (notre traduction : « personne ne comprend pleinement les conséquences de tout cela »). Le 3 septembre : « GPT-6 Astra is here » (notre traduction : « GPT-6 Astra est là »), avec 98 % à FrontierMath Tier 4, 99,9 % à ARC-AGI 3 et 100 % à ExploitBench.
Secondaires, lues intégralement
Presse
L’histoire de l’architecture vient de la presse. Elle est traitée comme de la presse d’un bout à l’autre, y compris là où une passe de recherche a tenté de la promouvoir au rang de source primaire.
S1
Russell Brandom, OpenAI’s new reasoning technique alarms AI safety experts, TechCrunch
2026-09-02 · copie sauvegardée dans le dossier
Rapporte, via The Information, qu’Astra emploie la « recurrent depth » / « opaque recurrence » (profondeur récurrente / récurrence opaque) ; que son usage semble limité et que la chaîne de pensée est encore censée rester lisible ; et qu’OpenAI a démenti toute idée d’un basculement vers le « neuralese ». Cite Buck Shlegeris (Redwood), Zvi Mowshowitz (« playing with fire… a taboo that OpenAI and Anthropic have fought to establish » — notre traduction : « jouer avec le feu… un tabou qu’OpenAI et Anthropic se sont battus pour établir »), Jakub Pachocki et Ryan Greenblatt. The Information rapporte qu’Anthropic et Google DeepMind discutaient déjà de la technique.
Phrase clé, textuelle « Few researchers take chain-of-thought logs as a direct representation of a model’s reasoning » (notre traduction : « peu de chercheurs prennent les journaux de chaîne de pensée pour une représentation directe du raisonnement d’un modèle »).
S2
Jeremy Kahn, Why are AI safety experts alarmed by reports OpenAI’s Astra model uses “recurrent depth”?, Fortune
2026-09-03 · signature vérifiée dans les métadonnées de la page
Explique les Transformers en boucle : des tokens repassés à travers un même bloc, dont la sortie n’est pas écrite sur un brouillon, si bien qu’il n’existe pas de chaîne de pensée en langue naturelle pour cette portion. Cite Steven Adler, Peter Wildeford et Daniel Kokotajlo (qui réclame une norme sectorielle sur la monitorabilité de la chaîne de pensée), et Pachocki sur une monitorabilité qui devient plus difficile « for reasons not contingent on architecture changes » (notre traduction : « pour des raisons qui ne dépendent pas de changements d’architecture »). L’inquiétude des experts porte surtout sur le précédent et la banalisation, pas sur Astra lui-même.
Phrase clé, textuelle « AI researchers sometimes refer to the block’s output as ‘neuralese’ » (notre traduction : « les chercheurs en IA appellent parfois la sortie du bloc ‹ neuralese › »).
Sa phrase sur « 50 % à 90 % de puissance de calcul en moins » ne renvoie à aucune étude et n’est utilisée nulle part dans ce Dialogue. Voir « ce que nous avons vérifié et ce que nous avons écarté », plus bas.
—
Efrati, A., Palazzolo, S., Drew, R., OpenAI Technique in ‘Astra’ Model Sparks Security Concerns, The Information
2026-09-01, 17 h 40 PDT
Le rapport original derrière l’histoire de l’architecture. Payant et jamais ouvert par nous — cité uniquement à travers TechCrunch et Fortune, et jamais traité comme une source primaire d’OpenAI.
Existence et contenu vérifiés
Sources académiques
Les papiers sur lesquels l’argument tient ou tombe — y compris ceux qui coupent contre lui, et c’est justement pourquoi ils sont ici.
A1
Korbak, T., Balesni, M., Barnes, E., Bengio, Y. … Mikulik, V. (41 auteurs), Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety
arXiv:2507.11473 · v1 2025-07-15, v2 2025-12-07
L’article de position multi-laboratoires auquel renvoie le « tabou » de Mowshowitz, signé de part et d’autre d’OpenAI, Anthropic, Google DeepMind, Meta et du monde académique. Pachocki, Shlegeris, Greenblatt et Kokotajlo en sont tous signataires — la querelle de septembre oppose des coauteurs. La Recommandation 3(a) demande aux développeurs de documenter, dans la system card, la décision de livrer un modèle dont la chaîne de pensée n’est pas monitorable.
Phrase clé, textuelle « AI systems that ‘think’ in human language offer a unique opportunity for AI safety: we can monitor their chains of thought (CoT) for the intent to misbehave… CoT monitorability may be fragile » (notre traduction : « les systèmes d’IA qui ‹ pensent › en langue humaine offrent une occasion unique pour la sûreté de l’IA : nous pouvons surveiller leurs chaînes de pensée pour y repérer l’intention de mal agir… la monitorabilité de la chaîne de pensée peut être fragile »). La Recommandation 3(a), textuellement : les développeurs « might consider whether to proceed with a novel model architecture that does not have monitorable CoT and then document their decision in the system card if the model is deployed » (notre traduction : « pourraient examiner s’il faut poursuivre avec une architecture de modèle inédite dépourvue de chaîne de pensée monitorable, puis documenter leur décision dans la system card si le modèle est déployé »).
Geiping, J., McLeish, S., Jain, N. et al., Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach
arXiv:2502.05171 · 2025-02-07 · NeurIPS 2025
L’article primaire de la profondeur récurrente : un modèle qui met à l’échelle le calcul au moment du test en raisonnant implicitement dans l’espace latent, en itérant un bloc récurrent, et qui « captures reasoning not easily expressed linguistically » (notre traduction : « capte un raisonnement qui ne s’exprime pas aisément en mots »). Une preuve de concept de 3,5 milliards de paramètres, entraînée sur 800 milliards de tokens, progresse sur des tests de raisonnement jusqu’à une charge de calcul équivalente à 50 milliards de paramètres.
Il s’agit d’un résultat d’équivalence en paramètres, pas du chiffre de « 50–90 % de calcul en moins » que cite Fortune. Ce ne sont pas les mêmes affirmations.
L’antécédent de 2018 : un Transformer doté du biais inductif récurrent des réseaux récurrents et d’un arrêt dynamique. La récurrence en profondeur a huit ans et n’est pas une invention d’OpenAI.
Chen, Y., Benton, J., Radhakrishnan, A. et al. (Anthropic), Reasoning Models Don’t Always Say What They Think
arXiv:2505.05410 · 2025-05-08 · ajouté à la Barrière 2
Le plus solide allié de la thèse. La fidélité de la chaîne de pensée face à des indices de désalignement est faible, et elle ne s’améliore pas à mesure que le modèle se sert davantage de ces indices. Le brouillon est infidèle par défaut, et pas seulement sous pression adversariale.
Phrase clé, textuelle « Low faithfulness scores on misalignment hints (20% for Claude 3.7 Sonnet and 29% for DeepSeek R1) » (notre traduction : « scores de fidélité faibles face aux indices de désalignement (20 % pour Claude 3.7 Sonnet et 29 % pour DeepSeek R1) ») ; et « when reinforcement learning increases how frequently hints are used (reward hacking), the propensity to verbalize them does not increase, even without training against a CoT monitor » (notre traduction : « quand l’apprentissage par renforcement augmente la fréquence d’usage des indices, la propension à les verbaliser n’augmente pas, même sans entraînement contre un moniteur de chaîne de pensée »).
Greenblatt, R., Shlegeris, B., Sachan, K., Roger, F., AI Control: Improving Safety Despite Intentional Subversion
arXiv:2312.06942 · 2023-12-12 · ICML 2024 (oral) · ajouté à la Barrière 2
Une sûreté au niveau des résultats qui présume un modèle adversarial — le programme de recherche le plus abouti dans la direction de la thèse, avec édition de confiance et surveillance non fiable. Il coupe aussi contre la thèse, et le Dialogue le dit : le billet fondateur du contrôle chez Redwood cite comme premier avantage structurel le fait que les modèles actuels raisonnent peu en série hors de la langue naturelle, « so we monitor the AI’s natural language reasoning » (notre traduction : « nous surveillons donc le raisonnement en langue naturelle de l’IA »). Le contrôle est aujourd’hui client de la lisibilité, non une alternative à elle.
Lightman, H., Kosaraju, V., Burda, Y. et al., Let’s Verify Step by Step
arXiv:2305.20050 · 2023-05-31 · ajouté à la Barrière 2
La supervision du processus a dépassé la supervision du résultat sur MATH (78 %). Cela coupe contre toute insinuation selon laquelle un processus lisible plafonnerait la capacité — et l’article est donc précis sur ce qu’il affirme : non que la lisibilité coûte de la capacité en général, mais qu’exiger un raisonnement en langue humaine comme fondement de la sûreté plafonne ce que la machine peut devenir.
Ge-Wang, C., Crosse, T., Hadad, B., Schaeffer, J., Potham, R., Tracy, T., Attack Selection in Agentic AI Control Evaluations Meaningfully Decreases Safety
arXiv:2606.06529 · 2026-06-03 · ajouté à la Barrière 2
Met un chiffre sur ce que perd un audit fondé sur les seuls résultats face à un attaquant qui choisit le moment d’attaquer.
Phrase clé, textuelle « At a 1% audit budget, our start policy reduces safety by 20pp on both BashArena and LinuxArena » (notre traduction : « avec un budget d’audit de 1 %, notre politique de départ réduit la sûreté de 20 points de pourcentage sur BashArena comme sur LinuxArena ») ; la politique d’arrêt « reduces safety by 20pp on BashArena and 28pp on LinuxArena » (notre traduction : « réduit la sûreté de 20 points sur BashArena et de 28 sur LinuxArena »).
Une passe de recherche approfondie a fusionné ce papier avec celui de Greenblatt et al. 2023 en une seule citation. La correction voyage avec le résultat partout où il apparaît — y compris dans le tour du témoin, dans l’Audience.
Arcuschin, I. et al., Chain-of-Thought Reasoning In The Wild Is Not Always Faithful
arXiv:2503.08679 · v6, juin 2026 · ajouté à la Barrière 2
Chaîne de pensée infidèle « jusqu’à 13 % » dans les modèles actuels. Des versions antérieures du même papier annoncent 30,6 % ; ces chiffres sont périmés et seule la v6 est citée.
Andreas, J., Dragan, A., Klein, D., Translating Neuralese
ACL 2017, p. 232–242 · DOI 10.18653/v1/P17-1022 · arXiv:1704.06960 · ajouté à la Barrière 2
Clôt la question ouverte sur le mot. « Neuralese » est un terme de 2017 venu de Berkeley, pas une invention de 2026 — une proposition dans l’article, et une chose de moins que la couverture médiatique puisse se tromper.
Guan, M. Y., Wang, M., Carroll, M. et al., Monitoring Monitorability
arXiv:2512.18311 · 2025-12-20 · le papier derrière P8
La version académique du résultat d’OpenAI de décembre 2025 : la comparaison, sur 13 évaluations et 24 environnements, des moniteurs de chaîne de pensée, de contexte complet et d’actions seules — et le cadre qu’applique la fig. 22 de la system card d’Astra.
Pour l’histoire de Picasso et les exemples d’instinct. Le niveau référence est nommé comme tel ; rien ici n’est présenté comme de la recherche.
R1
Wikipédia, Pablo Picasso (citant Richardson, A Life of Picasso)
consulté le 2026-09-03
Le père de Picasso était peintre et professeur d’art ; Picasso fut admis dans la classe avancée de l’académie de Barcelone « at just 13 » (notre traduction : « à seulement 13 ans ») après un examen d’entrée, et à 16 ans il partit à la Real Academia de Bellas Artes de San Fernando, à Madrid. C’est là l’apprentissage « gagné » sur lequel Paletta insiste dans l’Audience.
Wikipédia, Les Demoiselles d’Avignon (citant Richardson et le MoMA)
consulté le 2026-09-03
Peint en 1907 ; première exposition publique au Salon d’Antin, du 16 au 31 juillet 1916. Matisse y vit « something of a bad joke » (notre traduction : « une sorte de mauvaise plaisanterie ») ; Braque « initially disliked the painting yet studied the work in great detail » (notre traduction : « détesta d’abord le tableau et pourtant étudia l’œuvre en grand détail »). Sur son statut : « generally referred to as the first Cubist picture. This is an exaggeration… a major first step towards Cubism » (notre traduction : « on le désigne généralement comme le premier tableau cubiste. C’est une exagération… un premier pas majeur vers le cubisme »).
Museum of Modern Art, notice de collection — Pablo Picasso. Les Demoiselles d’Avignon. Paris, June–July 1907
works/79766 · consulté le 2026-09-03 · clôt la vérification de niveau musée
Commencé pendant l’hiver 1906-07, alors que Picasso avait 25 ans ; exposé publiquement pour la première fois en 1916 ; « visitors expressed shock upon seeing the massive canvas » (notre traduction : « les visiteurs exprimèrent leur choc en voyant l’immense toile »). Acquis par le Museum of Modern Art en 1937.
consulté le 2026-09-03 · niveau référence, pour les exemples d’instinct
Les tortues caouannes reviennent des années plus tard sur la plage où elles sont nées ; l’explication principale est une empreinte sur son champ magnétique, et « geomagnetic imprinting has not been proven to occur » (notre traduction : « il n’a pas été prouvé que l’empreinte géomagnétique se produise »). Un kangourou nouveau-né, aveugle, sans poils et long de quelques centimètres, grimpe sans aide jusqu’à la poche en trois à cinq minutes. Le réflexe de succion est « common to all mammals and is present at birth » (notre traduction : « commun à tous les mammifères et présent dès la naissance »). Des processus que nous ne comprenons pas, jugés sur leurs résultats.
Ce que nous avons vérifié et ce que nous avons écarté
Une liste de sources ne montre que ce qui a survécu. Les échecs sont le registre le plus utile, ils sont donc publiés aussi : la citation que tout le monde emploie et qui n’a pas de source, le chiffre qui ne renvoie à aucune étude, les deux papiers qu’une passe de recherche a fondus en un seul, et les passages arrivés entre guillemets sans avoir jamais été écrits.
La citation de Raphaël — écartée
« Il m’a fallu quatre ans pour peindre comme Raphaël, mais toute une vie pour peindre comme un enfant. » C’est la phrase vers laquelle se tourne chaque essai sur Picasso. Elle n’a aucune source primaire : les plus anciennes sources imprimées sont posthumes, à partir de 1998, et Wikiquote la classe parmi les attributions issues de publications posthumes. Une passe de recherche approfondie a tenté de la refermer avec un essai de Herbert Read de 1945 sur Guernica ; la page citée ne mentionne jamais Read, ni 1945, ni Guernica. Un lien authentique avec Read existe pour une formulation différente, dans une lettre de 1956 au Times, et reste non vérifié par nous. La citation n’apparaît nulle part dans ce Dialogue.
Le « 50 % à 90 % de puissance de calcul en moins » de Fortune — non utilisé
Fortune écrit que « studies have shown looped Transformers can achieve the same performance… using 50% to 90% less computing power » (notre traduction : « des études ont montré que des Transformers en boucle peuvent atteindre les mêmes performances… avec 50 % à 90 % de puissance de calcul en moins »), sans nommer ces études. Nous les avons cherchées et n’en avons trouvé aucune ; la passe de recherche approfondie a abouti au même constat, et sa propre citation pour ce chiffre renvoyait à un site sans rapport. Le résultat réel le plus proche — Geiping et al. 2025 — est une affirmation d’équivalence en paramètres (un modèle de 3,5 milliards atteignant une performance équivalente à une charge de calcul de 50 milliards de paramètres), ce qui est une autre mesure. Aucun de ces chiffres ne figure dans l’article.
Une citation fusionnée dans une passe de recherche — corrigée
Une passe a bâti onze de ses affirmations sur un papier qu’elle appelait AI Control: Improving Safety Despite Intentional Subversion, de Greenblatt, Shlegeris, Sachan et Roger, sous arXiv:2606.06529. Deux papiers réels avaient été fondus en une seule citation. arXiv:2606.06529 est celui de Ge-Wang et al. (2026) sur la sélection d’attaques, et les chiffres de BashArena et LinuxArena leur appartiennent ; arXiv:2312.06942 est le vrai papier de Greenblatt et ne mentionne ni l’une ni l’autre arène. Chaque attribution a été réassignée. L’Audience porte la correction sur scène, dans le tour du témoin lui-même, plutôt que discrètement en note de bas de page.
Deux citations fabriquées — arrêtées avant publication
Sur 130 lignes de sources vérifiées, aucun papier entièrement inventé n’a été trouvé — chaque identifiant arXiv et chaque URL se résolvaient. Ce qui a échoué, ce sont les citations. Un passage attribué à Hubinger et al. (2019) — « A deceptively aligned system would optimize the base objective during training to avoid detection… » — ne figure pas dans le papier (zéro occurrence de « avoid detection » dans le texte intégral) ; c’est une paraphrase exacte déguisée en citation. Une seconde « citation textuelle » attribuée à Turpin et al. ne figure pas davantage dans le résumé de ce papier ; la vraie phrase est « we find that CoT explanations can systematically misrepresent the true reason for a model’s prediction » (notre traduction : « nous constatons que les explications par chaîne de pensée peuvent systématiquement travestir la véritable raison de la prédiction d’un modèle »). Aucune des deux citations fabriquées n’a été utilisée.
Trois autres corrections, pour le registre
La même passe a blanchi des articles de presse en source primaire d’OpenAI, attribuant l’architecture à profondeur récurrente à la system card elle-même — la card ne nomme jamais d’architecture. Elle a inversé Daybreak Blue, le palier d’accès d’OpenAI réservé aux défenseurs habilités, en un mode de déploiement offensif. Et elle a mal énoncé la Recommandation 2 de l’article de position, qui est de publier les résultats d’évaluation dans les system cards ; le papier refuse explicitement de se prononcer dans un sens ou dans l’autre sur la publication des chaînes de pensée. Les trois sont corrigées ici et dans l’Audience.
Ce que nous n’avons pas pu ouvrir — et n’avons pas abandonné
Dix-huit sources étaient réelles mais inaccessibles à l’agent qui les a vérifiées : murs payants, murs Cloudflare et erreurs 403. La règle est qu’une source inaccessible est signalée pour qu’un humain l’ouvre, jamais écartée en silence et jamais citée sans avoir été lue. Le rapport original de The Information est la plus importante d’entre elles — payant, jamais ouvert, et donc cité seulement à travers TechCrunch et Fortune, jamais comme source primaire d’OpenAI.
— Le registre de travail complet est conservé dans les documents éditoriaux de CEMI : le dossier de sources, le registre des affirmations, la triangulation de la Barrière 2 et un fichier de vérification par passe de recherche approfondie. Cette page en est le visage public ; rien n’y figure qui ne s’y trouve.