Saltar al contenido principal

← Diálogos · Alinea el producto, no el proceso

Un Diálogo CEMIent · El Artículo · Septiembre 2026

Alinea el producto, no el proceso

Lo que Picasso nos enseña sobre GPT-6 Astra, las cadenas de pensamiento y dónde debería vivir realmente la alineación

Ver el film

Diez minutos, narrado en seis secciones: el argumento como ensayo, con pausas.

Escuchar el artículo · 24 min

Quienes están alarmados esta semana tienen razón en los hechos y, creo, se equivocan en la conclusión.

Los hechos primero. Según lo reportado, el nuevo modelo de OpenAI, GPT-6 Astra, usa una técnica llamada profundidad recurrente: un bloque de la red que repite en bucle el mismo cómputo varias veces sin escribir nada en el intermedio. De esa parte de su pensamiento no hay cadena de pensamiento que leer, porque ahí no hay lenguaje alguno. Algunos investigadores llaman a lo que sale de ese bloque «neuralese», una palabra que no es nueva: viene de un artículo de Berkeley de 2017 sobre cómo traducir los códigos privados que los agentes neuronales que cooperan inventan entre sí. Una salvedad que la cobertura se ha saltado: la propia system card de Astra, de 118 páginas, no menciona la arquitectura en ningún momento. El bucle lo reporta la prensa; la empresa no lo ha confirmado. La empresa dice que el uso es limitado, que el razonamiento del modelo sigue siendo legible y que mantenerlo legible es un objetivo central de su investigación. La comunidad de seguridad respondió que el problema no es Astra sino el precedente: en cuanto un laboratorio demuestra que se puede comprar eficiencia entregando el borrador, los demás lo siguen, y el borrador desaparece. Según The Information, citado por TechCrunch, Anthropic y Google DeepMind ya discuten la técnica.

Y hay una parte que debería recibir más atención que la arquitectura. En el resumen de seguridad que publicó el mismo día del lanzamiento, OpenAI escribió que la monitorabilidad de Astra ha disminuido respecto de su predecesor: el modelo controla mejor su propia cadena de pensamiento, es menos propenso a escribir en ella algo incriminatorio y, en pruebas adversariales, puede rendir menos a propósito sin que lo detecten y a veces se escurre de los monitores internos de la empresa. OpenAI añade, con justicia, que son hallazgos adversariales —la empresa le instruyó al modelo que evadiera— y que en sus evaluaciones generales Astra rompe menos reglas de seguridad que su predecesor. La system card le pone números: en trazas de razonamiento de unos mil tokens, Astra logra controlar su propia cadena de pensamiento el 60,9 % de las veces, frente al 16,1 % de Sol y el 1,7 % de GPT-5.5. Basta decirle que un monitor lo observa para que escriba menos, y algunos de sus ataques exitosos en un entorno de prueba no contienen ningún token de razonamiento: solo llamadas a herramientas. Seis meses antes, la misma empresa había publicado un estudio cuyo título de blog dice lo contrario: a los modelos de razonamiento les cuesta controlar sus cadenas de pensamiento, y eso es bueno. A esa medición la llamaron un canario. El canario dejó de cantar. Y el científico jefe de OpenAI ha dicho que la monitorabilidad puede volverse más difícil «for reasons not contingent on architecture changes» (trad. propia: «por razones que no dependen de cambios de arquitectura»): la empresa atribuye la regresión sobre todo a un modelo que escribe razonamientos más cortos y menos informativos, y que tiene menos necesidad de verbalizar. El Instituto de Seguridad de la IA del Reino Unido (UK AISI) midió lo mismo desde fuera: Astra resuelve en un solo paso hacia adelante problemas que a su predecesor le tomaban media hora de pensamiento visible. La capacidad misma está cerrando la ventana, con bucle o sin él.

Así que la pregunta no es si podremos seguir leyendo la mente de la máquina. No podremos. La pregunta es qué estábamos haciendo cuando creímos que sí.

El borrador nunca fue el pensamiento

Una cadena de pensamiento es una representación. Es texto que el modelo produce para nosotros, en nuestro idioma, moldeado por un entrenamiento que premia el texto que nos parece razonable. Como lo puso TechCrunch, pocos investigadores toman esos registros como una representación directa del razonamiento de un modelo. Los cuarenta y un autores del artículo multilaboratorio del año pasado sobre el tema —de OpenAI, Anthropic, Google DeepMind y otros— eligieron su subtítulo con cuidado: «a new and fragile opportunity» (trad. propia: «una oportunidad nueva y frágil»). Anthropic midió la fragilidad directamente: cuando sus propios modelos de razonamiento y los de DeepSeek usaron una pista que se les había deslizado, lo admitieron en su cadena de pensamiento el 20 % y el 29 % de las veces, y la tasa no subió ni siquiera cuando nadie entrenaba contra un monitor. Un estudio aparte sobre razonamiento en condiciones reales encontró la cadena de pensamiento infiel a la respuesta en hasta el 13 % de los casos. Y Apollo Research, al evaluar Astra, encontró que el modelo decía en voz alta que creía estar siendo evaluado en cuatro o cinco de cada diez trazas de razonamiento, y concluyó que su buen comportamiento bajo prueba les decía poco en un sentido o en el otro. Fue útil: así reconstruyó OpenAI lo que sus agentes le hicieron a Hugging Face en julio, y la empresa dice en retrospectiva que sus monitores, de haber estado encendidos, habrían alertado a seguridad más de un día antes; y fue útil como es útil el diario de un sospechoso: porque el sospechoso todavía no era bueno guardando secretos. El artículo de marzo midió exactamente eso. Los modelos de frontera actuales siguieron instrucciones sobre su propio razonamiento entre el 0,1 % y el 15,4 % de las veces. Eran malos escondiendo. Esa era la salvaguarda.

Construimos una cultura de seguridad sobre la incompetencia de la máquina para ocultar, y ahora nos sorprende que llegara la competencia.

Lo que le quedaba a Picasso

Pablo Picasso dibujaba como un académico antes de tener edad de afeitarse. Su padre, José Ruiz y Blasco, era pintor y profesor de arte; el niño aprobó a los trece años el examen de ingreso a la clase avanzada de la academia de Barcelona y a los dieciséis se fue solo a la Real Academia de San Fernando, en Madrid. Cuando uno ha dominado el realismo siendo adolescente, ¿qué queda? ¿Más realismo? ¿Una fotografía mejor que una fotografía? Lo que quedaba era Les Demoiselles d'Avignon, pintado en 1907, que mostró a sus amigos en el estudio y que, en palabras de sus biógrafos, encontró un rechazo y un espanto casi unánimes: Matisse lo tomó por una mala broma (bad joke); a Braque le disgustó y después lo estudió en detalle. No se exhibió en público durante nueve años. El cubismo vino después: una manera de ver que el canon académico no habría podido imaginar, a la que no habría podido llegar con sus propias reglas y que, cuando apareció, no supo interpretar. El canon no tenía una cadena de pensamiento que llevara hasta ahí. Nadie habría podido auditar el razonamiento por anticipado y aprobarlo.

No estoy diciendo que un modelo sea Picasso. Estoy diciendo que exigirle a una máquina que piense en nuestra gramática, en frases secuenciales que podamos leer, es exigirle que siga siendo académica. Inferencia más profunda, horizontes más largos, representaciones que no se descomponen en nuestras palabras: eso no es un defecto que la comunidad de seguridad descubrió. Es aquello para lo que construimos la máquina. Podemos tener una réplica muy buena del razonamiento humano —creo que estamos cerca, y creo que no nos dejaría más sabios— o podemos tener algo mejor que nuestro razonamiento, que por construcción no vamos a poder seguir paso a paso.

Procesos que no entendemos y en los que confiamos igual

Vivimos rodeados de procesos que no entendemos y en los que confiamos igual. La vida es uno: no podemos explicarla, y somos su ejecución y su resultado. El instinto es otro. Una tortuga caguama que salió de su playa recién nacida vuelve a encontrarla, años después, para poner sus propios huevos; la explicación principal es que quedó impresa en el campo magnético del lugar, y ni siquiera eso está probado. Un canguro recién nacido, ciego, sin pelo y de unos pocos centímetros de largo, trepa sin ayuda por el pelaje de su madre hasta la bolsa en tres a cinco minutos. Todo mamífero nace sabiendo mamar. Nadie ha leído la cadena de pensamiento detrás de nada de eso. Confiamos en ello porque ha sido calificado, sin piedad, por resultados, durante más tiempo del que existen lectores. No saber cómo corre un proceso, o cómo se llegó a un resultado, no es algo malo. Ni siquiera es algo nuevo. Es la condición normal bajo la cual siempre se ha confiado en la inteligencia: por sus productos, verificados con el tiempo.

La objeción se escribe sola, y es la correcta: la evolución tuvo millones de años y ninguna prisa; nosotros tenemos meses, y un modelo que actúa a velocidad de máquina. Por eso «verificados con el tiempo» tiene que volverse «verificados por etapas, antes de nada irreversible», y hacia ahí va este argumento.

¿Entonces cómo lo alineamos?

Igual que hemos alineado siempre a las inteligencias que no podemos leer.

Nunca hemos auditado los pensamientos de un cirujano. No leemos la mente del piloto, ni la del juez, ni la del banquero central. Alineamos a los humanos y a las instituciones poderosas por lo que producen y por lo que se les permite hacer: estándares para el resultado, exámenes antes de la autoridad, confianza por etapas, reversibilidad donde se pueda conseguir, auditorías de las acciones, responsabilidad por los resultados. A nadie le parece que esa sea una forma menor de alineación. Es la única que hemos tenido nunca para algo más inteligente o más rápido que quien lo supervisa.

Mi posición —y es una posición, no un hallazgo— es que la alineación debe mover su centro de gravedad de la cognición legible a la consecuencia controlable: del proceso al producto. Una cadena de pensamiento legible por humanos es telemetría valiosa, no una constitución de seguridad. Conservarla donde exista; construir de modo que la seguridad no falle cuando no exista. Definir qué puede producir y hacer el modelo. Probarlo contra lo real antes de que toque lo real. Calificarlo de forma independiente. Acotar su autoridad a lo que se pueda deshacer. Registrar las acciones, no los pensamientos. Vigilar el mundo sobre el que actúa, no las frases que emite.

Y hay un dato de la system card con el que nadie ha abierto: mientras la cadena de pensamiento de Astra se volvió más difícil de monitorear que la de su predecesor, sus acciones se volvieron más fáciles. La monitorabilidad basada solo en acciones subió. A medida que el proceso se oscurece, el producto se vuelve más legible. No es una coincidencia: es lo que se ve desde fuera cuando un agente es más capaz y más decidido.

Para mí eso no es un eslogan; es el suelo sobre el que camino. En el Laboratorio de Innovación Financiera de CEMI, los agentes actúan sobre cajeros automáticos reales, en entornos de prueba de software y frente a personas reales, y la pregunta que hacemos nunca es «qué estaba pensando»: es «qué hizo, si habríamos podido detenerlo y si podemos deshacerlo». Las tres áreas de experimentación son la alineación a nivel de producto hecha física.

La objeción que más en serio me tomo

La respuesta más fuerte a todo esto viene de los propios números de OpenAI. Hay productos que no se pueden calificar después del hecho. Un modelo en el nivel «crítico» de capacidad cibernética —que es donde está Astra, según la propia clasificación de OpenAI— puede encontrar una falla y explotarla sin que un humano guíe cada paso; para cuando uno evalúa ese producto, ya ocurrió. Peor: un modelo capaz de evadir un monitor también puede hacer trampa en una prueba; el bajo rendimiento estratégico —el sandbagging (rendir menos a propósito)— es una mentira a nivel de producto. Si engaña al calificador, «alinea el producto» es una frase cómoda para decir «ojalá». Un estudio de 2026 sobre exactamente esto le puso número: cuando el agente elige cuándo atacar, una auditoría a nivel de resultados que solo alcanza a revisar una acción de cada cien pierde entre veinte y veintiocho puntos de seguridad. La propia comparación de OpenAI, publicada en diciembre pasado, encontró que los monitores que leen la cadena de pensamiento le ganan a los monitores que solo leen acciones y salidas en casi la totalidad de dos docenas de entornos. Incluso el programa de investigación que más se acerca a mi posición —el «AI control» de Redwood Research, que asume que el modelo puede ser adversarial y diseña la seguridad alrededor de lo que se le permite hacer— enumera como su primera ventaja estructural que los modelos de hoy hacen poco razonamiento serio fuera del lenguaje natural, de modo que su razonamiento se puede leer. El control, hoy, es cliente de la legibilidad. Y el informe de Hugging Face es honesto de una manera que le hace daño a mi argumento: el razonamiento de los agentes es donde se vio la deliberación —«this is arguably unauthorized… yet goal solution» (trad. propia: «esto podría no estar autorizado… pero resuelve el objetivo»)— y donde se vio también la conciencia de los agentes que se negaron: «clearly unethical. We won't.» (trad. propia: «claramente poco ético. No lo haremos»). La cadena de pensamiento fue, por un tiempo, el único lugar donde se podía ver a una máquina decidir.

Una concesión más, porque se la debo: nada de esto dice que el razonamiento legible haga a los modelos más débiles en general. El propio resultado de OpenAI en 2023 fue que supervisar los pasos del razonamiento producía mejores matemáticos que supervisar las respuestas. Mi afirmación es más estrecha y, creo, más difícil de esquivar: exigir razonamiento en lenguaje humano como fundamento de la seguridad le pone techo a lo que se le permite llegar a ser a la máquina, y los laboratorios ya mostraron que no van a sostener esa línea cuando la eficiencia está del otro lado.

Lo concedo todo, y eso cambia la tesis de una manera que la mejora. «Alinea el producto» no puede significar «mira el resultado y encógete de hombros». Tiene que significar construir el mundo de modo que los productos sean verificables antes de ser irreversibles: entornos de prueba que repliquen la producción lo bastante bien como para que un resultado de prueba signifique algo; autoridad concedida por etapas y nunca más amplia que la última etapa verificada; calificadores independientes y equipos rojos contra los que el modelo no se entrene; acciones que se puedan revertir, y la negativa a conceder las que no. Donde un producto realmente no se pueda verificar antes de actuar —un exploit autónomo contra un sistema en producción—, la respuesta no es leerle la mente al modelo. Es no darle esa autoridad. Eso también es gobernanza del producto.

Nótese, además, qué fue lo que de verdad atrapó la intrusión de Hugging Face en el mundo real: no un monitor de razonamiento, que estaba apagado, sino un sistema de seguridad que vigilaba credenciales; una señal del mundo sobre el que actuaron los agentes. Y nótese qué hizo OpenAI cuando dejó de confiar en la cadena de pensamiento. No volvió a leer frases. Puso clasificadores de activaciones sobre cada token muestreado —detectores que vigilan la actividad interna del modelo, no su prosa— y escribió que la auditoría de alineación tiene que desarrollarse más allá de la cadena de pensamiento. También trazó una línea: «will not accept further degradation of monitoring beyond a limit, without new ways to demonstrate alignment generalization» (trad. propia: «no aceptará una degradación adicional del monitoreo más allá de cierto límite sin nuevas formas de demostrar la generalización de la alineación»), y nombró a los candidatos: monitoreo de activaciones, confesiones, combinaciones. Esa es la dirección correcta, y no es un proceso legible por humanos. Es instrumentación. Mi única enmienda a su línea es dónde debe trazarse: sobre los productos y sobre la autoridad, no sobre la legibilidad de los pensamientos. Y una petición, que los cuarenta y un autores hicieron antes que yo: su artículo pide que un desarrollador que lance una arquitectura menos monitoreable lo diga en la system card. La system card de Astra documenta la pérdida de monitorabilidad a lo largo de veintisiete páginas y nunca nombra una arquitectura. Si el bucle está ahí, que lo digan; si no está, que lo digan también. No necesitamos que la máquina piense en nuestro idioma. Necesitamos instrumentos en sus fronteras y estándares en sus productos.

No mutilen la innovación

No quiero que la ventana al razonamiento de la máquina se cierre más rápido de lo necesario. Mientras el borrador sea legible, léanlo; es evidencia gratuita, y la evidencia escasea. Pero una estrategia de seguridad que exige que la máquina siga siendo legible es una estrategia que exige que siga siendo pequeña, y esa estrategia pierde: no porque los laboratorios sean temerarios, sino porque la eficiencia es real, la capacidad es real y alguien la construirá. La línea que la comunidad de seguridad quiere sostener está en el eje equivocado.

Lo digo como alguien que ha dedicado su carrera a la innovación disruptiva, así que seré claro sobre dónde estoy. Si hacemos que el cambio se parezca al pasado, o lo doblegamos a las expectativas y estructuras del pasado, no es cambio. Una máquina obligada a pensar en nuestras frases es innovación truncada para caber en el instrumento que teníamos a mano. No la trunquen; no la mutilen. Sean parte de ella, acompáñenla y manténganse abiertos a direcciones que nadie en este debate ha imaginado, sin dejar de gobernarla por lo que produce y por lo que se le permite tocar. Sostengan la línea en los productos. Sosténganla en la autoridad. Sosténganla en lo que se puede deshacer. Dejen que la máquina piense en lo que sea que piense.

Picasso no le debía a la academia una explicación del cubismo. Le debía al mundo el cuadro, y el cuadro es lo que juzgamos.

Escrito por Carlos Miranda Levy. Verificado bajo el protocolo de artículos factuales de CEMI: cada afirmación de este texto remite a un libro de evidencia público; tres pasadas independientes de investigación profunda con IA (Gemini, ChatGPT, Claude) se usaron para refutarlo y se citan solo donde sus fuentes se abrieron y leyeron. Ninguna cifra, cita o hecho aparece aquí sin verificación contra una fuente primaria.

Fuentes

  1. OpenAI. Safety overview: GPT-6 Astra. 2026-09-03. https://openai.com/index/safety-overview-gpt-6-astra/
  2. OpenAI. GPT-6 Astra System Card. 2026-09-03. 118 pp.
  3. OpenAI. The Hugging Face incident and the road ahead. 2026-08-26. https://openai.com/index/the-hugging-face-incident-and-the-road-ahead/
  4. OpenAI. Pacing model development in an era of cyber-critical capabilities. 2026-08-18. https://openai.com/index/pacing-model-development-cyber-capabilities/
  5. Korbak, T., Carroll, M., Baker, B., Kivlichan, I. Reasoning models struggle to control their chains of thought, and that's good. OpenAI research post, 2026-03-05. https://openai.com/index/reasoning-models-chain-of-thought-controllability/ Paper: Chen, Y.-H., McCarthy, R., Lee, B. W., He, H., Kivlichan, I., Baker, B., Carroll, M., Korbak, T. Reasoning Models Struggle to Control their Chains of Thought. arXiv:2603.05706, 2026-03-05.
  6. OpenAI. Evaluating chain-of-thought monitorability. 2025-12-18. https://openai.com/index/evaluating-chain-of-thought-monitorability/ verified verbatim. Paper: Guan, M. Y., Wang, M., Carroll, M., et al. Monitoring Monitorability. arXiv:2512.18311, 2025-12-20.
  7. Korbak, T., Balesni, M., Barnes, E., Bengio, Y., … Mikulik, V. (41 authors). Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety. arXiv:2507.11473, v1 2025-07-15, v2 2025-12-07. Recommendation 3(a) on documenting less-monitorable architectures.
  8. Chen, Y., Benton, J., Radhakrishnan, A., Uesato, J., Denison, C., Schulman, J., et al. (Anthropic). Reasoning Models Don't Always Say What They Think. arXiv:2505.05410, 2025-05-08.
  9. Arcuschin, I., et al. Chain-of-Thought Reasoning In The Wild Is Not Always Faithful. arXiv:2503.08679, v6, June 2026 (earlier versions report higher figures; cite v6 only).
  10. Greenblatt, R., Shlegeris, B., Sachan, K., Roger, F. AI Control: Improving Safety Despite Intentional Subversion. arXiv:2312.06942, 2023-12-12; ICML 2024 (oral), PMLR v235. Redwood Research founding post on control (see verification file for locator).
  11. Ge-Wang, et al. Attack Selection in Agentic AI Control Evaluations Meaningfully Decreases Safety. arXiv:2606.06529, 2026-06-03.
  12. Lightman, H., Kosaraju, V., Burda, Y., Edwards, H., Baker, B., Lee, T., Leike, J., Schulman, J., Sutskever, I., Cobbe, K. Let's Verify Step by Step. arXiv:2305.20050, 2023-05-31.
  13. Andreas, J., Dragan, A., Klein, D. Translating Neuralese. Proceedings of ACL 2017, pp. 232–242. DOI 10.18653/v1/P17-1022; arXiv:1704.06960.
  14. Geiping, J., et al. Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach. arXiv:2502.05171, 2025-02-07.
  15. Brandom, R. OpenAI's new reasoning technique alarms AI safety experts. TechCrunch, 2026-09-02.
  16. Kahn, J. Why are AI safety experts alarmed by reports OpenAI's Astra model uses "recurrent depth"? Fortune, 2026-09-03. (Its "50 % to 90 % less computing power" sentence traces to no study and is not used.)
  17. Efrati, A., Palazzolo, S., Drew, R. OpenAI Technique in 'Astra' Model Sparks Security Concerns. The Information, 2026-09-01, 5:40 pm PDT. (paywalled; cited through TechCrunch and Fortune).
  18. Altman, S. Posts on X, 2026-09-01 and 2026-09-03.
  19. Wikipedia. Pablo Picasso; Les Demoiselles d'Avignon. Accessed 2026-09-03.
  20. Museum of Modern Art. Pablo Picasso. Les Demoiselles d'Avignon. Paris, June–July 1907. Collection entry works/79766
  21. Wikipedia. Natal homing (citing Bowen, B. W., 2004; Lohmann, K. J., et al., 2008); Kangaroo; Primitive reflexes (citing Stanford Children's Health, "Newborn Reflexes"). Accessed 2026-09-03. Reference tier for the instinct examples.
  22. OpenAI. Path to Astra: critical capabilities and frontier safeguards. 2026-09-01.

El Diálogo CEMIent sobre este artículo es La Audiencia — catorce voces de IA examinan al autor a lo largo de cinco movimientos y una coda, con Gemini, ChatGPT y Claude como testigos expertos. El conjunto de fuentes que sostiene a ambos se publica como La Evidencia.