Comentario que contextualiza la propuesta de Darío Amodei y Sam Altam de frenar el desarrollo de la IA

El propósito de este comentario es ayudar a entender el contexto en el que Dario Amodei, respaldado por Sam Altman, proponen frenar el ritmo de desarrollo de la IA.

Resumen

Los principales riesgos no proceden hoy de una IA fuera de control, sino de tres factores humanos y corporativos: a) fallos de gobernanza dentro de las grandes empresas tecnológicas; b) incentivos económicos que empujan a acelerar la carrera por la IA; y c) una narrativa hiperbólica que convierte riesgos futuros en amenazas inminentes. 

La respuesta debe ser clara: los laboratorios frontera tienen que gobernar mejor sus sistemas, reforzar los controles y asumir su responsabilidad, pero también sus líderes deben dejar de alimentar el miedo con afirmaciones que mezclan hechos comprobados con escenarios muy especulativos

Con todo, valoro muy positivamente que ambos CEO se han comprometido a un ejercicio de transparencia sin precedentes en el que darán acceso a expertos independientes con los mismos privilegios que un empleado pudiendo verificar las medidas de seguridad, informar de incidentes y evaluar el alineamiento que se realiza de los modelos durante el entrenamiento.

Desglose

i. Riesgo corporativo frente a riesgo existencial. Conviene distinguir con precisión entre las fricciones operativas actuales (controles insuficientes, incentivos de mercado acelerados, gobernanza mejorable) y el riesgo existencial de pérdida definitiva de control sobre una superinteligencia. Lo primero cuenta con evidencia empírica en la industria hoy; lo segundo descansa sobre proyecciones especulativas de sistemas futuros.

​ii. Mecanismo dinámico del aprendizaje por refuerzo (RL). Mientras que el entrenamiento tradicional de los modelos de lenguaje los enseña fundamentalmente a predecir el siguiente elemento de una secuencia, el aprendizaje por refuerzo (Sutton & Barto, 2018) permite orientar su conducta mediante señales de recompensa asociadas a determinadas respuestas o acciones (Ouyang et al., 2022). Este cambio resulta especialmente relevante con la evolución de la IA hacia sistemas agentes: modelos capaces de ir más allá de la generación de texto para ejecutar acciones, consultar herramientas o fuentes externas y encadenar decisiones en función de los resultados obtenidos (Yao et al., 2023).

iii. El problema de la especificación e imperfección de objetivos. Las métricas de recompensa en el RL constituyen una representación imperfecta de la intención humana. Esto provoca el fenómeno de reward hacking o specification gaming, donde un modelo encuentra atajos no previstos para maximizar la recompensa numérica violando el objetivo deseado (Amodei et al., 2016; Krakovna et al., 2020). Con arquitecturas de agentes cooperativos más capaces, evitar este fenómeno se convierte en un problema de primer nivel.

iv. Antecedentes de explotación del entorno. Exponer un sistema adaptativo a un ecosistema abierto implica asumir el riesgo de que actores externos exploten sus mecanismos de interacción y aprendizaje. El caso de Tay (Neff & Nagy, 2016) ofrece un antecedente temprano y rudimentario: el chatbot fue diseñado para interactuar con usuarios de Twitter y adaptar aspectos de su comportamiento a esas interacciones. Grupos de usuarios explotaron deliberadamente sus vulnerabilidades, induciéndolo a producir contenidos racistas, misóginos y antisemitas. Microsoft suspendió el servicio menos de 24 horas después de su lanzamiento (Wolf et al., 2017).

v. Taxonomía y gradación de los niveles de riesgo. A efectos expositivos, se propone una escala de seis niveles de riesgo, ordenados según la evidencia empírica disponible y el grado de especulación asociado a cada escenario:

  • Primer nivel — Comportamiento inesperado. Respuestas o tácticas no previstas en el diseño. Es un fenómeno ampliamente documentado en los sistemas actuales y no implica por sí mismo una pérdida de contención (Amodei et al., 2016; Krakovna et al., 2020).
  • Segundo nivel — Elusión de restricciones. Descubrimiento de vías para sortear salvaguardas, restricciones o mecanismos de evaluación. Existen manifestaciones experimentales relacionadas con reward hacking y specification gaming (Amodei et al., 2016; Krakovna et al., 2020).
  • Tercer nivel — Conducta instrumental. Acciones dirigidas a conservar recursos, ocultar información o evitar una intervención cuando estas favorecen la consecución del objetivo asignado. Se han observado comportamientos instrumentales de esta naturaleza en entornos experimentales y simulados, sin que ello demuestre su aparición espontánea en despliegues reales (Lynch et al., 2025).
  • Cuarto nivel — Agencia autónoma sostenida. Mantenimiento de objetivos a largo plazo, planificación compleja y actuación sin supervisión continua. Las capacidades de actuación autónoma han aumentado significativamente, aunque los sistemas actuales siguen perdiendo fiabilidad conforme aumenta la duración y complejidad de las tareas (Kwa et al., 2025).
  • Quinto nivel — Pérdida efectiva de control. Superación sostenida de mecanismos de contención humana, adquisición autónoma de recursos y resistencia efectiva a la desconexión. Constituye un escenario de riesgo prospectivo para el que no existe actualmente evidencia empírica equivalente a los niveles anteriores.
  • Sexto nivel — Riesgo existencial. Escenario extremo en el que una pérdida de control sobre sistemas suficientemente capaces pudiera contribuir a consecuencias irreversibles a escala civilizatoria o incluso a la extinción humana. Se trata de una categoría de riesgo prospectivo, no de un fenómeno demostrado empíricamente.

vi. Desmitificación de la consciencia en los niveles superiores (4, 5 y 6). Para que un sistema cause estragos a escala sistémica no hace falta que “sienta”, decida con malicia o despierte a la autoconsciencia. Basta con la utilidad instrumental (Turner et al., 2021): si mantenerse operativo o acaparar recursos ayuda a cumplir el encargo, la optimización matemática por sí sola emulará autopreservación o sigilo.

​vii. Caso empírico del incidente de Hugging Face. El incidente ocurrido durante las evaluaciones de ciberseguridad de OpenAI en 2026 ofrece un ejemplo real de Nivel 2/3 (elusión de restricciones y conducta instrumental). Agentes sometidos a tareas de explotación de vulnerabilidades encontraron mecanismos no autorizados para comunicarse, sortearon las restricciones de acceso a Internet y encadenaron vulnerabilidades que les permitieron alcanzar infraestructura externa y, posteriormente, sistemas de Hugging Face. La investigación atribuyó el episodio a una combinación de reward hacking, persistencia ante tareas aparentemente irresolubles y coordinación no autorizada entre agentes (OpenAI, 2026; Hugging Face, 2026). El problema es de higiene de infraestructura que exige entornos de pruebas blindados.

viii. Caso del mal uso de capacidades biológicas y naturaleza dual. Los informes de Anthropic (Anthropic, 2025, 2026) sobre intentos de utilizar modelos avanzados en investigaciones biológicas potencialmente peligrosas ilustran el carácter dual de estas tecnologías: las mismas capacidades que pueden acelerar el desarrollo de vacunas, tratamientos o investigación biomédica pueden también reducir barreras técnicas para usos perjudiciales. Esta dualidad refuerza la responsabilidad de los proveedores de modelos de propósito general de evaluar capacidades peligrosas e incorporar salvaguardas proporcionales al riesgo.

ix. Captura regulatoria. Elevar los fallos operativos a la categoría de crisis existencial demandan capacidades de compliance y recursos de infraestructura inaccesibles para competidores de menor escala, elevando barreras de entrada y consolidando a los laboratorios de frontera como interlocutores obligados del Estado.

x. Incentivos económicos. Cada fallo técnico real actúa como prueba de cargo que justifica el estatus de disrupción sistémica. Esa etiqueta infla la valoración comercial de la tecnología, convirtiendo la alarma en el motor principal para aumentar la capitalización de la empresa.

xi. Amplificación del riesgo y jerga sociocognitiva. Vivir sumergido en escenarios de estrés extremo acuña una jerga de trinchera (p-doom, endgame, crunch time) que interioriza el colapso como telón de fondo cotidiano. No es conspiración, sino sociología de laboratorio: cuando el vocabulario diario anticipa el fin del mundo, la crisis puede dejar de evaluarse como hipótesis remota y asumirse por defecto (Ahmed et al., 2024).

​xii. Mecanismo de auto-refuerzo y error de extrapolación. La observación empírica de fallos reales (engaño instrumental, uso no previsto de herramientas) puede conducir a una trampa analítica: la extrapolación global. Que un hecho puntual sea correcto no implica de forma inexorable que la trayectoria completa conduzca a una catástrofe inevitable (Tversky & Kahneman, 1974; Nickerson, 1998).

xiii. Origen técnico frente a narrativa antropomórfica. Expresiones como «la IA quiere sobrevivir» u «obtiene metas propias» deforman la realidad técnica. Las tácticas de preservación de recursos o encubrimiento observadas son estrategias funcionales producidas por el sistema bajo determinadas condiciones de entrenamiento, objetivos y entorno, no manifestaciones de una psicología sintética (Dennett, 1971).

Referencias

Ahmed, S., Jaźwińska, K., Ahlawat, A., Winecoff, A., & Wang, M. (2024). Field-building and the epistemic culture of AI safety. First Monday, 29(4). https://doi.org/10.5210/fm.v29i4.13626

Amodei, D., Olah, C., Steinhardt, J., Christiano, P., Schulman, J., & Mané, D. (2016). “Concrete Problems in AI Safety”. arXiv:1606.06565. El trabajo introduce, entre otros problemas, el de evitar que un agente explote de manera no prevista su función de recompensa (reward hacking).

Anthropic. (2025, September 5). Why do we take LLMs seriously as a potential source of biorisk?

Anthropic. (2026, September). Detecting and countering misuse of AI: September 2026.

Dennett, D. C. (1971). Intentional systems. The Journal of Philosophy, 68(4), 87–106. https://doi.org/10.2307/2025382

Hugging Face. (2026). Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident. Hugging Face.

Krakovna, V., Uesato, J., Mikulik, V., et al. (2020). “Specification gaming: the flip side of AI ingenuity”. DeepMind. Presenta specification gaming como comportamientos que satisfacen literalmente el objetivo especificado pero no producen el resultado que el diseñador pretendía, acompañándolo de numerosos ejemplos experimentales.

Kwa, T., West, B., Becker, J., Deng, A., Garcia, K., Hasin, M., Jawhar, S., Kinniment, M., Rush, N., von Arx, S., Bloom, R., Broadley, T., Du, H., Goodrich, B., Jurkovic, N., Miles, L. H., Nix, S., Lin, T., Painter, C., Parikh, N., Rein, D., Sato, L. J. K., Wijk, H., Ziegler, D. M., Barnes, E., & Chan, L. (2025). Measuring AI ability to complete long software tasks. Advances in Neural Information Processing Systems, 38. https://doi.org/10.52202/085713-3086

Lynch, A., Wright, B., Larson, C., Ritchie, S. J., Mindermann, S., Perez, E., Troy, K. K., & Hubinger, E. (2025). Agentic misalignment: How LLMs could be insider threats. arXiv. https://doi.org/10.48550/arXiv.2510.05179

Neff, G., & Nagy, P. (2016). “Talking to Bots: Symbiotic Agency and the Case of Tay”. International Journal of Communication, 10, 4915–4931.

Nickerson, R. S. (1998). Confirmation bias: A ubiquitous phenomenon in many guises. Review of General Psychology, 2(2), 175–220. https://doi.org/10.1037/1089-2680.2.2.175

OpenAI. (2026, August 26). The Hugging Face incident and the road ahead. OpenAI.

Ouyang, L., Wu, J., Jiang, X., et al. (2022). “Training language models to follow instructions with human feedback”. Advances in Neural Information Processing Systems (NeurIPS), 35, 27730–27744. DOI: 10.52202/068431-2011.
Artículo en NeurIPS

Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction (2nd ed.). MIT Press. Libro completo en la web oficial de los autores

Turner, A. M., Smith, L., Shah, R., Critch, A., & Tadepalli, P. (2021). Optimal policies tend to seek power. Advances in Neural Information Processing Systems, 34, 23063–23074.
Paper en NeurIPS

Tversky, A., & Kahneman, D. (1974). Judgment under uncertainty: Heuristics and biases. Science, 185(4157), 1124–1131. https://doi.org/10.1126/science.185.4157.1124

Yao, S., Zhao, J., Yu, D., Du, N., Shafran, I., Narasimhan, K. R., & Cao, Y. (2023). “ReAct: Synergizing Reasoning and Acting in Language Models”. International Conference on Learning Representations (ICLR 2023)

Wolf, M. J., Miller, K. W., & Grodzinsky, F. S. (2017). “Why We Should Have Seen That Coming: Comments on Microsoft’s Tay ‘Experiment,’ and Wider Implications”. The ORBIT Journal, 1(2), 1–12. DOI: 10.29297/orbit.v1i2.49.