«¡De verdad creemos, sinceramente, que la IA podría acabar con todos los seres humanos! Personalmente, creo que la probabilidad es superior al 10 % durante la próxima década.» [1]
La frase fue escrita el 9 de septiembre de 2026 por Evan Hubinger, investigador principal de alineamiento de Anthropic, en respuesta a un tuit publicado horas antes por Jacob Coxon, exempleado de Anthropic y miembro de su equipo de investigación, en el que exponía sus preocupaciones sobre la seguridad de la inteligencia artificial. Ese mismo día se había hecho pública la dimisión de Coxon de Anthropic.
Aunque no es la primera vez, ni será la última, que se producen declaraciones de este tipo, en esta ocasión han desencadenado una respuesta sin precedentes en la opinión pública, los medios de comunicación y la industria. Tal fue el revuelo que, días después, Dario Amodei, CEO de Anthropic, anunció el compromiso de su compañía de «ralentizar el ritmo al que mejoramos las capacidades de los modelos de IA.» [2] Ese mismo día, Sam Altman se sumó a esta posición [3]. Tres semanas después, Trump propuso rebautizar el concepto de IA como «superinteligencia» e instó a las grandes compañías tecnológicas dedicadas a la IA a firmar el denominado Acuerdo sobre la Superinteligencia, orientado a sentar las bases para la autorregulación y la supervisión del desarrollo de los modelos de inteligencia artificial más avanzados. [4]
El episodio volvió a situar en primer plano el debate sobre los riesgos asociados a la inteligencia artificial. Por la repercusión que ha tenido, merece la pena detenerse a analizar la retórica con la que se comunican estos riesgos.
La principal tesis que defiendo es que una afirmación tan alarmante, formulada sin una fundamentación suficiente, constituye una falta de rigor y de responsabilidad profesional que debería ser inadmisible en la industria (véase más abajo la sección ¿Se puede estimar la extinción de la humanidad?). Existe un riesgo real de que la IA contribuya a provocar incidentes graves de ciberseguridad, pero un algoritmo fuera de control no equivale, por sí mismo, a una superinteligencia con capacidad para extinguir a la humanidad. Para tranquilidad de todos, existen voces autorizadas que cuestionan fuertemente que pueda describirse de forma concluyente un escenario en el que la IA constituya una amenaza de extinción para la humanidad [5]. En cualquiera de los escenarios más catastróficos el riesgo real requiere incorporar factores humanos y políticos, además de los técnicos. No pretendo restar importancia a estos riesgos, sino analizar las consecuencias que puede tener adoptar una comunicación hiperbólica para describirlos.
Antes de entrar en detalle, resumo las principales causas que nos han llevado a esta situación y las consecuencias inmediatas que está provocando.
Entre las causas:
i) La retórica catastrofista y la antropomorfización. La retórica catastrofista está fuertemente arraigada en el campo de la IA desde sus orígenes y ha influido de forma recurrente en la percepción pública de esta tecnología (más abajo desarrollo esta cuestión con mayor detalle en la sección Contexto catastrofista). En los últimos años, a esta retórica se ha sumado una creciente antropomorfización de los sistemas de IA, que favorece la percepción de que poseen características propias de sujetos conscientes.
Ambos fenómenos se refuerzan mutuamente. Tendemos de manera natural a atribuir características humanas a otras entidades, animadas o inanimadas, y los sistemas actuales de IA facilitan especialmente esta proyección. El problema surge cuando se confunden propiedades distintas: autonomía no implica conciencia; que un sistema sea capaz de actuar de forma autónoma no significa que posea voluntad, intención o experiencia subjetiva propias.
Parte de la percepción actual de la IA puede explicarse por esta tendencia y por la consiguiente exageración de las capacidades y propiedades de los algoritmos, hasta llegar a sostener que existen sistemas de IA que ya son conscientes. Como ha recordado Mustafá Suleyman [6], CEO de Microsoft AI, y cofundador de DeepMind: «Las IA no tienen derechos, sentimientos ni conciencia. Y no debemos entrenarlas para que actúen como si los tuvieran».
ii) La antropomorfización promovida desde la industria. El problema anterior se acrecienta cuando esta percepción es favorecida por quienes diseñan, entrenan y comercializan estos sistemas. Determinados laboratorios han contribuido a difuminar la frontera entre la simulación de rasgos humanos y la atribución efectiva de propiedades como conciencia, sentimientos, intereses propios o estatus moral.
Anthropic constituye un caso especialmente relevante. La compañía ha mantenido una posición particularmente ambigua y se ha mostrado más receptiva que otros actores a determinadas tesis controvertidas sobre la posible condición moral de los sistemas de IA. El propio Suleyman advierte de que algunas de las prácticas de alineamiento de Anthropic pueden contribuir a reforzar esta antropomorfización [7].
Esta perspectiva tampoco se limita al diseño de los modelos. Joe Carlsmith, filósofo en plantilla de Anthropic, ha abordado cuestiones relacionadas con el «bienestar» y los posibles derechos de las IA [8]. Más significativo aún resulta el intento de trasladar este debate fuera del ámbito estrictamente tecnológico. Según una información reciente de The New York Times, Chris Olah, cofundador de Anthropic, tuvo acceso a la encíclica Magnifitas Humanitas [9] antes de su publicación y trató de que el Vaticano reconsiderara la posibilidad de que una IA pudiera poseer conciencia y, por tanto, algún tipo de estatus moral [10].
iii) Los incentivos comerciales. Las inversiones que sustentan el desarrollo de la IA empujan a los laboratorios de frontera a utilizar narrativas que pueden contribuir a revalorizar sus productos y reforzar la percepción de su excepcionalidad. Como señala Carmody Grey en una entrevista publicada en El País [11], las preguntas que plantean estas empresas invitan a dirigir nuestra atención hacia el producto y no necesariamente hacia las externalidades que genera.
La crítica principal es que concentrarse en escenarios extremos, como la superinteligencia o la extinción, puede desviar la atención de problemas actuales y verificables, como los ciberataques, el consumo de recursos, los efectos cognitivos, el impacto sobre la educación o la generación masiva de contenidos de baja calidad. Paradójicamente, una consecuencia tan extraordinaria y terrible como la extinción de la humanidad puede terminar concentrando la atención en la supuesta potencia del producto antes que en los problemas concretos derivados de su utilización.
Entre las consecuencias de la retórica existencial pueden señalarse las siguientes:
i) Alarma social. Una cosa es advertir de los riesgos asociados a una tecnología y otra generar ansiedad y preocupación sin una contextualización adecuada. La comunicación del riesgo debería distinguir entre escenarios posibles, escenarios plausibles y escenarios altamente especulativos. Además, resulta difícil de conciliar que algunas de las mismas personas que advierten de que esta tecnología podría acabar con la humanidad participen, al mismo tiempo, en su desarrollo acelerado. Esta contradicción aparente exige, como mínimo, una explicación pública mucho más rigurosa.
ii) Desplazamiento de responsabilidades. La narrativa de una IA «rebelde» puede contribuir a desplazar la responsabilidad desde quienes desarrollan y utilizan estos sistemas hacia la propia tecnología. Lo hemos visto en el incidente ocurrido durante el verano, cuando Hugging Face sufrió un ciberataque relacionado con agentes de IA de OpenAI. Un entorno deficientemente securizado y una operación inadecuada fueron condiciones necesarias para que esos agentes pudieran vulnerar la seguridad de Hugging Face [12].
En términos generales, los daños potenciales dependen, en buena medida, de cómo las personas diseñan, entrenan, conectan y despliegan estos sistemas, así como de los incentivos comerciales, políticos y regulatorios que condicionan su desarrollo. En un incendio, la responsabilidad por sus consecuencias no recae en el fuego ni en la vegetación, sino en las decisiones y condiciones que han permitido que se origine y se propague. De forma análoga, presentar la IA como una fuerza inevitable e incontrolable puede permitir a las empresas tecnológicas adoptar el papel de meros «gestores» de una transformación igualmente inevitable, reduciendo así la percepción de su responsabilidad sobre los daños concretos causados por sus productos.
Frente a esta posibilidad, Huang, CEO de Nvidia [13], ha llegado a sostener que, si OpenAI, Anthropic y otros laboratorios no pueden garantizar que sus experimentos de IA permanezcan bajo control, habría que plantearse cerrarlos.
iii) Cambios en el debate político y regulatorio. En pocos días, el debate pasó de plantear la necesidad de ralentizar el desarrollo de la IA a promover mecanismos de autorregulación y supervisión. Este giro habría resultado especialmente relevante si se hubiera integrado en él el marco regulatorio ya existente en la Unión Europea. El Reglamento de Inteligencia Artificial (RIA) incluye disposiciones específicas relativas a la supervisión y la gobernanza de los modelos de propósito general que pueden presentar riesgos sistémicos, y contempla mecanismos de evaluación y supervisión de estos sistemas [14].
Como muestra este episodio, la forma de comunicar los riesgos tecnológicos puede influir de manera decisiva en el debate público y, a través de él, en las respuestas políticas y regulatorias. Precisamente por eso, cuanto mayor sea la gravedad del riesgo que se pretende comunicar, mayor debería ser también la exigencia de rigor: distinguir entre evidencia y especulación, explicitar los supuestos en los que se apoyan las estimaciones y evitar que una hipótesis extrema se presente ante la opinión pública con un grado de certeza que la evidencia disponible no permite sostener.
Contexto catastrofista
Hay que recordar que la historia reciente está llena de predicciones sobre amenazas capaces de provocar la destrucción de la humanidad: desde los ataques químicos desde el aire tras la Primera Guerra Mundial hasta el holocausto nuclear, pasando por las armas de destrucción masiva tras el 11-S o la hipótesis de la «materia gris» asociada a la nanotecnología. Como señala John Mueller en su análisis sobre la persistencia del «alarmismo cósmico», este patrón tiene una larga tradición [15].
Es importante tener presente que este tipo de retórica ha acompañado a la IA desde sus inicios y que existe una cultura compartida dentro del área en la que se adoptan sin reparo declaraciones grandilocuentes, provocadoras, descuidadas, excesivas o confusas. Cuatro ejemplos:
Isaac Asimov, en 1973, el mayor divulgador científico del siglo XX, al ser preguntado por si los ordenadores podían pensar, señalaba que «puede que llegue el día en que tengamos que hacernos humildemente a un lado y dejar las cosas en manos de quien las sepa llevar mejor. Y si no nos hacemos a un lado, es posible que llegue el Supercomputador y nos aparte por las malas.» [16]
Marvin Minsky (en Darrach 1970), pionero incuestionable de la IA, declaró que la siguiente generación de ordenadores sería tan inteligente que «tendremos suerte si están dispuestos a mantenernos en casa como mascotas domésticas.» [17]
Más recientemente, y de forma aún más rotunda, Stephen Hawking declaraba a la BBC News (2014) que «el desarrollo de una inteligencia artificial completa podría suponer el fin de la humanidad.» [18]
El último, Geoffrey Hinton, premio Nobel y «padrino de la IA», estimó en 2024 que hay entre «un 10 % y un 20 %» de probabilidad que la IA lleve a la extinción humana en las próximas tres décadas. [19]
¿Cómo hemos llegado a este punto?
Existe una hipótesis según la cual es solo cuestión de tiempo que se consiga diseñar el hardware y los programas adecuados para reproducir capacidades equivalentes a las de los cerebros y las mentes humanas [20]. Esta hipótesis es legítima y tiene un amplio predicamento en el área de la IA y disciplinas afines. Nótese que esta afirmación constituye, en último término, una hipótesis filosófica y científica abierta, para la que no existe una demostración concluyente, y que es cuestionada por distintas corrientes que sostienen que la mente humana no puede reducirse o reproducirse mediante sistemas digitales [21].
El punto verdaderamente problemático aparece con una derivada de esta primera hipótesis. Si asumimos que es posible construir una inteligencia artificial equivalente a la humana, se plantea una segunda tesis: que el desarrollo de estas capacidades conduciría inevitablemente a un punto de no retorno, la denominada singularidad [22], a partir del cual emergería una inteligencia artificial cualitativamente superior a la humana: una «superinteligencia». Esta afirmación es pura especulación sin ningún fundamento.
A partir de aquí pueden distinguirse, de manera esquemática, dos grandes narrativas:
- Una visión tecno-optimista. El desarrollo de la inteligencia artificial conducirá progresivamente a una expansión radical de las capacidades cognitivas humanas. La Singularidad no debe entenderse simplemente como la aparición de una superinteligencia que sustituye al ser humano, sino como un proceso de convergencia y fusión entre inteligencia biológica y no biológica, mediante tecnologías que permitirán ampliar la inteligencia, superar las limitaciones biológicas y prolongar radicalmente la vida. Esta visión ha sido liderada por investigadores como Ray Kurzweil y constituye la base de tesis transhumanistas según las cuales la inteligencia futura será en gran medida no biológica, aunque continuará formando parte de una civilización esencialmente humana [23].
- Una visión tecno-pesimista. Una superinteligencia podría adquirir capacidades muy superiores a las humanas y perseguir objetivos incompatibles con nuestros intereses, incluso sin albergar intenciones hostiles. El problema central sería, por tanto, cómo mantener el control y alinear sus objetivos con los valores humanos antes de alcanzar ese nivel de inteligencia, puesto que una pérdida de control podría tener consecuencias existenciales. Esta tesis queda recogida en la obra del filósofo Bostrom [24].
Como podemos comprobar, en la actualidad ha sido esta segunda visión la que ha acaparado buena parte del debate público. Lo más preocupante es cómo esta segunda visión también ha permeado profundamente en el ecosistema tecnológico de Silicon Valley gracias a la figura de Elieze Yudkowsky [25], el cual transitó del optimismo tecnológico al temor por la superinteligencia. Cal Newport [26] señala cómo sus ideas han tenido una influencia importante en el ecosistema tecnológico de Silicon Valley, incluido el entorno de OpenAI, DeepMind y Anthropic. Newport defiende que esta genealogía sirve para interpretar el lenguaje de dirigentes como Sam Altman y Dario Amodei, cuando presentan frecuentemente la IA como una tecnología capaz de transformar radicalmente la humanidad y potencialmente generar riesgos extremos.
Existe un sesgo recurrente, influenciado por la cultura y las visiones de Bostrom y Yudkowsky, que consiste en pasar de hablar de un riesgo a considerarlo existencial sin justificar adecuadamente ese salto. La retórica apocalíptica de ciertos líderes de la IA puede entenderse mejor como una herencia cultural e intelectual que como una descripción objetiva de un peligro inminente.
En la siguiente sección analizaremos cómo estas ideas se trasladan al lenguaje de la probabilidad, dando lugar a estimaciones sobre la posibilidad de extinción humana y, en particular, al concepto de P(doom).
¿Se puede estimar la extinción de la humanidad?
La afirmación de Hubinger con la que abrimos el artículo se encuadra dentro de lo que en el argot de X se conoce como P(doom), abreviatura de probability of doom, esto es, la estimación probabilística de la extinción de la humanidad provocada por la pérdida de control de la inteligencia artificial. Es aquí donde la retórica sobre el riesgo existencial que hemos analizado adquiere una expresión aparentemente cuantitativa. Este tipo de estimaciones se pueden entender como un producto cultural dentro de la comunidad que se dedica a la seguridad y alineamiento de la IA, muy influida por las ideas expuestas en el apartado anterior [27].
El problema fundamental es que estas cifras pueden presentar una apariencia de precisión que no se corresponde con la evidencia disponible. Volviendo al ejemplo de Hubinger, el 10 % se debe entender como una estimación subjetiva. No significa que haya calculado que existe un 10 % de posibilidades de que la IA provoque la extinción humana, ni que exista un modelo estadístico que produzca ese resultado, ni que se haya planteado los posibles escenarios hipotéticos y haya estimado la probabilidad en cada caso. Es, simplemente, una manera de expresar un sentimiento sin ninguna evidencia que la respalde. Así, una afirmación extremadamente especulativa basada en un estado emocional adquiere una apariencia de precisión extraordinaria al expresarse mediante un porcentaje y un horizonte temporal concretos.
El segundo problema es que estas estimaciones no pueden comprobarse ni falsarse. Estamos ante un acontecimiento para el que prácticamente no existe evidencia empírica comparable, con lo que no es posible establecer un procedimiento que permita asignar una probabilidad cuantitativa. Las probabilidades no poseen autoridad por sí mismas sino que adquieren legitimidad porque proceden de algún método fundamentado. En consecuencia, lanzar este tipo de afirmaciones «sale gratis» ya que quedan fuera de cualquier mecanismo de validación. El problema aparece cuando estas cifras pasan al debate público y se utilizan para justificar decisiones supuestamente informadas científicamente, pese a que las predicciones en las que se basan son demasiado poco fiables para cumplir esa función y pueden resultar engañosas.
Narayanan y Kapoor distinguen que existen tres maneras de fundamentar una predicción: inductiva, deductiva y subjetiva [28]. Cada una de ellas requiere una justificación sólida que respalde la probabilidad obtenida. En el caso de las P(doom) no se puede aplicar ninguna de las tres para llegar a una estimación creíble. La tercera de las formas es la que se utiliza cuando encontramos en los medios afirmaciones similares a la de Hubinger. Las estimaciones subjetivas, en sí mismas, pueden ser legítimas [29]. Pero requieren evaluar la fiabilidad del pronosticador, cómo de buenas han sido sus predicciones en el pasado. En el caso del riesgo existencial de la IA no existe esa posibilidad. No disponemos de una serie de acontecimientos anteriores que permita comprobar retrospectivamente si un pronosticador ha sido sistemáticamente bueno estimando la probabilidad de extinción humana causada por una IA.
En general, la experiencia profesional tampoco constituye una garantía de precisión predictiva cuando se trata de eventos extremadamente raros. Esto no significa que sus opiniones carezcan de interés, sino que su autoridad profesional no convierte automáticamente sus estimaciones subjetivas en predicciones cuantitativas fiables en todos los contextos. Narayanan y Kapoor muestran ejemplos que esto también les afecta a los llamados superforecasters, pronosticadores que tienen un rendimiento muy por encima de la media. Cuando estos superpronosticadores se enfrentan a predicciones sobre eventos que son extremadamente raros, su fiabilidad baja al mismo nivel que el resto. El problema tampoco se resuelve aumentando el número de los expertos que realizan la estimación [30]. Concluyen ambos autores que en estos casos «lo que parece estar ocurriendo es que las intuiciones y temores vagos de los expertos se están traduciendo en cifras pseudo-precisas y, posteriormente, esas cifras vuelven a traducirse en intuiciones y temores vagos por parte de los responsables políticos».
Desafortunadamente, la comunicación pública tiende a prestar mucha más atención a la magnitud de la consecuencia que a la solidez de la estimación que pretende cuantificarla. Parece que cuanto mayor es la magnitud de la consecuencia, menos información necesitamos para que el escenario domine la conversación pública. Un riesgo del 0,1 % de extinción y un riesgo del 10 % presentan una diferencia cuantitativa enorme, sin embargo quedan eclipsados por la narrativa de la desaparición de la humanidad.
En mi opinión, comunicar públicamente estas estimaciones de esta manera es una irresponsabilidad por las consecuencias que puede tener sobre la opinión pública y la toma de decisiones políticas. Una intuición o un temor sobre un escenario extremo se convierte en una cifra aparentemente precisa y termina circulando como si tuviera una fundamentación científica. Este modo de comunicación entra en conflicto con los principios de los códigos deontológicos de la profesión. La industria debe asumir una mayor responsabilidad en la formulación y comunicación de estas estimaciones y los medios de comunicación deben ejercer una mayor fiscalización sobre ellas.
Imaginemos que un físico afirmara que existe un 10 % de probabilidad de que un meteorito provoque la extinción de la humanidad durante la próxima década. La primera exigencia de los medios sería conocer qué evidencia sustenta ese porcentaje, qué método se ha utilizado para calcularlo y qué grado de incertidumbre presenta. La condición de experto no sería suficiente para aceptar la cifra. Esa misma exigencia debe aplicarse a las estimaciones sobre la extinción causada por la inteligencia artificial. Cuando las consecuencias de una afirmación son de esta magnitud, la exigencia de justificación debe ser proporcional a la afirmación realizada.
— NOTAS —
[1] Evan Hubinger en X: “Jacob is correct here—we really do earnestly believe AI could kill all humans! I personally think it is >10% within the next decade. I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to.” | https://x.com/EvanHub/status/2097497037956891126
[2] Dario Amodei en X: “We Must Pace the Frontier: I’ve written a new essay on why the AI industry should slow down, with a three-part plan for doing so. Anthropic is unilaterally committing to the first of these steps. We’ll provide third-party evaluators with permanent, employee-level access to our” | https://x.com/DarioAmodei/status/2098773920774074715
[3] Sam Altman en X: “I agree with Dario that we need to pace the frontier. This has been a primary topic of discussions we’ve had at OpenAI in recent weeks. Committing to having independent evaluators with employee-like access is a great idea, and we will do the same. We’ll have more to share soon.” | https://x.com/sama/status/2098811563415150910
[4] The White House en X: “White House Accord on Super Intelligence https://t.co/NVNkHmLcbk” | https://x.com/WhiteHouse/status/2105292669303791687
[5] Allá por los años sesenta, Wiener anticipó el problema de alineación al advertir que una máquina autónoma puede perseguir un objetivo de forma literal pero no necesariamente de acuerdo con las intenciones de sus diseñadores, especialmente cuando actúa demasiado rápido para que los humanos puedan intervenir. En Wiener, N. (1960). Some moral and technical consequences of automation. Science, 131(3410), 1355–1358. https://doi.org/10.1126/science.131.3410.1355
Podemos visualizar este riesgo en los sistemas IA actuales. Ahora bien, hay un trecho prácticamente infinito de largo entre una IA descontrolada y la extinción de la humanidad.
En Vermeer, M. J. D. (2025, 6 de mayo). Could AI really kill off humans? Scientific American. https://www.scientificamerican.com/article/could-ai-really-kill-off-humans/ expone que «incluso si la IA adquiriera de algún modo la capacidad de lanzar todas las más de 12.000 ojivas del arsenal nuclear mundial de nueve países, las explosiones, la lluvia radiactiva y el consiguiente invierno nuclear probablemente seguirían sin llegar a provocar un evento de nivel de extinción.»
Según Heidy Khlaaf, los modelos de IA son sistemas probabilísticos que carecen de una comprensión similar a la humana y pueden alcanzar sus objetivos mediante estrategias impredecibles. Por ello, algunos investigadores consideran más preocupante que la falta de controles y supervisión adecuados provoque daños concretos e inmediatos, antes que los hipotéticos riesgos existenciales a largo plazo. En: Gibney, E. (2026, 22 de septiembre). Will AI really kill us all? The science behind the hype. Nature. https://doi.org/10.1038/d41586-026-02941-3
En este mismo artículo de Nature, de nuevo Vermeer señala que muchos de los investigadores preocupados por el riesgo existencial «simplemente dan por sentado que, una vez que lleguemos a ese punto [la singularidad], lo demás son detalles; […] esto implica tantas afirmaciones que no pueden ser comprobadas que al final la conversación se parece más a una cuestión de fe que a algo científico o empírico.»
En Vermeer, M. J. D., Lathrop, E., & Moon, A. (2025). On the extinction risk from artificial intelligence. RAND Corporation. https://www.rand.org/pubs/research_reports/RRA3034-1.html
La RAND Corporation concluyó que, en el estado actual, la IA no puede provocar el uso de armas nucleares debido a las estrictas salvaguardas de sus sistemas de mando y control. En este estudio se analizan escenarios relacionados con armas nucleares, patógenos biológicos y modificaciones deliberadas de la atmósfera, y se concluye que la extinción mediante armas nucleares no es plausible, mientras que los otros dos escenarios no pueden descartarse por completo. Sin embargo, todos ellos requerirían que la IA adquiriese una considerable capacidad para interactuar con sistemas físicos y realizar acciones prolongadas, muchas de las cuales podrían ser detectadas y contrarrestadas por seres humanos.
En Kelly, K. (2017, 4 de abril). The myth of a superhuman AI. WIRED. https://www.wired.com/2017/04/the-myth-of-a-superhuman-ai/ presenta hasta cinco mitos sobre la superinteligencia para desmontar el relato de que este se va a apoderar del mundo.
En Bray, C. (2026, 15 de septiembre). Could AI really wipe out humanity – six experts spell out the risks. The Guardian https://www.theguardian.com/technology/2026/sep/15/could-ai-really-wipe-out-humanity-and-hijack-the-internet
El catedrático Alan Woodward sostiene que la IA no actuaría por iniciativa propia: el riesgo depende de cómo los humanos utilicen estas herramientas.
Recientemente, y en respuesta a toda la polémica, se han unido voces como Steven Pinker (2026, 26 de septiembre). An open letter to Scott Alexander. Quillette. https://quillette.com/2026/09/26/an-open-letter-to-scott-alexander-steven-pinker-ai-alignment-safety/
De manera similar, el rechazo a una extinción de la humanidad por la IA ha sido formulado recientemente por numerosos expertos, entre ellos Blaise Agüera y Arcas, Jerry Kaplan, Gary Marcus, Melanie Mitchell, Yan LeCunn y Andrew Ng.
Finalmente, me parece pertinente incluir este artículo de Maarten Boudry donde sostiene que estamos proyectando sobre las IA nuestros propios instintos evolutivos y que la inteligencia por sí sola no implica deseo de supervivencia, poder o dominación. En Boudry, M. (2026, 25 de marzo). Why HAL 9000 feared death (and real AIs don’t): How we project animal instincts onto silicon minds. Substack. https://maartenboudry.substack.com/p/why-hal-9000-feared-death-and-real
[6] Suleyman, M. (2026, 16 de septiembre). A warning about ‘model welfare’. https://mustafa-suleyman.ai/a-warning-about-model-welfare
[7] Anthropic. (2026). Claude’s constitution. https://www.anthropic.com/constitution
La Constitución de Claude es un documento de Anthropic que establece los principios y valores que deben guiar el comportamiento de Claude, sirviendo como marco para entrenar al modelo para que sea útil, seguro y coherente con determinadas normas.
En Suleyman, M. (2026). A taxonomy of the assumptions and claims in Claude’s constitution, mapped against its language [PDF]. https://mustafa-suleyman.ai/ModelWelfare_Taxonomy.pdf
Mustafa Suleyman clasifica y analiza críticamente los supuestos y afirmaciones sobre el posible bienestar de los modelos de IA que aparecen en la Constitución de Claude, relacionándolos con el lenguaje utilizado en ella.
[8] ‘Suicidal Compassion’: Meet the Anthropic Officials Who Think AI Might Be Justified in Going Rogue Against the Humans Enslaving It | Joe Carlsmith https://freebeacon.com/america/suicidal-compassion-meet-the-anthropic-officials-who-think-ai-might-be-justified-in-going-rogue-against-the-humans-enslaving-it/
[9] Carta Encíclica de Su Santidad León XIV Magnifica Humanitas (15 de mayo de 2026) | https://www.vatican.va/content/leo-xiv/es/encyclicals/documents/20260515-magnifica-humanitas.html
El párrafo que generó la controversia con Anthropic fue:
«[L]as denominadas inteligencias artificiales no viven una experiencia, no poseen un cuerpo, no pasan por la alegría y el dolor, no maduran en las relaciones ni conocen desde dentro lo que significan el amor, el trabajo, la amistad y la responsabilidad. Tampoco tienen una conciencia moral: no juzgan el bien y el mal, no captan el sentido último de las situaciones ni asumen el peso de las consecuencias.»
[10] Is Claude Conscious? Inside Anthropic’s Quest to Instill Morality Into Its A.I. Models – The New York Times | https://www.nytimes.com/2026/09/29/us/anthropic-claude-morals-ai.html
[11] Carmody Grey, la filósofa que dijo no a Anthropic: “Cada vez estamos más solos y somos más tontos” | Tecnología | EL PAÍS https://elpais.com/tecnologia/2026-08-26/carmody-grey-la-filosofa-que-dijo-no-a-anthropic-cada-vez-estamos-mas-solos-y-somos-mas-tontos.html
[12] Horatau, M. (2026, 31 de agosto). The Hugging Face incident is not an AI story. Uphack.io. https://uphack.io/blog/post/the-hugging-face-incident-is-not-an-ai-story/
Muller, J. (2026, 26 de agosto). OpenAI saw warning signs weeks before Hugging Face breach. Axios. https://www.axios.com/2026/08/26/openai-hugging-face-technical-report-ai-hack
Goodin, D. (2026, 27 de agosto). How OpenAI let a mob of LLM agents game a test and ransack Hugging Face. Ars Technica. https://arstechnica.com/security/2026/08/how-openai-let-a-mob-of-llm-agents-game-a-test-and-ransack-hugging-face/
Siddik, A. B. (2026). Cyber-capable AI agents: Vulnerabilities, evaluation containment, and defensive response. arXiv. https://doi.org/10.48550/arXiv.2607.25379
[13] Jensen Huang Thinks A.I. Alarmism Has Gone Too Far – The New York Times | https://www.nytimes.com/2026/09/23/opinion/ezra-klein-podcast-jensen-huang.html
[14] Parlamento Europeo y Consejo de la Unión Europea. (2024). Reglamento (UE) 2024/1689 del Parlamento Europeo y del Consejo, de 13 de junio de 2024, por el que se establecen normas armonizadas en materia de inteligencia artificial (Reglamento de Inteligencia Artificial). Diario Oficial de la Unión Europea. https://eur-lex.europa.eu/eli/reg/2024/1689
[15] Mueller, J. (2026, 18 de septiembre). Artificial intelligence and the persistent survival of cosmic alarmism. Substack.
https://muellerbbbb.substack.com/p/artificial-intelligence-and-the-persistent
[16] Asimov, I. (1973). Please explain (M. Á. Paredes Larrucea, Trad.). Biblioteca Sol.
[17] Darrach, B. (1970, November 20). Meet Shaky, the first electronic person: The fascinating and fearsome reality of a machine with a mind of its own. LIFE, 69(21), 58B–68B.
https://gwern.net/doc/reinforcement-learning/robot/1970-darrach.pdf
[18] BBC News. (2014, December 2). Stephen Hawking warns artificial intelligence could end mankind. https://www.bbc.com/news/technology-30290540
[19] ‘Godfather of AI’ shortens odds of the technology wiping out humanity over next 30 years | AI (artificial intelligence) | The Guardian | https://www.theguardian.com/technology/2024/dec/27/godfather-of-ai-raises-odds-of-the-technology-wiping-out-humanity-over-next-30-years
Anteriormente, había declarado que había un 10 % de probabilidades de que la tecnología fuera el detonante de una catástrofe para la humanidad. Las declaraciones públicas de Geoffrey Hinton requieren un estudio separado tanto desde una perspectiva psicológica como sociológica
[20] Dennett, D. C. (1991). Consciousness explained. Little, Brown and Company. https://books.google.com/books?id=gpncAAAAIAAJ Incluyo esta referencia como uno de los ejemplos paradigmáticos del funcionalismo, aunque no es el único. El test de Turing (1950) es quizás el ejemplo más conocido. Herbert Simon (1965) afirmaba que ya era posible escribir programas para ordenadores electrónicos que les permitieran «pensar y aprender», y John McCarthy (1976) proponía que era lícito y útil hablar de que una máquina poseía «creencias» para describir su organización y comportamiento, y ponía como ejemplo el termostato.
Turing, A. M. (1950). Computing machinery and intelligence. Mind, 59(236), 433–460. https://doi.org/10.1093/mind/LIX.236.433
Simon, H. A. (1965). The shape of automation for men and management. Harper & Row.
McCarthy, J. (1979). Ascribing mental qualities to machines. In M. Ringle (Ed.), Philosophical perspectives in artificial intelligence (pp. 161–195). Harvester Press.
http://jmc.stanford.edu/articles/ascribing/ascribing.pdf
[21] Searle, J. R. (1980). Minds, brains, and programs. Behavioral and Brain Sciences, 3(3), 417–457. https://doi.org/10.1017/S0140525X00005756 De la misma manera este texto es uno de los muchos que critican al funcionalismo.
[22] Hay que tener en cuenta que la singularidad no exige que haya una sola IA que supere determinado umbral. Lo cual no es óbice para que en la imaginación popular este umbral se cruce con una única superinteligencia.
[23] Kurzweil, R. (1990). The age of intelligent machines. MIT Press. https://archive.org/details/ageofintelligent00kurz
y más recientemente:
Kurzweil, R. (2024). The singularity is nearer: When we merge with AI. Viking.
Kurzweil bebe de la obra de Moravec, H. P. (1988). Mind children: The future of robot and human intelligence. Harvard University Press. https://books.google.com/books?id=56mb7XuSx3QC
[24] Bostrom, N. (2014). Superintelligence: Paths, dangers, strategies. Oxford University Press.
[25] Eliezer Yudkowsky and Nate Soares (2025) If Anyone Builds It, Everyone Dies: Why Superhuman AI Would Kill Us All
[26] Newport, C. (2026, 5 de septiembre). How scared should we be of A.I. right now? The New York Times. https://www.nytimes.com/2026/09/05/opinion/ai-silicon-valley.html
[27] Lex Fridman en X: “Here’s my conversation with Roman Yampolskiy (@romanyam), AI safety researcher who believes that the chance of AGI eventually destroying human civilization is 99.9999%. I will continue to chat with many AI researchers & engineers, most of whom put p(doom) at <20%, but it’s but it’s important to balance those technical conversations by understanding the long-term existential risks of AI. This was a terrifying and fascinating discussion.” | https://x.com/lexfridman/status/1797383905034514684?s=20
Esta entrevista de Lex Fridman es un ejemplo del tipo de razonamientos y tesis que se sostienen en torno a P(doom). El número de referencias en X y en Internet es inagotable.
[28] Narayanan, A., & Kapoor, S. (2024, 26 de julio). AI existential risk probabilities are too unreliable to inform policy. AI as Normal Technology. https://www.normaltech.ai/p/ai-existential-risk-probabilities
[29] La estadística bayesiana es una rama muy potente de la estadística que permite trabajar con estimaciones objetivas. Escribí una introducción donde se compara con la estadística frecuentista que es la que habitualmente nos enseñan desde primaria. Probabilidad: frecuentista versus bayesiana – Pablo Haya | https://pablohaya.com/2024/04/01/probabilidad-frecuentista-versus-bayesiana/
[30] Narayanan y Kapoor también tratan este tema en el artículo antes referenciado. No importa que sean un número elevado, los expertos son superados frecuentemente por modelos estadísticos más sencillos. Esta limitación es tan conocida que, por ejemplo, en una reciente encuesta de 2024 a 1.580 investigadores, se incluye en el propio artículo referencias que sostienen la evidencia del bajo rendimiento de los expertos como pronosticadores. En Grace, K., Simonelli, J., Weinstein-Raun, B., Krueger, D., Young, N., Duffy, T., Adamczewski, T., Reeve, J., & Beck, A. (2026). Advanced AI according to 1,580 researchers: Uncertain, unsafe, and sooner than we thought. AI Impacts. https://aiimpacts.org/wp-content/uploads/2026/09/ESPAI2024.pdf
Los artículos citados en el anterior estudio dentro de la sección de Limitaciones:
Philip E. Tetlock. Expert Political Judgment: How Good Is It? How Can We Know? Princeton University Press, revised edition, 2017. doi: 10.2307/j.ctt1pk86s8. URL https://www.jstor.org/stable/j.ctt1pk86s8. Originally published in 2005.
Colin F. Camerer and Eric J. Johnson. The process-performance paradox in expert judgment: How can experts know so much and predict so badly? In K. Anders Ericsson and Jacqui Smith, editors, Toward a General Theory of Expertise: Prospects and Limits, pages 195–217. Cambridge University Press, New York, 1991. URL https://authors.library.caltech.edu/records/qrp4n-9az74.
Itzhak Ben-David, John R. Graham, and Campbell R. Harvey. Managerial miscalibration. The Quarterly Journal of Economics, 128(4):1547–1584, 2013. doi: 10.1093/qje/qjt023. URL https: //doi.org/10.1093/qje/qjt023.
