La cifra del 10% ha recorrido redes sociales en los últimos días con la fuerza de un aviso inquietante: es la probabilidad que Evan Hubinger, responsable de estrategia de alineamiento en Anthropic, asigna a que la inteligencia artificial conduzca a la extinción de la humanidad en la próxima década. El dato tomó aún más peso cuando Jacob Coxon, compañero suyo en la empresa, anunció su renuncia pública denunciando que el sector está “jugando con nuestras vidas”, aunque ese porcentaje, por sí solo, no posee base experimental ni medición contrastada: es una estimación subjetiva, un intento de poner cifras a la incertidumbre, y podría ser igualmente 0% o 90%, porque de momento no existe evidencia concluyente que valide ninguna de las opciones. Hubinger mismo aclara que no teme tanto a los sistemas que ya existen, sino a lo que podría surgir más adelante: una superinteligencia capaz de automejorarse de forma recursiva, es decir, de diseñar versiones más potentes de sí misma a una velocidad que escape al control humano. Para Coxon, los próximos uno o dos años serán el punto de inflexión, y ha pedido que empresas como OpenAI y Anthropic frenen la carrera, algo que se antoja extraordinariamente difícil cuando la propia IA se emplea ya para acelerar la investigación y el desarrollo de mejores sistemas.
Los expertos suelen agrupar los escenarios de riesgo extremo en dos grandes bloques, según ha recogido el diario The Wall Street Journal. El primero es el más conocido por la ficción: la pérdida total de control sobre un sistema mucho más capaz que nosotros, que persiga objetivos incompatibles con la supervivencia humana y cuente con la autonomía y los recursos suficientes para impedir que lo detengamos. El segundo resulta menos espectacular pero igual de grave: que la humanidad mantenga el control, pero que personas o grupos lo utilicen para fines destructivos, desde la creación de agentes patógenos letales mediante diseño asistido por IA hasta ciberataques masivos o el colapso de infraestructuras esenciales para la vida colectiva. Para que el escenario de extinción al que se refiere Hubinger llegara a producirse, tendrían que encadenarse varios acontecimientos de forma consecutiva: la creación de sistemas netamente superiores a la inteligencia humana, su capacidad para acelerar el diseño de generaciones sucesivas de forma exponencial, que esa evolución se desvincule de la supervisión humana y que no exista mecanismo alguno para frenarla cuando se detecte el peligro. La cifra conocida como p(doom) no es un dato medido, sino una valoración personal que refleja la inquietud de quienes trabajan en primera línea, y su verdadero valor no está tanto en el número como en el hecho de que venga de quienes conocen mejor el interior de esos sistemas.
El peso de estas advertencias reside precisamente en quién las formula: Hubinger dirige el área encargada de que los modelos de Anthropic actúen siempre en beneficio de las personas, y Coxon ha renunciado incluso a sus beneficios económicos en la empresa para expresar su alarma, lo que refuerza la sinceridad de su mensaje, aunque no lo convierte en una predicción demostrada. En declaraciones a la revista Wired, Coxon reconoce que Anthropic se encuentra entre las empresas más cuidadosas en materia de seguridad y que no ha detectado recortes de recursos en alineamiento dentro de la suya, pero su temor radica en los competidores: si OpenAI, laboratorios chinos u otros actores avanzan más rápido y relajan esas precauciones, todo el esfuerzo de una sola compañía puede resultar insuficiente. Es el clásico dilema del prisionero aplicado a la tecnología: incluso quien quisiera reducir la marcha se ve empujado a continuar si cree que los demás no harán lo mismo, porque quedarse atrás se percibe como un riesgo mayor que avanzar con cautela.
La dimensión internacional añade otra capa de complejidad. En China también existe una comunidad creciente de investigadores que analizan los riesgos de la automejora y la pérdida de control, como refleja el informe State of AI Safety in China 2026, y figuras destacadas como el científico Andrew Yao trabajan en estrategias de gobernanza, aunque la comunicación pública de estas preocupaciones es muy distinta a la que se observa en Silicon Valley: los responsables de empresas como DeepSeek o Moonshot rara vez hablan abiertamente de escenarios de extinción. Coxon señala que un acuerdo bilateral entre OpenAI y Anthropic sería solo el primer paso, y que lo verdaderamente necesario es un marco global que incluya a China, con mecanismos semejantes a los que rigen materiales nucleares para limitar y supervisar el uso de la capacidad de cómputo más avanzada. Precisamente en este contexto, Estados Unidos y China han anunciado que celebrarán en los próximos días sus primeras conversaciones dedicadas exclusivamente a la seguridad de la inteligencia artificial.
Ante tanta incertidumbre inevitable surge la pregunta: si los riesgos son tan profundos, ¿por qué no detener el desarrollo por completo? La respuesta que dan los propios expertos es que ven también el otro lado de la balanza: la IA podría acelerar curas, revolucionar la ciencia, mejorar la educación y abrir perspectivas de bienestar sin precedentes. Existe además la convicción de que si la superinteligencia es posible, alguien la creará tarde o temprano, y hacerlo desde dentro con intentos de garantizar su alineación se considera preferible a dejar que surja sin vigilancia ni principios. El dilema, en el fondo, no es entre avanzar y detenerse, sino entre hacerlo solos, compitiendo sin miramientos, o hacerlo juntos, acordando límites que protejan lo que ninguno desea perder.
