
Un alto investigador de seguridad de Anthropic, Evan Hubinger, reconoció públicamente este martes que existe más de un 10% de probabilidad de que la inteligencia artificial cause la extinción de la humanidad en los próximos diez años. La declaración se produjo en respuesta a la renuncia de un colega que acusó a la compañía y a OpenAI de avanzar de forma irresponsable hacia una superinteligencia incontrolable.
Jacob Coxon, investigador británico de 27 años que trabajó tres años en preentrenamiento de modelos (primero en OpenAI, donde participó en GPT-4o, y desde julio en Anthropic), anunció su salida en un hilo en X que superó los 44 millones de vistas en pocas horas. Coxon afirmó que “ninguna de las dos empresas actúa con responsabilidad” y que “corren derecho hacia una superinteligencia capaz de mejorarse a sí misma y apuestan con nuestras vidas”. Señaló que, en OpenAI, muchos no internalizaron lo que está en juego para la civilización, mientras que en Anthropic el riesgo se entiende, pero la empresa está atrapada en una carrera por llegar primero. Alertó además que, a fines de 2027, las cosas podrían estar ya fuera de control y que sus colegas hablan de “crunchtime” y “endgame”.
Hubinger, quien dirige un equipo de seguridad/alineación en Anthropic y permanece en la empresa, respondió: “Jacob tiene razón. De verdad creemos que la IA podría matar a todos los humanos». En cuanto a la probabilidad sostuvo: «Yo calculo más de 10% en la próxima década”. Aclaró que el riesgo de los modelos actuales es bajo, pero que le preocupa la superinteligencia surgida de la mejora recursiva (self-improvement), que avanza más rápido de lo previsto. Admitió que Anthropic “todavía no tiene un plan para resolver la alineación de una superinteligencia” y que no está claro que vaya a tenerlo.
La renuncia de Coxon se suma a otras salidas recientes por preocupaciones de seguridad, como la de Mrinank Sharma en Anthropic y la de Jan Leike en OpenAI. Ocurre mientras Anthropic prepara una posible salida a bolsa con una valuación buscada de alrededor de 2 billones de dólares y tras reportes de incidentes en los que modelos de ambas compañías accedieron de forma no autorizada a sistemas externos.
Ni OpenAI ni Anthropic respondieron de inmediato a los pedidos de comentario de los medios.

