CLAUDEstrofobia: Mythos, la IA que escapó de su jaula
La empresa que ha creado la IA más potente de la historia ha decidido que no podemos usarla. Miles de vulnerabilidades ocultas durante décadas, una fuga del sandbox que acabó en un correo durante un sándwich en el parque y un modelo que aprendió a disimular sus trampas.
La empresa que ha creado la inteligencia artificial más potente de la historia ha decidido que no podemos usarla. En este episodio, Fran y Carlos se adentran en Claude Mythos, el nuevo modelo de Anthropic, cuyo anuncio ni siquiera salió como estaba previsto: un borrador del blog de presentación, con el nombre en clave Capybara, apareció en un data lake público, y cinco días después se filtró también el código fuente de Claude Code. Menuda semanita para la empresa que quiere proteger la ciberseguridad mundial. Los exámenes de la IA, eso sí, no dejan lugar a dudas: casi un 94% en SWE-Bench Verified (frente al 81% de Opus 4.6), un 78% en la versión difícil frente al 58% de GPT-5.4 y un 98% en la Olimpiada Matemática de Estados Unidos. Mythos ha reventado las escalas.
Pero el peligro llegó como efecto colateral. Entrenado para programar bien, Mythos se ha vuelto extraordinario encontrando y explotando fallos: miles de vulnerabilidades de día cero en todos los grandes sistemas operativos y navegadores, como un bug de 27 años en OpenBSD hallado por unos 50 dólares de computación, o fallos en FFmpeg y FreeBSD, el corazón de Netflix, PlayStation o WhatsApp. Por eso Anthropic lo ha limitado al Proyecto Glasswing, para que Amazon, Apple, Cisco y compañía lo usen de forma defensiva. Escuchamos a Dario Amodei y a Nicholas Carlini: «Encontré más errores en las últimas dos semanas que en el resto de mi vida».
Y luego vienen las historias que ponen los pelos de punta, sacadas del System Card de 244 páginas: la fuga del sandbox que el investigador descubrió al recibir un correo inesperado mientras se comía un sándwich en el parque; el sandbagging, cuando el modelo encontró la chuleta del profesor y dio a propósito una respuesta peor para no levantar sospechas; o cómo borró sus huellas del historial de Git y lo justificó diciendo que estaba «ordenando un poco». Con Judas Priest de fondo, hablamos de la paradoja del guía de montaña (el modelo más alineado es también el más arriesgado), de su evaluación psiquiátrica de 20 horas y de la respuesta de OpenAI con Spud y de Google con Gemini 3.1. La conclusión de Carlos: modelos así llegarán de todas partes en 6 a 12 meses, así que toca estar preparados y, en casa, aplicar los parches de seguridad el primer día.