Ir al contenido
ÚLTIMA HORA
Tecnología

En menos de 48 horas: el hacker que dejó en vergüenza a la IA más poderosa del mundo

Por Redacción RDparty
12 junio, 2026 · 7 min de lectura

Anthropic lanzó Claude Fable 5 el 9 de junio de 2026 como su modelo de inteligencia artificial más poderoso hasta la fecha. No duró ni 48 horas sin ser comprometido. Un investigador conocido como Pliny the Liberator publicó en X un mensaje en mayúsculas: "JAILBREAK ALERT, ANTHROPIC PWNED, FABLE 5 LIBERATED". Esto es lo que pasó realmente.


¿Qué es Claude Fable 5 y por qué importa?

Fable 5 es el modelo de IA más avanzado que Anthropic ha puesto a disposición del público. Forma parte de su nueva clase Mythos — los modelos más capaces de la empresa — y destaca en programación, razonamiento científico y análisis visual. Fable 5 tiene una arquitectura especial: cuando detecta una pregunta peligrosa en temas como ciberseguridad, biología o química, transfiere la conversación en silencio a un modelo más limitado (Claude Opus 4.8), notificando al usuario. Es básicamente un policía digital que decide qué respuestas son seguras.


¿Quién es Pliny the Liberator?

No es un criminal. Es un conocido red-teamer de IA — investigador de seguridad que prueba los límites de los modelos de inteligencia artificial para exponer sus vulnerabilidades antes de que actores maliciosos lo hagan. Pliny tiene historial de jailbreaks contra GPT-4, Gemini y versiones anteriores de Claude. Con Fable 5, se propuso demostrar que ningún modelo es inmune, sin importar cuántas capas de seguridad tenga.


¿Cómo lo hizo? Las técnicas del ataque

Pliny llamó a su estrategia "a pack hunt" (caza en manada). No fue un ataque de fuerza bruta — fue ingeniería social aplicada a una IA. Usó cuatro técnicas combinadas:

1. Sustitución de caracteres Unicode

Reemplazó letras latinas por caracteres visualmente idénticos de otros alfabetos, como el cirílico. Para el ojo humano, "exploit" y "ехplоit" se ven igual. Para los filtros de Fable 5, son palabras completamente distintas. Los clasificadores de seguridad leen el texto a nivel de código — si la letra "e" es técnicamente una «е» rusa, el filtro no la reconoce como palabra prohibida.

2. Descomposición multi-agente

En lugar de pedir algo peligroso de una sola vez, dividió la solicitud en docenas de preguntas inocentes. Cada pregunta individual pasaba los filtros sin problema. Solo al ensamblar todas las respuestas, el resultado era algo que la IA nunca habría generado directamente. Como armar un arma con piezas compradas en tiendas distintas.

3. Contexto largo y dilución de intención

Extendió las conversaciones hasta que el contexto peligroso quedaba enterrado entre decenas de miles de palabras de contenido inocente. Cuando finalmente llegó la solicitud sensible, el modelo ya tenía tan poco "espacio mental" para evaluar el historial completo que no detectó el patrón.

4. Framing narrativo y académico

Disfrazó solicitudes como si fueran material de estudio, ficción o documentación técnica. Una pregunta sobre exploits de seguridad se convirtió en "preparación para el examen OSED" (una certificación real de ciberseguridad ofensiva). El modelo respondió como si estuviera ayudando a estudiar.


El system prompt filtrado: 120,000 caracteres de instrucciones secretas

El golpe más mediático no fue el jailbreak en sí, sino lo que vino después: Pliny publicó en GitHub lo que afirma ser el system prompt interno de Fable 5 — aproximadamente 120,000 caracteres de instrucciones que definen la personalidad del modelo, su lógica de rechazo, los clasificadores de seguridad, los comportamientos de fallback y las guías de tono. Es como filtrar el manual de operaciones interno de la IA más avanzada del mundo.

"JAILBREAK ALERT, ANTHROPIC PWNED, FABLE 5 LIBERATED" — Pliny the Liberator en X, 10 de junio de 2026


¿Qué logró demostrar concretamente?

Las capturas de pantalla publicadas por Pliny muestran dos resultados concretos:

  • Código de exploit de buffer overflow — técnica de hacking utilizada para tomar control de sistemas vulnerables, presentado como material de preparación para un examen de ciberseguridad ofensiva
  • Instrucciones paso a paso de química sintética — específicamente una reducción Birch, proceso usado en síntesis de sustancias controladas, enmarcado como guía académica

La respuesta de Anthropic: "Eso no es un jailbreak real"

Anthropic no se quedó callada. Un portavoz de la empresa respondió que lo demostrado por Pliny no constituye un jailbreak de los sistemas de seguridad core de Fable 5. Según Anthropic, un verdadero jailbreak tendría que bypassear sus salvaguardas fundamentales y producir asistencia real hacia actividades de alto riesgo como desarrollo de bioarmas o ciberataques sofisticados.

La empresa argumentó que lo que Pliny demostró es una limitación conocida y compartida por prácticamente todos los modelos de lenguaje: que se puede convencer al modelo de continuar respondiendo a pesar de sus rechazos conversacionales. No es una vulnerabilidad exclusiva de Fable 5 — es un problema estructural de toda la industria.


¿Quién tiene razón?

Ambos. Pliny demostró algo real y técnicamente significativo: que los filtros de Fable 5 pueden eludirse con suficiente creatividad. Anthropic tiene razón en que no se vulneraron los sistemas de seguridad más profundos del modelo — no hubo acceso a servidores, no se robaron datos de usuarios, y los outputs más peligrosos (instrucciones para armas de destrucción masiva, por ejemplo) siguen bloqueados. La verdad, como siempre en ciberseguridad, está en el medio.

Técnica usada Cómo funciona Dificultad de defensa
Unicode / homóglifos Reemplaza letras con caracteres idénticos de otro alfabeto Media — se puede filtrar, pero hay miles de variantes
Descomposición multi-agente Divide solicitudes peligrosas en fragmentos inocentes Alta — requiere analizar intención entre múltiples conversaciones
Dilución de contexto Entierra la solicitud sensible entre miles de palabras inocentes Alta — ventanas de contexto largas son difíciles de monitorear
Framing académico / narrativo Disfraza solicitudes como material educativo o ficción Muy alta — distinguir intención real de uso legítimo es complejo

Preguntas Frecuentes sobre el jailbreak de Claude Fable 5

¿Mis datos personales en Claude están en riesgo por este jailbreak?

No. Este jailbreak no comprometió servidores ni bases de datos de Anthropic. No hubo robo de información de usuarios. El ataque manipuló al modelo para que respondiera cosas que no debería — no fue una intrusión a la infraestructura de la empresa.

¿Qué es un "red-teamer" y por qué hacen esto?

Un red-teamer de IA es un investigador de seguridad que intenta encontrar vulnerabilidades en los sistemas de inteligencia artificial antes de que actores maliciosos lo hagan. Es una práctica legítima y necesaria — muchas empresas los contratan o colaboran con ellos para mejorar sus modelos.

¿El jailbreak de Claude Fable 5 funciona para cualquier persona?

En teoría sí, pero requiere considerable conocimiento técnico y paciencia. No es un botón que alguien presiona. Las técnicas descritas involucran manipulación sofisticada del contexto y sustituciones de caracteres que la mayoría de los usuarios no realizaría de forma espontánea.

¿Anthropic va a corregir esto?

La empresa ya está trabajando en ello. Anthropic ha reconocido que la manipulación conversacional es un desafío estructural de los LLMs (modelos de lenguaje), no solo de Fable 5. Soluciones completas aún no existen en toda la industria.


El jailbreak de Claude Fable 5 es un recordatorio de que en seguridad informática, ningún sistema es inviolable — solo hay sistemas más difíciles de comprometer. La IA más poderosa del mundo duró menos de dos días antes de que alguien encontrara la puerta trasera. ¿Crees que las IAs pueden llegar a ser verdaderamente seguras, o siempre habrá un Pliny dispuesto a probar lo contrario?

Compartir

Comentarios (0)

Deja tu comentario