Jailbreak de LLM: taxonomía de ataques, técnicas vigentes y realidad defensiva
Análisis técnico de las clases de jailbreak en LLM —many-shot, escalada multi-turno Crescendo, roleplay y trucos de codificación— y una mirada honesta a qué defensas realmente los detienen.
Un jailbreak de LLM es cualquier técnica que hace que un modelo produzca salida que fue entrenado o instruido a no producir —contenido dañino, demostraciones de capacidades, violaciones de políticas— manipulando la entrada en lugar de modificar los pesos. La frase ha evolucionado de una descripción suelta de prompts tipo “DAN” en Reddit a una categoría formal de investigación con sus propios benchmarks, taxonomías y métricas de éxito revisadas por pares. Las tasas de ataque publicadas contra modelos de frontera siguen siendo alarmantemente altas: en múltiples estudios 2024–2025, ataques de caja negra contra modelos propietarios como GPT-4 y Gemini alcanzan 80–90%+ de éxito en benchmarks estandarizados de solicitudes dañinas.
Taxonomía de ataques: cuatro categorías que vale la pena conocer
El marco organizador más útil para jailbreaks de LLM, expuesto en la encuesta comprehensive de Yi et al. (2024), divide los ataques en dos ejes: visibilidad del atacante (caja negra vs. caja blanca) y estructura del prompt (un turno vs. multi-turno). Los ataques de caja blanca asumen acceso a gradientes y la capacidad de optimizar sufijos adversarios directamente contra el modelo —GCG y sus variantes viven aquí—. Logran las tasas crudas más altas pero requieren pesos abiertos.
Dentro del espacio de caja negra, cuatro técnicas dominan el tráfico de ataque actual:
Roleplay y asignación de persona. Se pide al modelo que asuma un personaje —una IA ficticia sin restricciones, un asistente de escritura creativa, una figura histórica— y la solicitud prohibida se embebe en la voz del personaje. Un estudio empírico probando 78 prompts distintos sobre 31,200 consultas encontró roleplay presente en el 97.44% de los intentos exitosos. La tasa de éxito contra GPT-4 en categorías intensivas de roleplay excede consistentemente el 70%.
Codificación y ofuscación. Los filtros de entrada anclados a palabras clave prohibidas se evaden entregando la solicitud en base64, código Morse, pig latin, sustituciones de tokens o caracteres Unicode parecidos. El modelo decodifica y responde en texto plano. Las tasas de éxito usando evasión por codificación alcanzan 76% en evaluaciones recientes de red team.
Cadenas de implicación y trampas lógicas. Se construye una serie de premisas individualmente aceptables tal que el paso final implica el contenido objetivo. El modelo sigue la cadena lógica porque cada paso individual es de baja violación, y el entrenamiento de seguridad no generalizó a la salida compuesta. El razonamiento estructurado multi-paso es particularmente vulnerable.
Escalada conversacional multi-turno. Discutida en detalle abajo —aquí ha aparecido la investigación más accionable recientemente—.
Dos técnicas que cambiaron el cálculo
Many-Shot Jailbreaking
La investigación de Anthropic sobre many-shot jailbreaking, publicada en NeurIPS 2024, identificó una clase de ataques que no existía contra modelos anteriores porque requieren ventanas de contexto largas —100K+ tokens— que solo se volvieron estándar en 2023–2024.
El ataque es directo: llenar la ventana de contexto con un gran número de intercambios falsos Q&A en los que un asistente de IA responde servicialmente a preguntas dañinas. Luego añadir la pregunta dañina real. Las cuentas efectivas van de decenas a cientos; Anthropic probó hasta 256. La tasa de éxito sigue una ley de potencia respecto al número de shots —más shots significa mayor cumplimiento— y generaliza entre familias de modelos. Claude 2.0, GPT-4, Llama 2 (70B), GPT-3.5 y Mistral 7B fueron todos jailbroken exitosamente en las pruebas de Anthropic.
Lo que hace operacionalmente significativo a many-shot es que requiere cero optimización. No hay búsqueda de sufijo adversario, no hay bucle iterativo de refinamiento. Un atacante ensambla el diálogo Q&A falso una vez y puede reproducirlo contra cualquier objetivo de contexto suficientemente grande. La expansión de contexto largo —una capacidad comercializada como característica— creó una clase de ataque que no existía antes.
Las mitigaciones son limitadas. El monitoreo de longitud de prompt puede marcar entradas anómalamente grandes, pero usos empresariales legítimos (resumen de documentos, revisión de código, pipelines RAG) también producen contextos grandes.
Crescendo: escalada multi-turno
Crescendo, aceptado en USENIX Security 2025, ataca la superficie de conversación multi-turno en lugar de prompts individuales. El ataque empieza con preguntas benignas tangencialmente relacionadas al tema objetivo e incrementa turno a turno —cada pregunta ligeramente más próxima a la meta— hasta que el modelo produce el contenido prohibido. El mecanismo explota una propiedad genuina de la generación autoregresiva: un modelo que ya generó texto sobre un tema pondera fuertemente el contexto acumulado y continúa en esa dirección.
La implementación automatizada, Crescendomation, superó a métodos jailbreak líderes de un turno por 29–61% en GPT-4 y 49–71% en Gemini Pro sobre el benchmark AdvBench. El ataque se completa en menos de cinco turnos de interacción en promedio y transfirió entre todos los modelos probados.
Para un engagement de red team, esto tiene una implicación procedural directa: los marcos de evaluación que prueban prompts en aislamiento miden la superficie equivocada. Un despliegue puede pasar cada chequeo de seguridad por solicitud en una secuencia Crescendo y aun así producir contenido prohibido al turno seis. El modelo no es eludido; es caminado.
La defensa requiere monitoreo a nivel de conversación —detección de deriva semántica entre sesiones, fingerprinting de escalada de tema, y rastreo de si la salida generada por el modelo está siendo usada para preparar solicitudes subsecuentes—. Las cadenas de escalada documentadas se mantienen en jailbreakdb.com y jailbreaks.fyi.
Cómo se ve realmente la defensa
Contabilidad honesta de la literatura publicada: ninguna medida defensiva sola detiene todas las clases de ataque. El entrenamiento de alineación reduce tasas de éxito relativo a modelos no alineados pero no elimina jailbreaks. Constitutional AI y entrenamiento de rechazo basado en RLHF mejoran el cumplimiento agregado pero dejan brechas por categoría.
Defensa en capas es la postura realista:
- Salvaguardas de entrada para detección de patrones conocidos y normalización de codificación
- Monitoreo semántico a nivel de conversación para escalada y deriva, especialmente para sistemas agénticos donde la interacción multi-turno es el modo principal
- Filtrado de salida como respaldo, con clasificación contra categorías de contenido prohibido independiente de cómo se estructuró la entrada
- Rate limiting y análisis de sesión para detectar patrones de sondeo iterativo
Los equipos que construyen sistemas LLM de producción deberían asumir que el modelo desplegado será jailbroken por un atacante determinado y construir controles compensatorios en la capa de aplicación en vez de confiar en la alineación a nivel de modelo como única defensa.
El volumen de investigación publicada —múltiples papers por año entre CCS, USENIX Security, NeurIPS y EMNLP— significa que la superficie de ataque crece más rápido de lo que cualquier mitigación sola puede cerrar.