El Red Teaming clásico simula atacantes contra redes, sistemas e identidades; los hallazgos suelen ser vulnerabilidades técnicas claramente reproducibles. El AI Red Teaming, en cambio, se centra en el comportamiento del propio sistema de IA: los modelos de lenguaje responden de forma probabilística, un mismo ataque puede tener éxito recién en el décimo intento, y un hallazgo a menudo no es un error de programación, sino un comportamiento indeseado del modelo. Además de los objetivos de seguridad clásicos, se evalúan también los daños relacionados con el contenido, como la generación de contenidos dañinos o falsos. Igual de importante es la distinción respecto a los benchmarks: los conjuntos de prueba estáticos miden capacidades conocidas, mientras que el Red Teaming busca deliberadamente modos de fallo novedosos y específicos del contexto, una de las lecciones centrales del Microsoft AI Red Team tras más de 100 productos de GenAI evaluados.
AI Red Teaming para sistemas de IA generativa
Cómo probar de forma sistemática modelos de lenguaje y aplicaciones de IA frente a jailbreaks, prompt injection, fugas de datos y uso inseguro de herramientas: desde la definición de escenarios hasta un proceso de prueba repetible.
Con la llegada de la IA generativa a los procesos de negocio surge una superficie de ataque que las pruebas de seguridad clásicas no cubren: el comportamiento del propio modelo y su integración en las aplicaciones. El AI Red Teaming traslada la idea del ataque simulado a este nivel: desde jailbreaks y prompt injection directa e indirecta hasta el uso abusivo de herramientas conectadas. Desde 2025 existen anclajes metodológicos sólidos, en particular la OWASP GenAI Red Teaming Guide y la taxonomía del NIST para adversarial machine learning. Al mismo tiempo, el Reglamento de IA convierte el adversarial testing en una obligación explícita para determinados modelos y exige a los sistemas de IA de alto riesgo resiliencia frente a ataques específicos de la IA.
2025: del anclaje metodológico a la obligación legal
Tres hitos de 2025 — toque un hito para ver los detalles.
OWASP GenAI Red Teaming Guide 1.0
El OWASP GenAI Security Project publica una metodología estructurada y neutral respecto a fabricantes, con cuatro niveles de prueba: modelo, implementación, infraestructura y comportamiento en tiempo de ejecución.
NIST AI 100-2 E2025
La taxonomía del NIST para adversarial machine learning clasifica los ataques contra sistemas de IA predictivos y generativos según los objetivos, las capacidades y la fase del ciclo de vida del atacante.
Se aplica la obligación de adversarial testing del Reglamento de IA
Según el art. 55(1)(a), los proveedores de modelos de IA de uso general con riesgo sistémico deben realizar y documentar adversarial testing para identificar y mitigar riesgos sistémicos.
Lo esencial en resumen
Seis bloques temáticos — toque para desplegar.
Anclajes metodológicos: OWASP y NIST
Dos documentos, un vocabulario — definir de forma trazable el alcance de las pruebas y la matriz de evaluación.
- Metodología estructurada y neutral respecto a fabricantes, publicada por el OWASP GenAI Security Project.
- Cuatro niveles de prueba: la evaluación del propio modelo, la implementación (incluidos guardrails y prompts de sistema), la infraestructura circundante y el comportamiento en tiempo de ejecución en interacción con usuarios y procesos.
- Taxonomía y terminología para adversarial machine learning.
- Clasifica los ataques contra sistemas de IA predictivos y generativos según los objetivos, las capacidades y la fase del ciclo de vida del atacante.
- Junto con la guía de OWASP constituye el vocabulario con el que definir de forma trazable el alcance de las pruebas y la matriz de evaluación.
Estándares y fuentes
Los contenidos de esta página se basan en las siguientes guías y estudios disponibles públicamente.
GenAI Red Teaming Guide
Versión 1.0 del 22 de enero de 2025; estructura el AI Red Teaming en los cuatro niveles de prueba: modelo, implementación, infraestructura y comportamiento en tiempo de ejecución.
OWASP Top 10 for LLM Applications 2025
Lista de riesgos actual para aplicaciones LLM con Prompt Injection (LLM01), Sensitive Information Disclosure (LLM02), Excessive Agency (LLM06) y System Prompt Leakage (LLM07) como objetivos de prueba típicos.
Verordnung (EU) 2024/1689 (KI-Verordnung / AI Act)
El art. 55(1)(a) obliga a los proveedores de modelos GPAI con riesgo sistémico a un adversarial testing documentado (aplicable desde el 02.08.2025); el art. 15(5) exige resiliencia de los sistemas de IA de alto riesgo frente a ataques específicos de la IA.
Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations (NIST AI 100-2 E2025)
Taxonomía y terminología de los ataques contra sistemas de IA predictivos y generativos (marzo de 2025); aporta el vocabulario común para la matriz de evaluación y el reporting.
Lessons From Red Teaming 100 Generative AI Products
Ocho lecciones prácticas de más de 100 ejercicios de red teaming de GenAI, entre otras sobre la distinción respecto a los benchmarks y la interacción entre automatización y pericia humana.
Servicios relacionados
¿Qué resiliencia tiene su aplicación de IA?
En una primera reunión sin compromiso aclaramos qué superficies de ataque presentan sus aplicaciones de IA y qué enfoque de prueba —puntual o continuo— se ajusta a su escenario de uso.