Reservar cita

AI Red Teaming para sistemas de IA generativa

Cómo probar de forma sistemática modelos de lenguaje y aplicaciones de IA frente a jailbreaks, prompt injection, fugas de datos y uso inseguro de herramientas: desde la definición de escenarios hasta un proceso de prueba repetible.

Actualizado: julio de 2026 · Valeri Milke, Lead Auditor ISO 27001 e ISO 42001

4familias de técnicas: jailbreaks, prompt injection, extracción de datos, uso inseguro de herramientas
1.0versión de la OWASP GenAI Red Teaming Guide con cuatro niveles de prueba (enero de 2025)
100+productos de GenAI evaluados por el Microsoft AI Red Team (más de 100)
2025desde el 2 de agosto: adversarial testing obligatorio para modelos con riesgo sistémico (art. 55(1)(a))

Con la llegada de la IA generativa a los procesos de negocio surge una superficie de ataque que las pruebas de seguridad clásicas no cubren: el comportamiento del propio modelo y su integración en las aplicaciones. El AI Red Teaming traslada la idea del ataque simulado a este nivel: desde jailbreaks y prompt injection directa e indirecta hasta el uso abusivo de herramientas conectadas. Desde 2025 existen anclajes metodológicos sólidos, en particular la OWASP GenAI Red Teaming Guide y la taxonomía del NIST para adversarial machine learning. Al mismo tiempo, el Reglamento de IA convierte el adversarial testing en una obligación explícita para determinados modelos y exige a los sistemas de IA de alto riesgo resiliencia frente a ataques específicos de la IA.

2025: del anclaje metodológico a la obligación legal

Tres hitos de 2025 — toque un hito para ver los detalles.

Lo esencial en resumen

Seis bloques temáticos — toque para desplegar.

Anclajes metodológicos: OWASP y NIST

Dos documentos, un vocabulario — definir de forma trazable el alcance de las pruebas y la matriz de evaluación.

Versión 1.0 · enero de 2025
  • Metodología estructurada y neutral respecto a fabricantes, publicada por el OWASP GenAI Security Project.
  • Cuatro niveles de prueba: la evaluación del propio modelo, la implementación (incluidos guardrails y prompts de sistema), la infraestructura circundante y el comportamiento en tiempo de ejecución en interacción con usuarios y procesos.
modeloimplementaciónguardrailsprompts de sistemainfraestructuracomportamiento en tiempo de ejecución

Estándares y fuentes

Los contenidos de esta página se basan en las siguientes guías y estudios disponibles públicamente.

OWASP GenAI Security Project · 2025

GenAI Red Teaming Guide

Versión 1.0 del 22 de enero de 2025; estructura el AI Red Teaming en los cuatro niveles de prueba: modelo, implementación, infraestructura y comportamiento en tiempo de ejecución.

OWASP GenAI Security Project · 2025

OWASP Top 10 for LLM Applications 2025

Lista de riesgos actual para aplicaciones LLM con Prompt Injection (LLM01), Sensitive Information Disclosure (LLM02), Excessive Agency (LLM06) y System Prompt Leakage (LLM07) como objetivos de prueba típicos.

Amtsblatt der EU / EUR-Lex · 2024

Verordnung (EU) 2024/1689 (KI-Verordnung / AI Act)

El art. 55(1)(a) obliga a los proveedores de modelos GPAI con riesgo sistémico a un adversarial testing documentado (aplicable desde el 02.08.2025); el art. 15(5) exige resiliencia de los sistemas de IA de alto riesgo frente a ataques específicos de la IA.

NIST · 2025

Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations (NIST AI 100-2 E2025)

Taxonomía y terminología de los ataques contra sistemas de IA predictivos y generativos (marzo de 2025); aporta el vocabulario común para la matriz de evaluación y el reporting.

Microsoft AI Red Team · 2025

Lessons From Red Teaming 100 Generative AI Products

Ocho lecciones prácticas de más de 100 ejercicios de red teaming de GenAI, entre otras sobre la distinción respecto a los benchmarks y la interacción entre automatización y pericia humana.

¿Qué resiliencia tiene su aplicación de IA?

En una primera reunión sin compromiso aclaramos qué superficies de ataque presentan sus aplicaciones de IA y qué enfoque de prueba —puntual o continuo— se ajusta a su escenario de uso.