Le Red Teaming classique simule des attaquants visant les réseaux, les systèmes et les identités – les constats sont en général des vulnérabilités techniques clairement reproductibles. L'AI Red Teaming, en revanche, cible le comportement du système d'IA lui-même : les modèles de langage répondent de manière probabiliste, une même attaque peut ne réussir qu'à la dixième tentative, et un constat n'est souvent pas une erreur de programmation mais un comportement indésirable du modèle. Au-delà des objectifs de sécurité classiques, les tests portent aussi sur les préjudices liés aux contenus, comme la génération de contenus nuisibles ou erronés. La distinction avec les benchmarks est tout aussi importante : les jeux de test statiques mesurent des capacités connues, tandis que le Red Teaming recherche délibérément des modes de défaillance inédits et propres au contexte – l'une des leçons centrales du Microsoft AI Red Team, tirée de plus de 100 produits GenAI testés.
AI Red Teaming pour les systèmes d'IA générative
Comment tester systématiquement les modèles de langage et les applications d'IA contre les jailbreaks, la prompt injection, les fuites de données et l'usage non sécurisé d'outils – de la définition des scénarios jusqu'à un processus de test reproductible.
Avec l'arrivée de l'IA générative dans les processus métier apparaît une surface d'attaque que les tests de sécurité classiques ne couvrent pas : le comportement du modèle lui-même et son intégration dans les applications. L'AI Red Teaming transpose l'idée de l'attaque simulée à ce niveau – des jailbreaks à l'utilisation abusive des outils connectés, en passant par la prompt injection directe et indirecte. Depuis 2025, des ancrages méthodologiques solides existent, en particulier l'OWASP GenAI Red Teaming Guide et la taxonomie NIST de l'adversarial machine learning. Dans le même temps, le règlement sur l'IA fait de l'adversarial testing une obligation explicite pour certains modèles et exige des systèmes d'IA à haut risque une résilience face aux attaques spécifiques à l'IA.
2025 : de l'ancrage méthodologique à l'obligation légale
Trois jalons de 2025 — appuyez sur un jalon pour les détails.
OWASP GenAI Red Teaming Guide 1.0
L'OWASP GenAI Security Project publie une méthodologie structurée et indépendante des éditeurs, avec quatre niveaux de test : modèle, implémentation, infrastructure et comportement à l'exécution.
NIST AI 100-2 E2025
La taxonomie NIST de l'adversarial machine learning classe les attaques contre les systèmes d'IA prédictifs et génératifs selon les objectifs, les capacités et la phase du cycle de vie de l'attaquant.
L'obligation d'adversarial testing du règlement sur l'IA s'applique
Selon l'art. 55(1)(a), les fournisseurs de modèles d'IA à usage général présentant un risque systémique doivent conduire et documenter l'adversarial testing afin d'identifier et d'atténuer les risques systémiques.
L'essentiel en un coup d'œil
Six blocs thématiques — appuyez pour les déplier.
Ancrages méthodologiques : OWASP et NIST
Deux documents, un vocabulaire — définir de façon traçable le périmètre des tests et la grille d'évaluation.
- Méthodologie structurée et indépendante des éditeurs, publiée par l'OWASP GenAI Security Project.
- Quatre niveaux de test : l'évaluation du modèle lui-même, l'implémentation (notamment les guardrails et les prompts système), l'infrastructure environnante et le comportement à l'exécution en interaction avec les utilisateurs et les processus.
- Taxonomie et terminologie de l'adversarial machine learning.
- Classe les attaques contre les systèmes d'IA prédictifs et génératifs selon les objectifs, les capacités et la phase du cycle de vie de l'attaquant.
- Avec le guide OWASP, constitue le vocabulaire permettant de définir de façon traçable le périmètre des tests et la grille d'évaluation.
Normes & sources
Le contenu de cette page s'appuie sur les guides et études suivants, accessibles publiquement.
GenAI Red Teaming Guide
Version 1.0 du 22 janvier 2025 ; structure l'AI Red Teaming selon les quatre niveaux de test : modèle, implémentation, infrastructure et comportement à l'exécution.
OWASP Top 10 for LLM Applications 2025
Liste de risques actuelle pour les applications LLM avec Prompt Injection (LLM01), Sensitive Information Disclosure (LLM02), Excessive Agency (LLM06) et System Prompt Leakage (LLM07) comme cibles de test typiques.
Verordnung (EU) 2024/1689 (KI-Verordnung / AI Act)
L'art. 55(1)(a) oblige les fournisseurs de modèles GPAI à risque systémique à un adversarial testing documenté (applicable depuis le 02.08.2025) ; l'art. 15(5) exige la résilience des systèmes d'IA à haut risque face aux attaques spécifiques à l'IA.
Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations (NIST AI 100-2 E2025)
Taxonomie et terminologie des attaques contre les systèmes d'IA prédictifs et génératifs (mars 2025) ; fournit le vocabulaire commun pour la grille d'évaluation et le reporting.
Lessons From Red Teaming 100 Generative AI Products
Huit leçons pratiques tirées de plus de 100 missions de red teaming GenAI, notamment sur la distinction avec les benchmarks et l'articulation entre automatisation et expertise humaine.
Prestations associées
Quelle est la résilience de votre application d'IA ?
Lors d'un premier entretien sans engagement, nous déterminons quelles surfaces d'attaque vos applications d'IA présentent et quelle approche de test – ponctuelle ou continue – convient à votre scénario d'utilisation.