Termin vereinbaren

AI Red Teaming für generative KI-Systeme

Wie Sie Sprachmodelle und KI-Anwendungen systematisch auf Jailbreaks, Prompt Injection, Datenabfluss und unsichere Tool-Nutzung testen – von der Szenariodefinition bis zum wiederholbaren Prüfprozess.

Stand: Juli 2026 · Valeri Milke, ISO 27001 & ISO 42001 Lead Auditor

4Technikfamilien im Fokus: Jailbreaks, Prompt Injection, Datenextraktion, unsichere Tool-Nutzung
1.0Version des OWASP GenAI Red Teaming Guide mit vier Prüfebenen (Januar 2025)
100+GenAI-Produkte vom Microsoft AI Red Team getestet (über 100)
2025seit 2. August: Adversarial-Testing-Pflicht für Modelle mit systemischem Risiko (Art. 55(1)(a) KI-Verordnung)

Mit dem Einzug generativer KI in Geschäftsprozesse entsteht eine Angriffsfläche, die klassische Sicherheitstests nicht abdecken: das Verhalten des Modells selbst und seine Einbettung in Anwendungen. AI Red Teaming überträgt die Idee des simulierten Angriffs auf diese Ebene – von Jailbreaks über direkte und indirekte Prompt Injection bis zur missbräuchlichen Nutzung angebundener Tools. Seit 2025 existieren dafür belastbare methodische Anker, insbesondere der OWASP GenAI Red Teaming Guide und die NIST-Taxonomie für Adversarial Machine Learning. Zugleich macht die KI-Verordnung Adversarial Testing für bestimmte Modelle zur ausdrücklichen Pflicht und verlangt für Hochrisiko-KI-Systeme Widerstandsfähigkeit gegen KI-spezifische Angriffe.

2025: Vom methodischen Anker zur Rechtspflicht

Drei Anker aus dem Jahr 2025 — Meilenstein antippen für Details.

Das Wichtigste im Überblick

Sechs Themenblöcke — zum Aufklappen antippen.

Methodische Anker: OWASP und NIST

Zwei Dokumente, ein Vokabular — Testumfang und Bewertungsraster nachvollziehbar definieren.

Version 1.0 · Januar 2025
  • Strukturierte, herstellerneutrale Methodik des OWASP GenAI Security Project.
  • Vier Prüfebenen: die Evaluierung des Modells selbst, die Implementierung (u. a. Guardrails und Systemprompts), die umgebende Infrastruktur sowie das Laufzeitverhalten im Zusammenspiel mit Nutzern und Prozessen.
ModellImplementierungGuardrailsSystempromptsInfrastrukturLaufzeitverhalten

Standards & Quellen

Die Inhalte dieser Seite basieren auf den folgenden öffentlich verfügbaren Leitfäden und Studien.

OWASP GenAI Security Project · 2025

GenAI Red Teaming Guide

Version 1.0 vom 22. Januar 2025; strukturiert AI Red Teaming über die vier Prüfebenen Modell, Implementierung, Infrastruktur und Laufzeitverhalten.

OWASP GenAI Security Project · 2025

OWASP Top 10 for LLM Applications 2025

Aktuelle Risikoliste für LLM-Anwendungen mit Prompt Injection (LLM01), Sensitive Information Disclosure (LLM02), Excessive Agency (LLM06) und System Prompt Leakage (LLM07) als typischen Testzielen.

Amtsblatt der EU / EUR-Lex · 2024

Verordnung (EU) 2024/1689 (KI-Verordnung / AI Act)

Art. 55(1)(a) verpflichtet Anbieter von GPAI-Modellen mit systemischem Risiko zu dokumentiertem Adversarial Testing (gilt seit 02.08.2025); Art. 15(5) fordert Widerstandsfähigkeit von Hochrisiko-KI-Systemen gegen KI-spezifische Angriffe.

NIST · 2025

Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations (NIST AI 100-2 E2025)

Taxonomie und Terminologie für Angriffe auf prädiktive und generative KI-Systeme (März 2025); liefert das gemeinsame Vokabular für Bewertungsraster und Reporting.

Microsoft AI Red Team · 2025

Lessons From Red Teaming 100 Generative AI Products

Acht Praxislektionen aus über 100 GenAI-Red-Team-Einsätzen, u. a. zur Abgrenzung von Benchmarks und zum Zusammenspiel von Automatisierung und menschlicher Expertise.

Wie widerstandsfähig ist Ihre KI-Anwendung?

In einem unverbindlichen Erstgespräch klären wir, welche Angriffsflächen Ihre KI-Anwendungen bieten und welcher Testansatz – einmalig oder kontinuierlich – zu Ihrem Einsatzszenario passt.