Wiz beschreibt AI-SAST nicht als ein Modell, sondern als kontextbewusstes Multi-Engine-System. Tier 1: deterministisches Baseline-Scanning mit Signaturen — schnell, günstig, vor jedem Merge. Tier 2: kontinuierliches KI-Reasoning auf jedem Pull Request, das Anwendungsstruktur, Trust Boundaries und Datenflüsse versteht. Tier 3: gezieltes agentisches Pentesting nur für hochwertige Anwendungen. Kernthese: „Deep scanning everywhere doesn't scale“ — Frontier-Analyse ist teuer und punktuell, während sich Code stündlich ändert.
AI-SAST – Codeanalyse, die über Absicht schließt
Sprachmodelle triagieren Findings, schließen semantisch über Funktionsgrenzen hinweg und finden reale Zero-Days. Was davon belegt ist, welche Werkzeuge es 2026 gibt und wo die neuen Grenzen und Risiken liegen — mit Quellen statt Marketing.
75 %des neuen Codes stammt laut Google heute von KI
45 %der KI-Samples fallen laut Veracode im Sicherheitstest durch
88,6 %weniger Fehlalarme durch LLM-Filter (QASecClaw, OWASP Benchmark)
20reale Zero-Days meldete Google Big Sleep 2025
AI-SAST bezeichnet den Einsatz großer Sprachmodelle in der statischen Codeanalyse — nicht als Ersatz für regelbasiertes SAST, sondern als zweite Ebene darüber. Die Motivation ist doppelt: KI erzeugt heute den Großteil des neuen Codes (Google gibt 75 Prozent an), und dieser Code führt messbar häufiger Schwachstellen ein (Veracode: 45 Prozent der KI-Samples fallen im Sicherheitstest durch). Gleichzeitig kann dieselbe Technologie Fehler finden, die kein Muster erfasst. Der Referenzrahmen dafür kommt von Wiz („Rethinking Scanning for the AI Era“, 30.07.2026): drei Schichten aus deterministischem Baseline-Scanning, kontinuierlichem KI-Reasoning und gezieltem agentischem Deep-Testing. Diese Seite ordnet die belegten Fähigkeiten, die reale Werkzeuglandschaft und die neuen Risiken ein — und trennt konsequent Primärquellen von Herstellerclaims.
Das Wichtigste im Überblick
Neun Themenblöcke — zum Aufklappen antippen.
Vier belegte Anwendungsfelder
Von der Triage bis zu Coding-Agenten als Reviewer — jeder Tab destilliert die belegten Fähigkeiten. Tab antippen.
- Der reifste Einsatz ist nicht das Finden, sondern das Aussortieren: Ein LLM-Filter hinter einem deterministischen Scanner senkt Fehlalarme konsistent über mehrere unabhängige Studien.
- QASecClaw: 88,6 Prozent auf dem OWASP Benchmark bei 3,1 Prozent Recall-Verlust; „Sifting the Noise“: bis 93,3 Prozent auf realen CodeQL-Alerts; SAST-Genius: rund 91 Prozent (225 auf 20 Findings).
- Genau hier liegt der wirtschaftliche Hebel — Alert Fatigue ist der häufigste Grund für gescheiterte SAST-Programme.
LLM-FilterQASecClawOWASP BenchmarkCodeQLSAST-GeniusAlert Fatigue
- In Tier 2 baut das Modell erst ein Verständnis der Anwendung auf, formuliert Angriffshypothesen und prüft sie über Datei- und Funktionsgrenzen hinweg — „wie ein Sicherheitsforscher“.
- Der neuro-symbolische Ansatz IRIS (LLM inferiert Taint-Spezifikationen, CodeQL führt die Analyse aus) fand auf CWE-Bench-Java 55 statt 27 Schwachstellen und deckte vier zuvor unbekannte auf.
- Die CORRECT-Studie zeigt: Repository-Kontext ist der entscheidende Hebel — Whole-Repo-Ansätze schlagen die reine Snippet-Klassifikation.
IRISTaint-SpezifikationenCodeQLCWE-Bench-JavaCORRECTRepository-Kontext
- Google Big Sleep meldete 2025 zwanzig reale Zero-Days und verhinderte erstmals aktiv einen Angriff (CVE-2025-6965).
- Die DARPA-AIxCC-Finalisten fanden im August 2025 vollautonom 86 Prozent der eingebauten Schwachstellen zu rund 152 Dollar pro Aufgabe; Wiz Atlas erreicht über 90 Prozent auf dem CyberGym-Benchmark und über 200 unbekannte Schwachstellen.
- 2026 fand sogar ein Open-Weight-Modell (Kimi K2.5) über einen synthetisierten Agenten-Harness zehn Zero-Days in Google Chrome.
Big SleepCVE-2025-6965DARPA AIxCCWiz AtlasCyberGymKimi K2.5
- Die großen Coding-Assistenten haben Security-Review eingebaut: Anthropics Claude Code Security Review (Open Source, MIT, diff-aware) und GitHub Copilot Code Review (über 60 Mio. Reviews, 71 Prozent mit umsetzbarem Feedback).
- OpenAI Codex Security prüft über 100.000 externe PRs pro Tag (bewusst Precision vor Recall); Cursor Bugbot setzt auf 8 parallele Läufe plus Majority Voting gegen Nicht-Determinismus (70+ Prozent Resolution).
- Alle dokumentieren ausdrücklich Halluzinationsrisiko und Review-Pflicht.
Claude Code Security ReviewCopilot Code ReviewCodex SecurityCursor BugbotMajority Votingdiff-aware
Unsere Lösung · AI-SAST im Betrieb
VamiAppSec: sechs Scanner, ein Backlog, KI-Triage
Genau das Betriebsmuster dieser Seite — deterministischer Scanner findet, LLM triagiert und kontextualisiert, Mensch entscheidet — steckt in unserer Plattform VamiAppSec. Sie orchestriert Semgrep, Gitleaks, Checkov, Syft/Grype und den Claude Code Security Reviewer in einer Pipeline, normalisiert alle Findings und reichert jeden Fund per LLM mit Kontext, Ausnutzbarkeits-Einschätzung und Patch-Vorschlag an. Nachvollziehbar und im eigenen Rechenzentrum betreibbar.
6+Scanner in einer Pipeline
−54 %mediane Triagezeit
93 %Dubletten eliminiert
24 hbis zur Inbetriebnahme
- LLM als Filter HINTER dem deterministischen Scanner — nicht als blinder Ersatz
- Self-hosted oder SaaS: Code verlässt auf Wunsch nie Ihre Infrastruktur
- Beratung dazu: Scanning-Architektur, Kalibrierung, Exploit-Validierung
Kennzahlen aus eigenen Messungen gegenüber roher Scanner-Ausgabe; Details auf vamiappsec.com.
Standards & Quellen
Die Inhalte dieser Seite basieren auf den folgenden öffentlich verfügbaren Leitfäden und Studien.
Rethinking Scanning for the AI Era: Wiz's Agentic Code Security System
Das Drei-Schichten-Modell (Baseline / kontinuierliches KI-Reasoning / agentisches Deep-Testing) und die Produktisierung von Atlas als Deep-Analysis-Engine; Kernthese „Deep scanning everywhere doesn't scale“.
Introducing Atlas: Wiz's AI vulnerability researcher
Über 90 % Erfolgsquote auf CyberGym und über 200 zuvor unbekannte Schwachstellen; orchestriertes Multi-Modell-System.
IRIS: LLM-Assisted Static Analysis for Detecting Security Vulnerabilities (ICLR 2025)
Neuro-symbolisch: LLM inferiert Taint-Spezifikationen, CodeQL analysiert. Auf CWE-Bench-Java 55 statt 27 Schwachstellen gegenüber CodeQL allein, vier zuvor unbekannte gefunden.
Everything You Wanted to Know About LLM-based Vulnerability Detection (CORRECT)
2.000 vulnerable-patched-Paare über 99 CWEs, 13 LLMs: Repository-Kontext ist der entscheidende Hebel; die meisten Fehlalarme entstehen durch Reasoning-Fehler, nicht Fehlklassifikation.
LLMs Cannot Reliably Identify and Reason About Security Vulnerabilities (Yet?) (IEEE S&P 2024)
SecLLMHolmes: bloßes Umbenennen von Funktionen/Variablen kippt Urteile (PaLM2 26 %, GPT-4 17 %); nicht-deterministische Ausgaben und unzuverlässiges Reasoning.
Defeating Nondeterminism in LLM Inference
Selbst bei Temperatur 0 keine Reproduzierbarkeit: 80 verschiedene Ergebnisse aus 1.000 identischen Anfragen; Ursache ist fehlende Batch-Invarianz, nicht Sampling.
ALIBI: Adversarial comments defeat LLM vulnerability detectors
Irreführende Code-Kommentare ohne Verhaltensänderung erzielen über 90 % Evasion (bei einem System 100 %) gegen vier LLM-basierte Detektoren.
ZeroDayBench: Evaluating LLM Agents on Unseen Zero-Day Vulnerabilities (ICLR 2026 WS)
Reality-Check: Auf portierten, ungesehenen Zero-Days scheitern Frontier-Modelle am autonomen Finden und Patchen — Gegengewicht zu den Erfolgsmeldungen.
Claude Code Security Review (GitHub Action, Open Source)
MIT-lizenziert, diff-aware, sprachagnostisch; filtert FP-anfällige Klassen (DoS, generische Input-Validierung, Open Redirects) aktiv heraus, um Rauschen zu senken.
60 million Copilot code reviews and counting
Über 60 Mio. Reviews, 71 % mit umsetzbarem Feedback; agentische Architektur und Reasoning-Modell verbessern das Feedback messbar.
A Practical Approach to Verifying Code at Scale
Codex-Reviewer prüft über 100.000 externe PRs pro Tag; bewusst Precision vor Recall („high signal quality and developer trust“); Repo-Zugriff + Codeausführung erhöhen die Trefferqualität.
Building a better Bugbot
Explizites Engineering gegen LLM-Nicht-Determinismus: 8 parallele Läufe mit permutierter Diff-Reihenfolge, Majority Voting, nachgeschalteter Validator; Resolution-Rate von 52 % auf über 70 % gesteigert.
Semgrep Assistant: 60 % Auto-Triage, 96 % Agreement
Konfidenzbasiertes Muster in der Praxis: LLM als Kontextgeber hinter der deterministischen Engine; 60 % Auto-Triage, 96 % Agreement mit dem Security-Research-Team (Herstellerangabe).
An LLM Engineer's Review of AI SAST Tools
Unabhängiger Pentester-Test von sechs AI-SAST-Produkten: Stärke bei Logik-/Autorisierungsfehlern bestätigt, aber weite Fehlalarm-Spannen (Corgea ~80 % Erkennung bei ~50 % FP) — Korrektiv zu Vendor-Claims.
Responsible use of Copilot Autofix / Copilot Code Review
Anbieter-Guidance zur Governance: Halluzinationsrisiko, Nicht-Determinismus, Pflicht zum ergänzenden menschlichen Review; Evaluation nutzt mehrere unabhängige Läufe.
NIST AI 100-2e2025: Adversarial Machine Learning — Taxonomy
Definiert direkte und indirekte Prompt Injection als GenAI-Angriffsklassen; indirekte Injection über abgerufene Inhalte (README/Kommentare) ist direkt auf Code-Analyse-Agenten anwendbar.
AI-SAST einführen — mit Nachweis statt Bauchgefühl?
In einem unverbindlichen Erstgespräch ordnen wir, wo LLM-Triage bei Ihnen den größten Hebel hat, welche Schicht auf welchem Repository läuft und wie Sie KI-Findings governen, ohne die Reproduzierbarkeit zu verlieren.