Wiz décrit l'AI SAST non comme un modèle unique mais comme un système multi-moteurs conscient du contexte. Niveau 1 : scan de base déterministe par signatures — rapide, économique, avant chaque merge. Niveau 2 : raisonnement IA continu sur chaque pull request, comprenant structure applicative, trust boundaries et flux de données. Niveau 3 : pentesting agentique ciblé, réservé aux applications à forte valeur. Thèse centrale : « Deep scanning everywhere doesn't scale » — l'analyse frontière est coûteuse et ponctuelle alors que le code change toutes les heures.
AI SAST – l'analyse de code qui raisonne sur l'intention
Les modèles de langage trient les findings, raisonnent sémantiquement au-delà des frontières de fonctions et trouvent de vrais zero-days. Ce qui en est prouvé, quels outils existent en 2026 et où se situent les nouvelles limites et risques — avec des sources plutôt que du marketing.
75 %du nouveau code est aujourd'hui produit par l'IA, selon Google
45 %des échantillons IA échouent au test de sécurité (Veracode)
88,6 %de fausses alertes en moins par filtre LLM (QASecClaw, OWASP Benchmark)
20zero-days réels signalés par Google Big Sleep en 2025
AI SAST désigne l'usage de grands modèles de langage dans l'analyse statique du code — non comme remplacement du SAST à base de règles, mais comme seconde couche par-dessus. La motivation est double : l'IA produit aujourd'hui la majeure partie du nouveau code (Google indique 75 %) et ce code introduit mesurablement plus souvent des vulnérabilités (Veracode : 45 % des échantillons IA échouent au test de sécurité). En même temps, cette même technologie trouve des failles qu'aucun motif ne capture. Le cadre de référence vient de Wiz (« Rethinking Scanning for the AI Era », 30.07.2026) : trois couches — scan de base déterministe, raisonnement IA continu et deep testing agentique ciblé. Cette page situe les capacités prouvées, le paysage réel d'outils et les nouveaux risques — en séparant systématiquement sources primaires et claims d'éditeurs.
L'essentiel en un coup d'œil
Neuf blocs thématiques — appuyez pour les déplier.
Quatre domaines d'application prouvés
Du tri aux agents de code relecteurs — chaque onglet condense les capacités prouvées. Appuyez sur un onglet.
- L'usage le plus mûr n'est pas de trouver mais de trier : un filtre LLM derrière un scanner déterministe réduit les fausses alertes de façon cohérente sur plusieurs études indépendantes.
- QASecClaw : 88,6 % sur l'OWASP Benchmark à 3,1 % de perte de rappel ; « Sifting the Noise » : jusqu'à 93,3 % sur de vraies alertes CodeQL ; SAST-Genius : environ 91 % (225 à 20 findings).
- C'est là que se situe le levier économique — l'alert fatigue est la première cause d'échec des programmes SAST.
Filtre LLMQASecClawOWASP BenchmarkCodeQLSAST-GeniusAlert fatigue
- Au niveau 2, le modèle construit d'abord une compréhension de l'application, formule des hypothèses d'attaque et les teste au-delà des frontières de fichiers et de fonctions — « comme un chercheur en sécurité ».
- L'approche neuro-symbolique IRIS (le LLM infère les spécifications de taint, CodeQL exécute l'analyse) a trouvé 55 vulnérabilités au lieu de 27 sur CWE-Bench-Java, dont quatre inconnues.
- L'étude riche en contexte CORRECT le montre : le contexte du dépôt est le levier décisif.
IRISSpécifications de taintCodeQLCWE-Bench-JavaCORRECTContexte du dépôt
- Google Big Sleep a signalé vingt zero-days réels en 2025 et a empêché une attaque pour la première fois (CVE-2025-6965).
- Les finalistes du DARPA AIxCC ont trouvé de façon autonome 86 % des vulnérabilités injectées en août 2025, à environ 152 dollars par tâche ; Wiz Atlas dépasse 90 % sur le benchmark CyberGym et plus de 200 vulnérabilités inconnues.
- En 2026, même un modèle open-weight (Kimi K2.5) a trouvé, via un harnais d'agents synthétisé, dix zero-days dans Google Chrome.
Big SleepCVE-2025-6965DARPA AIxCCWiz AtlasCyberGymKimi K2.5
- Les grands assistants de code intègrent la revue de sécurité : Claude Code Security Review d'Anthropic (open source, MIT, diff-aware) et GitHub Copilot Code Review (plus de 60 M de revues, 71 % avec retour actionnable).
- OpenAI Codex Security traite plus de 100 000 PR externes par jour (précision avant rappel) ; Cursor Bugbot combine 8 passes parallèles et vote majoritaire contre le non-déterminisme (70 %+ de résolution).
- Tous documentent explicitement le risque d'hallucination et l'obligation de relecture.
Claude Code Security ReviewCopilot Code ReviewCodex SecurityCursor BugbotVote majoritaireDiff-aware
Notre solution · AI SAST en production
VamiAppSec : six scanners, un backlog, un tri par IA
Le schéma d'exploitation exact de cette page — le scanner déterministe trouve, le LLM trie et contextualise, l'humain décide — est intégré à notre plateforme VamiAppSec. Elle orchestre Semgrep, Gitleaks, Checkov, Syft/Grype et le Claude Code Security Reviewer dans un pipeline, normalise tous les findings et enrichit chaque résultat par LLM : contexte, évaluation d'exploitabilité et proposition de correctif. Traçable et déployable dans votre propre datacenter.
6+scanners dans un pipeline
−54 %temps de tri médian
93 %doublons éliminés
24 hjusqu'à la mise en service
- LLM comme filtre DERRIÈRE le scanner déterministe — pas un remplacement aveugle
- Self-hosted ou SaaS : sur demande, le code ne quitte jamais votre infrastructure
- En conseil : architecture de scanning, calibrage, validation d'exploitabilité
Chiffres issus de nos propres mesures par rapport à la sortie brute des scanners ; détails sur vamiappsec.com.
Normes & sources
Le contenu de cette page s'appuie sur les guides et études suivants, accessibles publiquement.
Rethinking Scanning for the AI Era: Wiz's Agentic Code Security System
Le modèle à trois niveaux (base / raisonnement IA continu / deep testing agentique) et la productisation d'Atlas comme moteur d'analyse profonde ; thèse « Deep scanning everywhere doesn't scale ».
Introducing Atlas: Wiz's AI vulnerability researcher
Plus de 90 % de réussite sur CyberGym et plus de 200 vulnérabilités inconnues ; système multi-modèles orchestré.
IRIS: LLM-Assisted Static Analysis (ICLR 2025)
Neuro-symbolique : le LLM infère les specs de taint, CodeQL analyse. 55 vulnérabilités au lieu de 27 sur CWE-Bench-Java face à CodeQL seul, quatre inconnues trouvées.
Everything You Wanted to Know About LLM-based Vulnerability Detection (CORRECT)
2 000 paires vulnérable-patché sur 99 CWE, 13 LLM : le contexte du dépôt est le levier décisif ; l'essentiel des fausses alertes vient d'erreurs de raisonnement.
LLMs Cannot Reliably Identify and Reason About Security Vulnerabilities (Yet?) (IEEE S&P 2024)
SecLLMHolmes : le simple renommage de fonctions/variables inverse les verdicts (PaLM2 26 %, GPT-4 17 %) ; sorties non déterministes et raisonnement peu fiable.
Defeating Nondeterminism in LLM Inference
Aucune reproductibilité même à température 0 : 80 résultats différents pour 1 000 requêtes identiques ; cause : absence d'invariance par batch.
ALIBI: Adversarial comments defeat LLM vulnerability detectors
Des commentaires trompeurs sans changement de comportement atteignent plus de 90 % d'évasion (100 % sur un système) contre quatre détecteurs LLM.
ZeroDayBench (ICLR 2026 Workshop)
Reality-check : sur des zero-days portés et inédits, les modèles frontière échouent encore à trouver et corriger de façon autonome.
Claude Code Security Review (GitHub Action, open source)
Licence MIT, diff-aware, agnostique au langage ; filtre activement les classes propices aux FP pour réduire le bruit.
60 million Copilot code reviews and counting
Plus de 60 M de revues, 71 % avec retour actionnable ; architecture agentique et modèle de raisonnement améliorent le retour.
A Practical Approach to Verifying Code at Scale
Le relecteur Codex traite plus de 100 000 PR externes par jour ; précision avant rappel ; accès dépôt + exécution du code améliorent la qualité.
Building a better Bugbot
Ingénierie explicite contre le non-déterminisme LLM : 8 passes parallèles à ordre de diff permuté, vote majoritaire, validateur en aval ; taux de résolution porté de 52 % à plus de 70 %.
Semgrep Assistant : 60 % d'auto-tri, 96 % d'accord
Motif basé sur la confiance : LLM comme fournisseur de contexte derrière le moteur déterministe ; 60 % d'auto-tri, 96 % d'accord (chiffre éditeur).
An LLM Engineer's Review of AI SAST Tools
Test indépendant de six produits AI SAST : force sur les failles de logique/autorisation confirmée, mais larges écarts de fausses alertes — correctif aux claims d'éditeurs.
Responsible use of Copilot Autofix / Code Review
Guidance de gouvernance : risque d'hallucination, non-déterminisme, obligation de relecture humaine ; évaluation sur plusieurs exécutions indépendantes.
NIST AI 100-2e2025 : Adversarial Machine Learning — Taxonomie
Définit l'injection directe et indirecte comme classes d'attaque GenAI ; l'injection indirecte via contenu récupéré (README/commentaires) s'applique aux agents d'analyse.
Introduire l'AI SAST — avec des preuves, pas au feeling ?
Lors d'un premier échange sans engagement, nous déterminons où le tri par LLM a le plus de levier chez vous, quelle couche tourne sur quel dépôt et comment gouverner les findings IA sans perdre la reproductibilité.