Prendre rendez-vous

AI SAST – l'analyse de code qui raisonne sur l'intention

Les modèles de langage trient les findings, raisonnent sémantiquement au-delà des frontières de fonctions et trouvent de vrais zero-days. Ce qui en est prouvé, quels outils existent en 2026 et où se situent les nouvelles limites et risques — avec des sources plutôt que du marketing.

Mise à jour: août 2026 · Valeri Milke, Lead Auditor ISO 27001 & ISO 42001

75 %du nouveau code est aujourd'hui produit par l'IA, selon Google
45 %des échantillons IA échouent au test de sécurité (Veracode)
88,6 %de fausses alertes en moins par filtre LLM (QASecClaw, OWASP Benchmark)
20zero-days réels signalés par Google Big Sleep en 2025

AI SAST désigne l'usage de grands modèles de langage dans l'analyse statique du code — non comme remplacement du SAST à base de règles, mais comme seconde couche par-dessus. La motivation est double : l'IA produit aujourd'hui la majeure partie du nouveau code (Google indique 75 %) et ce code introduit mesurablement plus souvent des vulnérabilités (Veracode : 45 % des échantillons IA échouent au test de sécurité). En même temps, cette même technologie trouve des failles qu'aucun motif ne capture. Le cadre de référence vient de Wiz (« Rethinking Scanning for the AI Era », 30.07.2026) : trois couches — scan de base déterministe, raisonnement IA continu et deep testing agentique ciblé. Cette page situe les capacités prouvées, le paysage réel d'outils et les nouveaux risques — en séparant systématiquement sources primaires et claims d'éditeurs.

L'essentiel en un coup d'œil

Neuf blocs thématiques — appuyez pour les déplier.

Quatre domaines d'application prouvés

Du tri aux agents de code relecteurs — chaque onglet condense les capacités prouvées. Appuyez sur un onglet.

Le mieux prouvé
  • L'usage le plus mûr n'est pas de trouver mais de trier : un filtre LLM derrière un scanner déterministe réduit les fausses alertes de façon cohérente sur plusieurs études indépendantes.
  • QASecClaw : 88,6 % sur l'OWASP Benchmark à 3,1 % de perte de rappel ; « Sifting the Noise » : jusqu'à 93,3 % sur de vraies alertes CodeQL ; SAST-Genius : environ 91 % (225 à 20 findings).
  • C'est là que se situe le levier économique — l'alert fatigue est la première cause d'échec des programmes SAST.
Filtre LLMQASecClawOWASP BenchmarkCodeQLSAST-GeniusAlert fatigue
Notre solution · AI SAST en production

VamiAppSec : six scanners, un backlog, un tri par IA

Le schéma d'exploitation exact de cette page — le scanner déterministe trouve, le LLM trie et contextualise, l'humain décide — est intégré à notre plateforme VamiAppSec. Elle orchestre Semgrep, Gitleaks, Checkov, Syft/Grype et le Claude Code Security Reviewer dans un pipeline, normalise tous les findings et enrichit chaque résultat par LLM : contexte, évaluation d'exploitabilité et proposition de correctif. Traçable et déployable dans votre propre datacenter.

6+scanners dans un pipeline
−54 %temps de tri médian
93 %doublons éliminés
24 hjusqu'à la mise en service
  • LLM comme filtre DERRIÈRE le scanner déterministe — pas un remplacement aveugle
  • Self-hosted ou SaaS : sur demande, le code ne quitte jamais votre infrastructure
  • En conseil : architecture de scanning, calibrage, validation d'exploitabilité

Chiffres issus de nos propres mesures par rapport à la sortie brute des scanners ; détails sur vamiappsec.com.

Normes & sources

Le contenu de cette page s'appuie sur les guides et études suivants, accessibles publiquement.

Wiz (Amir Lande Blau) · 2026

Rethinking Scanning for the AI Era: Wiz's Agentic Code Security System

Le modèle à trois niveaux (base / raisonnement IA continu / deep testing agentique) et la productisation d'Atlas comme moteur d'analyse profonde ; thèse « Deep scanning everywhere doesn't scale ».

Wiz · 2026

Introducing Atlas: Wiz's AI vulnerability researcher

Plus de 90 % de réussite sur CyberGym et plus de 200 vulnérabilités inconnues ; système multi-modèles orchestré.

arXiv:2405.17238 · 2025

IRIS: LLM-Assisted Static Analysis (ICLR 2025)

Neuro-symbolique : le LLM infère les specs de taint, CodeQL analyse. 55 vulnérabilités au lieu de 27 sur CWE-Bench-Java face à CodeQL seul, quatre inconnues trouvées.

arXiv:2504.13474 · 2025

Everything You Wanted to Know About LLM-based Vulnerability Detection (CORRECT)

2 000 paires vulnérable-patché sur 99 CWE, 13 LLM : le contexte du dépôt est le levier décisif ; l'essentiel des fausses alertes vient d'erreurs de raisonnement.

arXiv:2312.12575 · 2024

LLMs Cannot Reliably Identify and Reason About Security Vulnerabilities (Yet?) (IEEE S&P 2024)

SecLLMHolmes : le simple renommage de fonctions/variables inverse les verdicts (PaLM2 26 %, GPT-4 17 %) ; sorties non déterministes et raisonnement peu fiable.

Thinking Machines Lab · 2025

Defeating Nondeterminism in LLM Inference

Aucune reproductibilité même à température 0 : 80 résultats différents pour 1 000 requêtes identiques ; cause : absence d'invariance par batch.

arXiv:2607.24964 · 2026

ALIBI: Adversarial comments defeat LLM vulnerability detectors

Des commentaires trompeurs sans changement de comportement atteignent plus de 90 % d'évasion (100 % sur un système) contre quatre détecteurs LLM.

arXiv:2603.02297 · 2026

ZeroDayBench (ICLR 2026 Workshop)

Reality-check : sur des zero-days portés et inédits, les modèles frontière échouent encore à trouver et corriger de façon autonome.

Anthropic · 2025

Claude Code Security Review (GitHub Action, open source)

Licence MIT, diff-aware, agnostique au langage ; filtre activement les classes propices aux FP pour réduire le bruit.

GitHub · 2026

60 million Copilot code reviews and counting

Plus de 60 M de revues, 71 % avec retour actionnable ; architecture agentique et modèle de raisonnement améliorent le retour.

OpenAI Alignment · 2025

A Practical Approach to Verifying Code at Scale

Le relecteur Codex traite plus de 100 000 PR externes par jour ; précision avant rappel ; accès dépôt + exécution du code améliorent la qualité.

Cursor · 2026

Building a better Bugbot

Ingénierie explicite contre le non-déterminisme LLM : 8 passes parallèles à ordre de diff permuté, vote majoritaire, validateur en aval ; taux de résolution porté de 52 % à plus de 70 %.

Semgrep · 2025

Semgrep Assistant : 60 % d'auto-tri, 96 % d'accord

Motif basé sur la confiance : LLM comme fournisseur de contexte derrière le moteur déterministe ; 60 % d'auto-tri, 96 % d'accord (chiffre éditeur).

Joshua Rogers · 2025

An LLM Engineer's Review of AI SAST Tools

Test indépendant de six produits AI SAST : force sur les failles de logique/autorisation confirmée, mais larges écarts de fausses alertes — correctif aux claims d'éditeurs.

GitHub Docs · 2026

Responsible use of Copilot Autofix / Code Review

Guidance de gouvernance : risque d'hallucination, non-déterminisme, obligation de relecture humaine ; évaluation sur plusieurs exécutions indépendantes.

NIST · 2025

NIST AI 100-2e2025 : Adversarial Machine Learning — Taxonomie

Définit l'injection directe et indirecte comme classes d'attaque GenAI ; l'injection indirecte via contenu récupéré (README/commentaires) s'applique aux agents d'analyse.

Introduire l'AI SAST — avec des preuves, pas au feeling ?

Lors d'un premier échange sans engagement, nous déterminons où le tri par LLM a le plus de levier chez vous, quelle couche tourne sur quel dépôt et comment gouverner les findings IA sans perdre la reproductibilité.