Prendre rendez-vous

AI SAST – l'analyse de code qui raisonne sur l'intention

Les modèles de langage trient les findings, raisonnent sémantiquement au-delà des frontières de fonctions et trouvent de vrais zero-days. Ce qui en est prouvé, quels outils existent en 2026 et où se situent les nouvelles limites et risques — avec des sources plutôt que du marketing.

AI SAST désigne l'usage de grands modèles de langage dans l'analyse statique du code — non comme remplacement du SAST à base de règles, mais comme seconde couche par-dessus. La motivation est double : l'IA produit aujourd'hui la majeure partie du nouveau code (Google indique 75 %) et ce code introduit mesurablement plus souvent des vulnérabilités (Veracode : 45 % des échantillons IA échouent au test de sécurité). En même temps, cette même technologie trouve des failles qu'aucun motif ne capture. Le cadre de référence vient de Wiz (« Rethinking Scanning for the AI Era », 30.07.2026) : trois couches — scan de base déterministe, raisonnement IA continu et deep testing agentique ciblé. Cette page situe les capacités prouvées, le paysage réel d'outils et les nouveaux risques — en séparant systématiquement sources primaires et claims d'éditeurs.

L'essentiel en un coup d'œil

01

Le modèle à trois niveaux (Wiz)

Wiz décrit l'AI SAST non comme un modèle unique mais comme un système multi-moteurs conscient du contexte. Niveau 1 : scan de base déterministe par signatures — rapide, économique, avant chaque merge. Niveau 2 : raisonnement IA continu sur chaque pull request, comprenant structure applicative, trust boundaries et flux de données. Niveau 3 : pentesting agentique ciblé, réservé aux applications à forte valeur. Thèse centrale : « Deep scanning everywhere doesn't scale » — l'analyse frontière est coûteuse et ponctuelle alors que le code change toutes les heures.

02

Le tri : le bénéfice le mieux prouvé

L'usage le plus mûr n'est pas de trouver mais de trier. Un filtre LLM derrière un scanner déterministe réduit les fausses alertes de façon cohérente sur plusieurs études indépendantes : QASecClaw 88,6 % sur l'OWASP Benchmark à 3,1 % de perte de rappel, « Sifting the Noise » jusqu'à 93,3 % sur de vraies alertes CodeQL, SAST-Genius environ 91 % (225 à 20 findings). C'est là que se situe le levier économique, car l'alert fatigue est la première cause d'échec des programmes SAST.

03

Raisonnement sémantique plutôt que motifs

Au niveau 2, le modèle construit d'abord une compréhension de l'application, formule des hypothèses d'attaque et les teste au-delà des frontières de fichiers et de fonctions — « comme un chercheur en sécurité ». L'approche neuro-symbolique IRIS (le LLM infère les spécifications de taint, CodeQL exécute l'analyse) a trouvé 55 vulnérabilités au lieu de 27 sur CWE-Bench-Java face à CodeQL seul, dont quatre inconnues. L'étude riche en contexte CORRECT le montre : le contexte du dépôt est le levier décisif.

Bases : le SAST classique
04

Recherche autonome de vulnérabilités

La découverte elle-même devient une commodité : Google Big Sleep a signalé vingt zero-days réels en 2025 et a empêché une attaque pour la première fois (CVE-2025-6965). Les finalistes du DARPA AIxCC ont trouvé de façon autonome 86 % des vulnérabilités injectées en août 2025, à environ 152 dollars par tâche. Wiz Atlas dépasse 90 % sur le benchmark CyberGym et plus de 200 vulnérabilités inconnues. En 2026, même un modèle open-weight (Kimi K2.5) a trouvé, via un harnais d'agents synthétisé, dix zero-days dans Google Chrome.

Conseil : AI Code Security
05

Les agents de code comme relecteurs

Les grands assistants de code intègrent la revue de sécurité : Claude Code Security Review d'Anthropic (open source, MIT, diff-aware, filtre activement les classes propices aux FP), GitHub Copilot Code Review (plus de 60 M de revues, 71 % avec retour actionnable), OpenAI Codex Security (plus de 100 000 PR externes par jour, précision avant rappel), Cursor Bugbot (8 passes parallèles plus vote majoritaire contre le non-déterminisme, 70 %+ de résolution). Tous documentent explicitement le risque d'hallucination et l'obligation de relecture.

06

Éditeurs de SAST IA-natif

À côté des acteurs établis (Checkmarx, Veracode Fix, Snyk Agent Fix à 85 % de taux secure-and-functional, Sonar, GitLab Duo), une classe d'outils IA-natifs a émergé : ZeroPath, Corgea, DryRun, Amplify, Almanax. Un test indépendant de pentester (Joshua Rogers, 09/2025) confirme leur force sur les failles de logique et d'autorisation, mais mesure de larges écarts : Corgea environ 80 % de détection à ~50 % de fausses alertes, d'autres majoritairement des fausses alertes. Les benchmarks d'éditeurs (« 100 % de détection ») méritent un contre-contrôle.

07

Limite 1 — le non-déterminisme

Les verdicts des LLM varient d'une exécution à l'autre, par principe : même à température 0, les sorties ne sont pas reproductibles car l'inférence n'est pas invariante par batch (Thinking Machines : 80 résultats différents pour 1 000 requêtes identiques). Pour un gate de conformité, cela signifie que la base reproductible doit venir du niveau 1 ; les findings IA exigent une piste d'audit et des contrôles humains, pas une automatisation aveugle. GitHub et GitLab l'inscrivent dans leur documentation.

08

Limite 2 — l'analyste devient une cible

Un modèle qui lit le contenu d'un dépôt traite comme entrée les instructions des commentaires, README et issues. C'est exploitable : des commentaires adverses trompent les détecteurs LLM dans plus de 90 % des cas (framework ALIBI), et le seul framing supprime jusqu'à 97 % des vulnérabilités détectées. Les incidents réels vont de CVE-2025-53773 (RCE Copilot par prompt injection) à une RCE sur les serveurs de CodeRabbit avec accès en écriture à un million de dépôts. Le NIST classe l'injection indirecte comme une classe d'attaque à part entière.

09

Le reality-check honnête

Toutes les annonces de succès ne résistent pas à l'examen. Sur des zero-days vraiment inédits (ZeroDayBench, CVE portés dans des dépôts étrangers), même les modèles frontière échouent encore à trouver et corriger de façon autonome. La classification LLM naïve sans contexte plafonne à une balanced accuracy de 0,50 à 0,55 — à peine mieux qu'un pile ou face. Et la contamination des benchmarks reste une réserve, même si elle n'est pas le moteur principal sur les benchmarks de vulnérabilités réelles. D'où : l'IA complète les couches, elle ne les remplace pas.

Notre solution · AI SAST en production

VamiAppSec : six scanners, un backlog, un tri par IA

Le schéma d'exploitation exact de cette page — le scanner déterministe trouve, le LLM trie et contextualise, l'humain décide — est intégré à notre plateforme VamiAppSec. Elle orchestre Semgrep, Gitleaks, Checkov, Syft/Grype et le Claude Code Security Reviewer dans un pipeline, normalise tous les findings et enrichit chaque résultat par LLM : contexte, évaluation d'exploitabilité et proposition de correctif. Traçable et déployable dans votre propre datacenter.

6+scanners dans un pipeline
−54 %temps de tri médian
93 %doublons éliminés
24 hjusqu'à la mise en service
  • LLM comme filtre DERRIÈRE le scanner déterministe — pas un remplacement aveugle
  • Self-hosted ou SaaS : sur demande, le code ne quitte jamais votre infrastructure
  • En conseil : architecture de scanning, calibrage, validation d'exploitabilité

Chiffres issus de nos propres mesures par rapport à la sortie brute des scanners ; détails sur vamiappsec.com.

Normes & sources

Le contenu de cette page s'appuie sur les guides et études suivants, accessibles publiquement.

Wiz (Amir Lande Blau) · 2026

Rethinking Scanning for the AI Era: Wiz's Agentic Code Security System

Le modèle à trois niveaux (base / raisonnement IA continu / deep testing agentique) et la productisation d'Atlas comme moteur d'analyse profonde ; thèse « Deep scanning everywhere doesn't scale ».

Wiz · 2026

Introducing Atlas: Wiz's AI vulnerability researcher

Plus de 90 % de réussite sur CyberGym et plus de 200 vulnérabilités inconnues ; système multi-modèles orchestré.

arXiv:2405.17238 · 2025

IRIS: LLM-Assisted Static Analysis (ICLR 2025)

Neuro-symbolique : le LLM infère les specs de taint, CodeQL analyse. 55 vulnérabilités au lieu de 27 sur CWE-Bench-Java face à CodeQL seul, quatre inconnues trouvées.

arXiv:2504.13474 · 2025

Everything You Wanted to Know About LLM-based Vulnerability Detection (CORRECT)

2 000 paires vulnérable-patché sur 99 CWE, 13 LLM : le contexte du dépôt est le levier décisif ; l'essentiel des fausses alertes vient d'erreurs de raisonnement.

arXiv:2312.12575 · 2024

LLMs Cannot Reliably Identify and Reason About Security Vulnerabilities (Yet?) (IEEE S&P 2024)

SecLLMHolmes : le simple renommage de fonctions/variables inverse les verdicts (PaLM2 26 %, GPT-4 17 %) ; sorties non déterministes et raisonnement peu fiable.

Thinking Machines Lab · 2025

Defeating Nondeterminism in LLM Inference

Aucune reproductibilité même à température 0 : 80 résultats différents pour 1 000 requêtes identiques ; cause : absence d'invariance par batch.

arXiv:2607.24964 · 2026

ALIBI: Adversarial comments defeat LLM vulnerability detectors

Des commentaires trompeurs sans changement de comportement atteignent plus de 90 % d'évasion (100 % sur un système) contre quatre détecteurs LLM.

arXiv:2603.02297 · 2026

ZeroDayBench (ICLR 2026 Workshop)

Reality-check : sur des zero-days portés et inédits, les modèles frontière échouent encore à trouver et corriger de façon autonome.

Anthropic · 2025

Claude Code Security Review (GitHub Action, open source)

Licence MIT, diff-aware, agnostique au langage ; filtre activement les classes propices aux FP pour réduire le bruit.

GitHub · 2026

60 million Copilot code reviews and counting

Plus de 60 M de revues, 71 % avec retour actionnable ; architecture agentique et modèle de raisonnement améliorent le retour.

OpenAI Alignment · 2025

A Practical Approach to Verifying Code at Scale

Le relecteur Codex traite plus de 100 000 PR externes par jour ; précision avant rappel ; accès dépôt + exécution du code améliorent la qualité.

Cursor · 2026

Building a better Bugbot

Ingénierie explicite contre le non-déterminisme LLM : 8 passes parallèles à ordre de diff permuté, vote majoritaire, validateur en aval ; taux de résolution porté de 52 % à plus de 70 %.

Semgrep · 2025

Semgrep Assistant : 60 % d'auto-tri, 96 % d'accord

Motif basé sur la confiance : LLM comme fournisseur de contexte derrière le moteur déterministe ; 60 % d'auto-tri, 96 % d'accord (chiffre éditeur).

Joshua Rogers · 2025

An LLM Engineer's Review of AI SAST Tools

Test indépendant de six produits AI SAST : force sur les failles de logique/autorisation confirmée, mais larges écarts de fausses alertes — correctif aux claims d'éditeurs.

GitHub Docs · 2026

Responsible use of Copilot Autofix / Code Review

Guidance de gouvernance : risque d'hallucination, non-déterminisme, obligation de relecture humaine ; évaluation sur plusieurs exécutions indépendantes.

NIST · 2025

NIST AI 100-2e2025 : Adversarial Machine Learning — Taxonomie

Définit l'injection directe et indirecte comme classes d'attaque GenAI ; l'injection indirecte via contenu récupéré (README/commentaires) s'applique aux agents d'analyse.

Introduire l'AI SAST — avec des preuves, pas au feeling ?

Lors d'un premier échange sans engagement, nous déterminons où le tri par LLM a le plus de levier chez vous, quelle couche tourne sur quel dépôt et comment gouverner les findings IA sans perdre la reproductibilité.