Wiz describe AI SAST no como un modelo único, sino como un sistema multi-motor consciente del contexto. Nivel 1: escaneo base determinista por firmas — rápido, barato, antes de cada merge. Nivel 2: razonamiento de IA continuo en cada pull request, que entiende la estructura de la aplicación, los trust boundaries y los flujos de datos. Nivel 3: pentesting agéntico dirigido, solo para aplicaciones de alto valor. Tesis central: «Deep scanning everywhere doesn't scale» — el análisis frontier es caro y puntual mientras el código cambia cada hora.
AI SAST – análisis de código que razona sobre la intención
Los modelos de lenguaje trían hallazgos, razonan semánticamente más allá de los límites de las funciones y encuentran zero-days reales. Qué está probado, qué herramientas existen en 2026 y dónde están los nuevos límites y riesgos — con fuentes en lugar de marketing.
75 %del código nuevo lo produce hoy la IA, según Google
45 %de las muestras de IA suspende la prueba de seguridad (Veracode)
88,6 %menos falsas alarmas con filtro LLM (QASecClaw, OWASP Benchmark)
20zero-days reales reportó Google Big Sleep en 2025
AI SAST designa el uso de grandes modelos de lenguaje en el análisis estático de código — no como sustituto del SAST basado en reglas, sino como segunda capa por encima. La motivación es doble: la IA produce hoy la mayor parte del código nuevo (Google indica un 75 %) y ese código introduce medibemente más vulnerabilidades (Veracode: el 45 % de las muestras de IA suspende la prueba de seguridad). Al mismo tiempo, esa misma tecnología encuentra fallos que ningún patrón captura. El marco de referencia viene de Wiz («Rethinking Scanning for the AI Era», 30.07.2026): tres capas — escaneo base determinista, razonamiento de IA continuo y deep testing agéntico dirigido. Esta página sitúa las capacidades probadas, el panorama real de herramientas y los nuevos riesgos — separando sistemáticamente fuentes primarias de afirmaciones de fabricante.
Lo esencial en resumen
Nueve bloques temáticos — toca para desplegar.
Cuatro campos de aplicación probados
Del triaje a los agentes de código como revisores — cada pestaña condensa las capacidades probadas. Toca una pestaña.
- El uso más maduro no es encontrar, sino descartar: un filtro LLM detrás de un escáner determinista reduce las falsas alarmas de forma consistente en varios estudios independientes.
- QASecClaw: 88,6 % en el OWASP Benchmark con 3,1 % de pérdida de recall; «Sifting the Noise»: hasta 93,3 % en alertas reales de CodeQL; SAST-Genius: alrededor del 91 % (225 a 20 hallazgos).
- Ahí está la palanca económica — la fatiga de alertas es la causa más frecuente del fracaso de los programas SAST.
Filtro LLMQASecClawOWASP BenchmarkCodeQLSAST-GeniusFatiga de alertas
- En el nivel 2, el modelo construye primero una comprensión de la aplicación, formula hipótesis de ataque y las prueba más allá de los límites de archivos y funciones — «como un investigador de seguridad».
- El enfoque neuro-simbólico IRIS (el LLM infiere las especificaciones de taint, CodeQL ejecuta el análisis) encontró 55 vulnerabilidades en lugar de 27 en CWE-Bench-Java, cuatro de ellas desconocidas.
- El estudio rico en contexto CORRECT lo demuestra: el contexto del repositorio es la palanca decisiva.
IRISEspecificaciones de taintCodeQLCWE-Bench-JavaCORRECTContexto del repositorio
- Google Big Sleep reportó veinte zero-days reales en 2025 e impidió un ataque por primera vez (CVE-2025-6965).
- Los finalistas del DARPA AIxCC encontraron de forma autónoma el 86 % de las vulnerabilidades inyectadas en agosto de 2025, a unos 152 dólares por tarea; Wiz Atlas supera el 90 % en el benchmark CyberGym y más de 200 vulnerabilidades desconocidas.
- En 2026, incluso un modelo open-weight (Kimi K2.5) encontró, mediante un harness de agentes sintetizado, diez zero-days en Google Chrome.
Big SleepCVE-2025-6965DARPA AIxCCWiz AtlasCyberGymKimi K2.5
- Los grandes asistentes de código integran la revisión de seguridad: Claude Code Security Review de Anthropic (open source, MIT, diff-aware) y GitHub Copilot Code Review (más de 60 M de revisiones, 71 % con feedback accionable).
- OpenAI Codex Security procesa más de 100.000 PR externos al día (precisión antes que recall); Cursor Bugbot combina 8 pasadas paralelas y voto mayoritario contra el no-determinismo (70 %+ de resolución).
- Todos documentan explícitamente el riesgo de alucinación y el deber de revisión.
Claude Code Security ReviewCopilot Code ReviewCodex SecurityCursor BugbotVoto mayoritarioDiff-aware
Nuestra solución · AI SAST en operación
VamiAppSec: seis escáneres, un backlog, triaje con IA
El patrón operativo exacto de esta página — el escáner determinista encuentra, el LLM tría y contextualiza, el humano decide — está integrado en nuestra plataforma VamiAppSec. Orquesta Semgrep, Gitleaks, Checkov, Syft/Grype y el Claude Code Security Reviewer en un pipeline, normaliza todos los hallazgos y enriquece cada uno con un LLM: contexto, evaluación de explotabilidad y propuesta de parche. Trazable y desplegable en su propio centro de datos.
6+escáneres en un pipeline
−54 %tiempo mediano de triaje
93 %duplicados eliminados
24 hhasta la puesta en marcha
- LLM como filtro DETRÁS del escáner determinista — no un sustituto ciego
- Self-hosted o SaaS: si lo desea, el código nunca sale de su infraestructura
- Con consultoría: arquitectura de escaneo, calibración, validación de explotabilidad
Cifras de mediciones propias frente a la salida bruta de los escáneres; detalles en vamiappsec.com.
Estándares y fuentes
Los contenidos de esta página se basan en las siguientes guías y estudios disponibles públicamente.
Rethinking Scanning for the AI Era: Wiz's Agentic Code Security System
El modelo de tres niveles (base / razonamiento de IA continuo / deep testing agéntico) y la productización de Atlas como motor de análisis profundo; tesis «Deep scanning everywhere doesn't scale».
Introducing Atlas: Wiz's AI vulnerability researcher
Más del 90 % de éxito en CyberGym y más de 200 vulnerabilidades desconocidas; sistema multi-modelo orquestado.
IRIS: LLM-Assisted Static Analysis (ICLR 2025)
Neuro-simbólico: el LLM infiere specs de taint, CodeQL analiza. 55 vulnerabilidades en vez de 27 en CWE-Bench-Java frente a CodeQL solo, cuatro desconocidas encontradas.
Everything You Wanted to Know About LLM-based Vulnerability Detection (CORRECT)
2.000 pares vulnerable-parcheado sobre 99 CWE, 13 LLM: el contexto del repositorio es la palanca decisiva; la mayoría de las falsas alarmas vienen de errores de razonamiento.
LLMs Cannot Reliably Identify and Reason About Security Vulnerabilities (Yet?) (IEEE S&P 2024)
SecLLMHolmes: el mero renombrado de funciones/variables invierte veredictos (PaLM2 26 %, GPT-4 17 %); salidas no deterministas y razonamiento poco fiable.
Defeating Nondeterminism in LLM Inference
Sin reproducibilidad ni a temperatura 0: 80 resultados distintos de 1.000 peticiones idénticas; causa: falta de invariancia por lote.
ALIBI: Adversarial comments defeat LLM vulnerability detectors
Comentarios engañosos sin cambio de comportamiento logran más del 90 % de evasión (100 % en un sistema) frente a cuatro detectores LLM.
ZeroDayBench (ICLR 2026 Workshop)
Reality-check: en zero-days portados e inéditos, los modelos frontier aún fallan en encontrar y parchear de forma autónoma.
Claude Code Security Review (GitHub Action, open source)
Licencia MIT, diff-aware, agnóstico al lenguaje; filtra activamente clases propensas a FP para reducir el ruido.
60 million Copilot code reviews and counting
Más de 60 M de revisiones, 71 % con feedback accionable; arquitectura agéntica y modelo de razonamiento mejoran el feedback.
A Practical Approach to Verifying Code at Scale
El revisor Codex comprueba más de 100.000 PR externos al día; precisión antes que recall; acceso al repo + ejecución del código elevan la calidad.
Building a better Bugbot
Ingeniería explícita contra el no-determinismo LLM: 8 pasadas paralelas con orden de diff permutado, voto mayoritario, validador posterior; resolución del 52 % a más del 70 %.
Semgrep Assistant: 60 % de auto-triaje, 96 % de acuerdo
Patrón basado en confianza: LLM como proveedor de contexto detrás del motor determinista; 60 % de auto-triaje, 96 % de acuerdo (cifra de fabricante).
An LLM Engineer's Review of AI SAST Tools
Prueba independiente de seis productos AI SAST: fuerza en fallos de lógica/autorización confirmada, pero amplios rangos de falsas alarmas — correctivo a los claims de fabricante.
Responsible use of Copilot Autofix / Code Review
Guía de gobernanza: riesgo de alucinación, no-determinismo, deber de revisión humana; evaluación con varias ejecuciones independientes.
NIST AI 100-2e2025: Adversarial Machine Learning — Taxonomía
Define la inyección directa e indirecta como clases de ataque GenAI; la inyección indirecta vía contenido recuperado (README/comentarios) aplica a los agentes de análisis.
¿Implantar AI SAST — con evidencia, no por intuición?
En una primera conversación sin compromiso definimos dónde tiene más palanca el triaje con LLM en su caso, qué capa corre en qué repositorio y cómo gobernar los hallazgos de IA sin perder la reproducibilidad.