Reservar cita

AI SAST – análisis de código que razona sobre la intención

Los modelos de lenguaje trían hallazgos, razonan semánticamente más allá de los límites de las funciones y encuentran zero-days reales. Qué está probado, qué herramientas existen en 2026 y dónde están los nuevos límites y riesgos — con fuentes en lugar de marketing.

AI SAST designa el uso de grandes modelos de lenguaje en el análisis estático de código — no como sustituto del SAST basado en reglas, sino como segunda capa por encima. La motivación es doble: la IA produce hoy la mayor parte del código nuevo (Google indica un 75 %) y ese código introduce medibemente más vulnerabilidades (Veracode: el 45 % de las muestras de IA suspende la prueba de seguridad). Al mismo tiempo, esa misma tecnología encuentra fallos que ningún patrón captura. El marco de referencia viene de Wiz («Rethinking Scanning for the AI Era», 30.07.2026): tres capas — escaneo base determinista, razonamiento de IA continuo y deep testing agéntico dirigido. Esta página sitúa las capacidades probadas, el panorama real de herramientas y los nuevos riesgos — separando sistemáticamente fuentes primarias de afirmaciones de fabricante.

Lo esencial en resumen

01

El modelo de tres niveles (Wiz)

Wiz describe AI SAST no como un modelo único, sino como un sistema multi-motor consciente del contexto. Nivel 1: escaneo base determinista por firmas — rápido, barato, antes de cada merge. Nivel 2: razonamiento de IA continuo en cada pull request, que entiende la estructura de la aplicación, los trust boundaries y los flujos de datos. Nivel 3: pentesting agéntico dirigido, solo para aplicaciones de alto valor. Tesis central: «Deep scanning everywhere doesn't scale» — el análisis frontier es caro y puntual mientras el código cambia cada hora.

02

El triaje: el beneficio mejor probado

El uso más maduro no es encontrar, sino descartar. Un filtro LLM detrás de un escáner determinista reduce las falsas alarmas de forma consistente en varios estudios independientes: QASecClaw 88,6 % en el OWASP Benchmark con 3,1 % de pérdida de recall, «Sifting the Noise» hasta 93,3 % en alertas reales de CodeQL, SAST-Genius alrededor del 91 % (225 a 20 hallazgos). Ahí está la palanca económica, porque la fatiga de alertas es la causa más frecuente del fracaso de los programas SAST.

03

Razonamiento semántico en vez de patrones

En el nivel 2, el modelo construye primero una comprensión de la aplicación, formula hipótesis de ataque y las prueba más allá de los límites de archivos y funciones — «como un investigador de seguridad». El enfoque neuro-simbólico IRIS (el LLM infiere las especificaciones de taint, CodeQL ejecuta el análisis) encontró 55 vulnerabilidades en lugar de 27 en CWE-Bench-Java frente a CodeQL solo, cuatro de ellas desconocidas. El estudio rico en contexto CORRECT lo demuestra: el contexto del repositorio es la palanca decisiva.

Bases: el SAST clásico
04

Búsqueda autónoma de vulnerabilidades

El propio hallazgo se convierte en commodity: Google Big Sleep reportó veinte zero-days reales en 2025 e impidió un ataque por primera vez (CVE-2025-6965). Los finalistas del DARPA AIxCC encontraron de forma autónoma el 86 % de las vulnerabilidades inyectadas en agosto de 2025, a unos 152 dólares por tarea. Wiz Atlas supera el 90 % en el benchmark CyberGym y más de 200 vulnerabilidades desconocidas. En 2026, incluso un modelo open-weight (Kimi K2.5) encontró, mediante un harness de agentes sintetizado, diez zero-days en Google Chrome.

Consultoría: AI Code Security
05

Agentes de código como revisores

Los grandes asistentes de código integran la revisión de seguridad: Claude Code Security Review de Anthropic (open source, MIT, diff-aware, filtra activamente clases propensas a FP), GitHub Copilot Code Review (más de 60 M de revisiones, 71 % con feedback accionable), OpenAI Codex Security (más de 100.000 PR externos al día, precisión antes que recall), Cursor Bugbot (8 pasadas paralelas más voto mayoritario contra el no-determinismo, 70 %+ de resolución). Todos documentan explícitamente el riesgo de alucinación y el deber de revisión.

06

Proveedores de SAST IA-nativo

Junto a los actores establecidos (Checkmarx, Veracode Fix, Snyk Agent Fix con 85 % de tasa secure-and-functional, Sonar, GitLab Duo) ha surgido una clase propia de herramientas IA-nativas: ZeroPath, Corgea, DryRun, Amplify, Almanax. Una prueba independiente de pentester (Joshua Rogers, 09/2025) confirma su fuerza en fallos de lógica y autorización, pero mide amplios rangos: Corgea en torno al 80 % de detección con ~50 % de falsas alarmas, otros mayoritariamente falsas alarmas. Los benchmarks de fabricante («100 % de detección») merecen contraste.

07

Límite 1 — el no-determinismo

Los veredictos de los LLM varían entre ejecuciones, y por principio: incluso a temperatura 0 las salidas no son reproducibles porque la inferencia no es invariante por lote (Thinking Machines: 80 resultados distintos de 1.000 peticiones idénticas). Para un gate de cumplimiento esto significa que la base reproducible debe venir del nivel 1; los hallazgos de IA necesitan una traza de auditoría y muestreo humano, no automatización ciega. GitHub y GitLab lo escriben en su documentación de uso.

08

Límite 2 — el analista se vuelve objetivo

Un modelo que lee el contenido de un repositorio procesa como entrada las instrucciones de comentarios, README e issues. Eso es explotable: comentarios adversarios engañan a los detectores LLM en más del 90 % de los casos (framework ALIBI), y solo el framing suprime hasta el 97 % de las vulnerabilidades detectadas. Los incidentes reales van desde CVE-2025-53773 (RCE de Copilot por prompt injection) hasta una RCE en los servidores de CodeRabbit con acceso de escritura a un millón de repositorios. El NIST clasifica la inyección indirecta como su propia clase de ataque.

09

El reality-check honesto

No toda historia de éxito resiste el examen. En zero-days realmente inéditos (ZeroDayBench, CVE portados a repositorios ajenos), incluso los modelos frontier fallan aún en encontrar y parchear de forma autónoma. La clasificación LLM ingenua sin contexto se queda en una balanced accuracy de 0,50 a 0,55 — apenas por encima de una moneda al aire. Y la contaminación de benchmarks sigue siendo una reserva, aunque no sea el motor principal en los benchmarks de vulnerabilidades reales. Por eso: la IA complementa las capas, no las sustituye.

Nuestra solución · AI SAST en operación

VamiAppSec: seis escáneres, un backlog, triaje con IA

El patrón operativo exacto de esta página — el escáner determinista encuentra, el LLM tría y contextualiza, el humano decide — está integrado en nuestra plataforma VamiAppSec. Orquesta Semgrep, Gitleaks, Checkov, Syft/Grype y el Claude Code Security Reviewer en un pipeline, normaliza todos los hallazgos y enriquece cada uno con un LLM: contexto, evaluación de explotabilidad y propuesta de parche. Trazable y desplegable en su propio centro de datos.

6+escáneres en un pipeline
−54 %tiempo mediano de triaje
93 %duplicados eliminados
24 hhasta la puesta en marcha
  • LLM como filtro DETRÁS del escáner determinista — no un sustituto ciego
  • Self-hosted o SaaS: si lo desea, el código nunca sale de su infraestructura
  • Con consultoría: arquitectura de escaneo, calibración, validación de explotabilidad

Cifras de mediciones propias frente a la salida bruta de los escáneres; detalles en vamiappsec.com.

Estándares y fuentes

Los contenidos de esta página se basan en las siguientes guías y estudios disponibles públicamente.

Wiz (Amir Lande Blau) · 2026

Rethinking Scanning for the AI Era: Wiz's Agentic Code Security System

El modelo de tres niveles (base / razonamiento de IA continuo / deep testing agéntico) y la productización de Atlas como motor de análisis profundo; tesis «Deep scanning everywhere doesn't scale».

Wiz · 2026

Introducing Atlas: Wiz's AI vulnerability researcher

Más del 90 % de éxito en CyberGym y más de 200 vulnerabilidades desconocidas; sistema multi-modelo orquestado.

arXiv:2405.17238 · 2025

IRIS: LLM-Assisted Static Analysis (ICLR 2025)

Neuro-simbólico: el LLM infiere specs de taint, CodeQL analiza. 55 vulnerabilidades en vez de 27 en CWE-Bench-Java frente a CodeQL solo, cuatro desconocidas encontradas.

arXiv:2504.13474 · 2025

Everything You Wanted to Know About LLM-based Vulnerability Detection (CORRECT)

2.000 pares vulnerable-parcheado sobre 99 CWE, 13 LLM: el contexto del repositorio es la palanca decisiva; la mayoría de las falsas alarmas vienen de errores de razonamiento.

arXiv:2312.12575 · 2024

LLMs Cannot Reliably Identify and Reason About Security Vulnerabilities (Yet?) (IEEE S&P 2024)

SecLLMHolmes: el mero renombrado de funciones/variables invierte veredictos (PaLM2 26 %, GPT-4 17 %); salidas no deterministas y razonamiento poco fiable.

Thinking Machines Lab · 2025

Defeating Nondeterminism in LLM Inference

Sin reproducibilidad ni a temperatura 0: 80 resultados distintos de 1.000 peticiones idénticas; causa: falta de invariancia por lote.

arXiv:2607.24964 · 2026

ALIBI: Adversarial comments defeat LLM vulnerability detectors

Comentarios engañosos sin cambio de comportamiento logran más del 90 % de evasión (100 % en un sistema) frente a cuatro detectores LLM.

arXiv:2603.02297 · 2026

ZeroDayBench (ICLR 2026 Workshop)

Reality-check: en zero-days portados e inéditos, los modelos frontier aún fallan en encontrar y parchear de forma autónoma.

Anthropic · 2025

Claude Code Security Review (GitHub Action, open source)

Licencia MIT, diff-aware, agnóstico al lenguaje; filtra activamente clases propensas a FP para reducir el ruido.

GitHub · 2026

60 million Copilot code reviews and counting

Más de 60 M de revisiones, 71 % con feedback accionable; arquitectura agéntica y modelo de razonamiento mejoran el feedback.

OpenAI Alignment · 2025

A Practical Approach to Verifying Code at Scale

El revisor Codex comprueba más de 100.000 PR externos al día; precisión antes que recall; acceso al repo + ejecución del código elevan la calidad.

Cursor · 2026

Building a better Bugbot

Ingeniería explícita contra el no-determinismo LLM: 8 pasadas paralelas con orden de diff permutado, voto mayoritario, validador posterior; resolución del 52 % a más del 70 %.

Semgrep · 2025

Semgrep Assistant: 60 % de auto-triaje, 96 % de acuerdo

Patrón basado en confianza: LLM como proveedor de contexto detrás del motor determinista; 60 % de auto-triaje, 96 % de acuerdo (cifra de fabricante).

Joshua Rogers · 2025

An LLM Engineer's Review of AI SAST Tools

Prueba independiente de seis productos AI SAST: fuerza en fallos de lógica/autorización confirmada, pero amplios rangos de falsas alarmas — correctivo a los claims de fabricante.

GitHub Docs · 2026

Responsible use of Copilot Autofix / Code Review

Guía de gobernanza: riesgo de alucinación, no-determinismo, deber de revisión humana; evaluación con varias ejecuciones independientes.

NIST · 2025

NIST AI 100-2e2025: Adversarial Machine Learning — Taxonomía

Define la inyección directa e indirecta como clases de ataque GenAI; la inyección indirecta vía contenido recuperado (README/comentarios) aplica a los agentes de análisis.

¿Implantar AI SAST — con evidencia, no por intuición?

En una primera conversación sin compromiso definimos dónde tiene más palanca el triaje con LLM en su caso, qué capa corre en qué repositorio y cómo gobernar los hallazgos de IA sin perder la reproducibilidad.