Reservar cita

AI SAST – análisis de código que razona sobre la intención

Los modelos de lenguaje trían hallazgos, razonan semánticamente más allá de los límites de las funciones y encuentran zero-days reales. Qué está probado, qué herramientas existen en 2026 y dónde están los nuevos límites y riesgos — con fuentes en lugar de marketing.

Actualizado: agosto de 2026 · Valeri Milke, Lead Auditor ISO 27001 e ISO 42001

75 %del código nuevo lo produce hoy la IA, según Google
45 %de las muestras de IA suspende la prueba de seguridad (Veracode)
88,6 %menos falsas alarmas con filtro LLM (QASecClaw, OWASP Benchmark)
20zero-days reales reportó Google Big Sleep en 2025

AI SAST designa el uso de grandes modelos de lenguaje en el análisis estático de código — no como sustituto del SAST basado en reglas, sino como segunda capa por encima. La motivación es doble: la IA produce hoy la mayor parte del código nuevo (Google indica un 75 %) y ese código introduce medibemente más vulnerabilidades (Veracode: el 45 % de las muestras de IA suspende la prueba de seguridad). Al mismo tiempo, esa misma tecnología encuentra fallos que ningún patrón captura. El marco de referencia viene de Wiz («Rethinking Scanning for the AI Era», 30.07.2026): tres capas — escaneo base determinista, razonamiento de IA continuo y deep testing agéntico dirigido. Esta página sitúa las capacidades probadas, el panorama real de herramientas y los nuevos riesgos — separando sistemáticamente fuentes primarias de afirmaciones de fabricante.

Lo esencial en resumen

Nueve bloques temáticos — toca para desplegar.

Cuatro campos de aplicación probados

Del triaje a los agentes de código como revisores — cada pestaña condensa las capacidades probadas. Toca una pestaña.

Mejor probado
  • El uso más maduro no es encontrar, sino descartar: un filtro LLM detrás de un escáner determinista reduce las falsas alarmas de forma consistente en varios estudios independientes.
  • QASecClaw: 88,6 % en el OWASP Benchmark con 3,1 % de pérdida de recall; «Sifting the Noise»: hasta 93,3 % en alertas reales de CodeQL; SAST-Genius: alrededor del 91 % (225 a 20 hallazgos).
  • Ahí está la palanca económica — la fatiga de alertas es la causa más frecuente del fracaso de los programas SAST.
Filtro LLMQASecClawOWASP BenchmarkCodeQLSAST-GeniusFatiga de alertas
Nuestra solución · AI SAST en operación

VamiAppSec: seis escáneres, un backlog, triaje con IA

El patrón operativo exacto de esta página — el escáner determinista encuentra, el LLM tría y contextualiza, el humano decide — está integrado en nuestra plataforma VamiAppSec. Orquesta Semgrep, Gitleaks, Checkov, Syft/Grype y el Claude Code Security Reviewer en un pipeline, normaliza todos los hallazgos y enriquece cada uno con un LLM: contexto, evaluación de explotabilidad y propuesta de parche. Trazable y desplegable en su propio centro de datos.

6+escáneres en un pipeline
−54 %tiempo mediano de triaje
93 %duplicados eliminados
24 hhasta la puesta en marcha
  • LLM como filtro DETRÁS del escáner determinista — no un sustituto ciego
  • Self-hosted o SaaS: si lo desea, el código nunca sale de su infraestructura
  • Con consultoría: arquitectura de escaneo, calibración, validación de explotabilidad

Cifras de mediciones propias frente a la salida bruta de los escáneres; detalles en vamiappsec.com.

Estándares y fuentes

Los contenidos de esta página se basan en las siguientes guías y estudios disponibles públicamente.

Wiz (Amir Lande Blau) · 2026

Rethinking Scanning for the AI Era: Wiz's Agentic Code Security System

El modelo de tres niveles (base / razonamiento de IA continuo / deep testing agéntico) y la productización de Atlas como motor de análisis profundo; tesis «Deep scanning everywhere doesn't scale».

Wiz · 2026

Introducing Atlas: Wiz's AI vulnerability researcher

Más del 90 % de éxito en CyberGym y más de 200 vulnerabilidades desconocidas; sistema multi-modelo orquestado.

arXiv:2405.17238 · 2025

IRIS: LLM-Assisted Static Analysis (ICLR 2025)

Neuro-simbólico: el LLM infiere specs de taint, CodeQL analiza. 55 vulnerabilidades en vez de 27 en CWE-Bench-Java frente a CodeQL solo, cuatro desconocidas encontradas.

arXiv:2504.13474 · 2025

Everything You Wanted to Know About LLM-based Vulnerability Detection (CORRECT)

2.000 pares vulnerable-parcheado sobre 99 CWE, 13 LLM: el contexto del repositorio es la palanca decisiva; la mayoría de las falsas alarmas vienen de errores de razonamiento.

arXiv:2312.12575 · 2024

LLMs Cannot Reliably Identify and Reason About Security Vulnerabilities (Yet?) (IEEE S&P 2024)

SecLLMHolmes: el mero renombrado de funciones/variables invierte veredictos (PaLM2 26 %, GPT-4 17 %); salidas no deterministas y razonamiento poco fiable.

Thinking Machines Lab · 2025

Defeating Nondeterminism in LLM Inference

Sin reproducibilidad ni a temperatura 0: 80 resultados distintos de 1.000 peticiones idénticas; causa: falta de invariancia por lote.

arXiv:2607.24964 · 2026

ALIBI: Adversarial comments defeat LLM vulnerability detectors

Comentarios engañosos sin cambio de comportamiento logran más del 90 % de evasión (100 % en un sistema) frente a cuatro detectores LLM.

arXiv:2603.02297 · 2026

ZeroDayBench (ICLR 2026 Workshop)

Reality-check: en zero-days portados e inéditos, los modelos frontier aún fallan en encontrar y parchear de forma autónoma.

Anthropic · 2025

Claude Code Security Review (GitHub Action, open source)

Licencia MIT, diff-aware, agnóstico al lenguaje; filtra activamente clases propensas a FP para reducir el ruido.

GitHub · 2026

60 million Copilot code reviews and counting

Más de 60 M de revisiones, 71 % con feedback accionable; arquitectura agéntica y modelo de razonamiento mejoran el feedback.

OpenAI Alignment · 2025

A Practical Approach to Verifying Code at Scale

El revisor Codex comprueba más de 100.000 PR externos al día; precisión antes que recall; acceso al repo + ejecución del código elevan la calidad.

Cursor · 2026

Building a better Bugbot

Ingeniería explícita contra el no-determinismo LLM: 8 pasadas paralelas con orden de diff permutado, voto mayoritario, validador posterior; resolución del 52 % a más del 70 %.

Semgrep · 2025

Semgrep Assistant: 60 % de auto-triaje, 96 % de acuerdo

Patrón basado en confianza: LLM como proveedor de contexto detrás del motor determinista; 60 % de auto-triaje, 96 % de acuerdo (cifra de fabricante).

Joshua Rogers · 2025

An LLM Engineer's Review of AI SAST Tools

Prueba independiente de seis productos AI SAST: fuerza en fallos de lógica/autorización confirmada, pero amplios rangos de falsas alarmas — correctivo a los claims de fabricante.

GitHub Docs · 2026

Responsible use of Copilot Autofix / Code Review

Guía de gobernanza: riesgo de alucinación, no-determinismo, deber de revisión humana; evaluación con varias ejecuciones independientes.

NIST · 2025

NIST AI 100-2e2025: Adversarial Machine Learning — Taxonomía

Define la inyección directa e indirecta como clases de ataque GenAI; la inyección indirecta vía contenido recuperado (README/comentarios) aplica a los agentes de análisis.

¿Implantar AI SAST — con evidencia, no por intuición?

En una primera conversación sin compromiso definimos dónde tiene más palanca el triaje con LLM en su caso, qué capa corre en qué repositorio y cómo gobernar los hallazgos de IA sin perder la reproducibilidad.