01El modelo de tres niveles (Wiz)
Wiz describe AI SAST no como un modelo único, sino como un sistema multi-motor consciente del contexto. Nivel 1: escaneo base determinista por firmas — rápido, barato, antes de cada merge. Nivel 2: razonamiento de IA continuo en cada pull request, que entiende la estructura de la aplicación, los trust boundaries y los flujos de datos. Nivel 3: pentesting agéntico dirigido, solo para aplicaciones de alto valor. Tesis central: «Deep scanning everywhere doesn't scale» — el análisis frontier es caro y puntual mientras el código cambia cada hora.
02El triaje: el beneficio mejor probado
El uso más maduro no es encontrar, sino descartar. Un filtro LLM detrás de un escáner determinista reduce las falsas alarmas de forma consistente en varios estudios independientes: QASecClaw 88,6 % en el OWASP Benchmark con 3,1 % de pérdida de recall, «Sifting the Noise» hasta 93,3 % en alertas reales de CodeQL, SAST-Genius alrededor del 91 % (225 a 20 hallazgos). Ahí está la palanca económica, porque la fatiga de alertas es la causa más frecuente del fracaso de los programas SAST.
03Razonamiento semántico en vez de patrones
En el nivel 2, el modelo construye primero una comprensión de la aplicación, formula hipótesis de ataque y las prueba más allá de los límites de archivos y funciones — «como un investigador de seguridad». El enfoque neuro-simbólico IRIS (el LLM infiere las especificaciones de taint, CodeQL ejecuta el análisis) encontró 55 vulnerabilidades en lugar de 27 en CWE-Bench-Java frente a CodeQL solo, cuatro de ellas desconocidas. El estudio rico en contexto CORRECT lo demuestra: el contexto del repositorio es la palanca decisiva.
Bases: el SAST clásico →04Búsqueda autónoma de vulnerabilidades
El propio hallazgo se convierte en commodity: Google Big Sleep reportó veinte zero-days reales en 2025 e impidió un ataque por primera vez (CVE-2025-6965). Los finalistas del DARPA AIxCC encontraron de forma autónoma el 86 % de las vulnerabilidades inyectadas en agosto de 2025, a unos 152 dólares por tarea. Wiz Atlas supera el 90 % en el benchmark CyberGym y más de 200 vulnerabilidades desconocidas. En 2026, incluso un modelo open-weight (Kimi K2.5) encontró, mediante un harness de agentes sintetizado, diez zero-days en Google Chrome.
Consultoría: AI Code Security →05Agentes de código como revisores
Los grandes asistentes de código integran la revisión de seguridad: Claude Code Security Review de Anthropic (open source, MIT, diff-aware, filtra activamente clases propensas a FP), GitHub Copilot Code Review (más de 60 M de revisiones, 71 % con feedback accionable), OpenAI Codex Security (más de 100.000 PR externos al día, precisión antes que recall), Cursor Bugbot (8 pasadas paralelas más voto mayoritario contra el no-determinismo, 70 %+ de resolución). Todos documentan explícitamente el riesgo de alucinación y el deber de revisión.
06Proveedores de SAST IA-nativo
Junto a los actores establecidos (Checkmarx, Veracode Fix, Snyk Agent Fix con 85 % de tasa secure-and-functional, Sonar, GitLab Duo) ha surgido una clase propia de herramientas IA-nativas: ZeroPath, Corgea, DryRun, Amplify, Almanax. Una prueba independiente de pentester (Joshua Rogers, 09/2025) confirma su fuerza en fallos de lógica y autorización, pero mide amplios rangos: Corgea en torno al 80 % de detección con ~50 % de falsas alarmas, otros mayoritariamente falsas alarmas. Los benchmarks de fabricante («100 % de detección») merecen contraste.
07Límite 1 — el no-determinismo
Los veredictos de los LLM varían entre ejecuciones, y por principio: incluso a temperatura 0 las salidas no son reproducibles porque la inferencia no es invariante por lote (Thinking Machines: 80 resultados distintos de 1.000 peticiones idénticas). Para un gate de cumplimiento esto significa que la base reproducible debe venir del nivel 1; los hallazgos de IA necesitan una traza de auditoría y muestreo humano, no automatización ciega. GitHub y GitLab lo escriben en su documentación de uso.
08Límite 2 — el analista se vuelve objetivo
Un modelo que lee el contenido de un repositorio procesa como entrada las instrucciones de comentarios, README e issues. Eso es explotable: comentarios adversarios engañan a los detectores LLM en más del 90 % de los casos (framework ALIBI), y solo el framing suprime hasta el 97 % de las vulnerabilidades detectadas. Los incidentes reales van desde CVE-2025-53773 (RCE de Copilot por prompt injection) hasta una RCE en los servidores de CodeRabbit con acceso de escritura a un millón de repositorios. El NIST clasifica la inyección indirecta como su propia clase de ataque.
09El reality-check honesto
No toda historia de éxito resiste el examen. En zero-days realmente inéditos (ZeroDayBench, CVE portados a repositorios ajenos), incluso los modelos frontier fallan aún en encontrar y parchear de forma autónoma. La clasificación LLM ingenua sin contexto se queda en una balanced accuracy de 0,50 a 0,55 — apenas por encima de una moneda al aire. Y la contaminación de benchmarks sigue siendo una reserva, aunque no sea el motor principal en los benchmarks de vulnerabilidades reales. Por eso: la IA complementa las capas, no las sustituye.