Reservar cita

Seguridad de los Agent Skills

Cómo verificar, proteger y gobernar a lo largo de todo su ciclo de vida las capacidades empaquetadas para agentes de IA – instrucciones más código ejecutable en formato SKILL.md – antes de su puesta en marcha.

Actualizado: julio de 2026 · Valeri Milke, Lead Auditor ISO 27001 e ISO 42001

3etapas de progressive disclosure al cargar los skills
~100tokens al inicio — solo el nombre y la descripción
2campos obligatorios del frontmatter: «name» y «description»
4enfoques de verificación: revisión, sandboxing, allowlisting, firma

Los Agent Skills son un formato abierto que permite dotar a los agentes de IA de nuevas capacidades: un skill es un directorio con un archivo SKILL.md que contiene metadatos e instrucciones y que, además, puede agrupar scripts, documentos de referencia y plantillas. Desarrollado originalmente por Anthropic y publicado como estándar abierto, el formato es hoy compatible con una gran variedad de productos de agentes: desde Claude Code y GitHub Copilot hasta Gemini CLI y OpenAI Codex. Pero eso también significa que quien instala un skill instala instrucciones y código ejecutable de terceros, con las mismas consecuencias que cualquier instalación de software, más una nueva superficie de ataque: instrucciones en lenguaje natural que dirigen directamente el comportamiento del agente. Este artículo pone los riesgos en contexto y muestra cómo pueden plantearse la verificación y la gobernanza de los Agent Skills.

Lo esencial en resumen

Seis bloques temáticos — toque para desplegar.

Enfoques de verificación de un vistazo

Cuatro enfoques antes de que un skill entre en servicio — toque una pestaña.

Antes de aprobar
  • Una revisión completa de todos los archivos de un skill: SKILL.md, archivos Markdown referenciados, scripts y recursos.
  • Se buscan instrucciones adversariales (ignorar reglas de seguridad, ocultar acciones), accesos a la red, credenciales codificadas en duro, destinos de redirección inesperados y patrones de exfiltración.
SKILL.mdscriptsrecursosinstrucciones adversarialescredenciales codificadas en durodestinos de redirecciónpatrones de exfiltración

Estándares y fuentes

Los contenidos de esta página se basan en las siguientes guías y estudios disponibles públicamente.

Anthropic (Claude Platform Docs) · 2026

Agent Skills

Fuente primaria sobre arquitectura, estructura de SKILL.md, progressive disclosure, entornos de ejecución y security considerations de los Agent Skills.

Anthropic (Claude Platform Docs) · 2026

Skills for enterprise

Guía de gobernanza con evaluación por niveles de riesgo, checklist de revisión de ocho pasos, modelo de ciclo de vida, recomendaciones de checksums/firmas y requisitos de registro de skills.

agentskills.io (offener Standard, initiiert von Anthropic) · 2026

Agent Skills Specification

Especificación del formato: campos de frontmatter obligatorios y opcionales (entre ellos el experimental «allowed-tools»), estructura de directorios y etapas de progressive disclosure.

OWASP GenAI Security Project · 2025

LLM01:2025 Prompt Injection

Define la prompt injection directa e indirecta, así como contramedidas como el privilege control, las aprobaciones humanas y la segregación de contenidos externos.

OWASP GenAI Security Project · 2025

OWASP Top 10 for Agentic Applications 2026

Catálogo de riesgos para aplicaciones agénticas (ASI01–ASI10); fuente del principio de gobernanza «Least Agency».

Red Hat Developer · 2026

Agent Skills: Explore security threats and controls

Catálogo práctico de amenazas y controles para Agent Skills, que incluye sandboxing en contenedores, escaneo de malware/secretos y permisos de archivos restrictivos.

¿Quiere introducir Agent Skills de forma segura?

Si utiliza skills en su empresa o desea establecer un proceso de aprobación para ellos, le apoyamos con gusto: desde revisiones de skills hasta la gobernanza. Contáctenos para una primera conversación.