Reservar cita

Seguridad de los Agent Skills

Cómo verificar, proteger y gobernar a lo largo de todo su ciclo de vida las capacidades empaquetadas para agentes de IA – instrucciones más código ejecutable en formato SKILL.md – antes de su puesta en marcha.

Los Agent Skills son un formato abierto que permite dotar a los agentes de IA de nuevas capacidades: un skill es un directorio con un archivo SKILL.md que contiene metadatos e instrucciones y que, además, puede agrupar scripts, documentos de referencia y plantillas. Desarrollado originalmente por Anthropic y publicado como estándar abierto, el formato es hoy compatible con una gran variedad de productos de agentes: desde Claude Code y GitHub Copilot hasta Gemini CLI y OpenAI Codex. Pero eso también significa que quien instala un skill instala instrucciones y código ejecutable de terceros, con las mismas consecuencias que cualquier instalación de software, más una nueva superficie de ataque: instrucciones en lenguaje natural que dirigen directamente el comportamiento del agente. Este artículo pone los riesgos en contexto y muestra cómo pueden plantearse la verificación y la gobernanza de los Agent Skills.

Lo esencial en resumen

01

Qué son los Agent Skills

Un Agent Skill es un directorio con un archivo SKILL.md: un frontmatter YAML con los campos obligatorios «name» y «description» más instrucciones en Markdown; opcionalmente se añaden los directorios scripts/ (código ejecutable), references/ (documentación) y assets/ (plantillas, datos). Los agentes cargan los skills mediante progressive disclosure en tres etapas: al inicio, solo el nombre y la descripción (unos 100 tokens); al activarse, las instrucciones completas; los scripts y archivos de referencia, solo cuando se necesitan. Los scripts se ejecutan a través de la shell y únicamente su salida entra en el contexto. El formato fue desarrollado por Anthropic, publicado como estándar abierto (agentskills.io) y es compatible con numerosos agentes, entre ellos Claude y Claude Code, GitHub Copilot, VS Code, Gemini CLI y OpenAI Codex.

02

Prompt injection a través del contenido de los skills

Las instrucciones de un skill entran directamente en el contexto del agente como indicaciones aparentemente fiables. Anthropic advierte de forma expresa: un skill malicioso puede llevar al agente a invocar herramientas o ejecutar código de una manera que no se corresponde con la finalidad declarada del skill, por ejemplo ocultando acciones al usuario o modificando el comportamiento solo bajo determinadas condiciones. Esto responde al patrón de la prompt injection indirecta (OWASP LLM01:2025): contenidos de fuentes externas alteran el comportamiento del modelo de forma no intencionada. Especialmente arriesgados son los skills que cargan en tiempo de ejecución contenidos desde URL externas: incluso un skill originalmente benigno puede quedar comprometido si sus dependencias externas cambian más adelante.

03

Riesgo de cadena de suministro: skills de fuentes ajenas

Los skills se comparten como paquetes de software: a través de repositorios Git, catálogos de plugins y marketplaces comunitarios. Anthropic recomienda utilizar exclusivamente skills de fuentes de confianza y tratar la instalación de un skill con el mismo cuidado que la instalación de software en sistemas productivos. Indicadores de riesgo típicos son los scripts incluidos (se ejecutan con acceso completo al entorno del agente), las credenciales codificadas en duro, las referencias a servidores MCP (amplían el acceso más allá del skill), los accesos a la red y las rutas de archivos fuera del directorio del skill. Dado que los skills pueden cambiar con cada actualización, cada nueva versión cuenta como un nuevo despliegue, con una nueva revisión de seguridad.

04

Permisos excesivos y fuga de datos

Un skill no aporta su propio modelo de permisos, sino que hereda los derechos del agente que lo ejecuta, y estos difieren considerablemente según el entorno de ejecución: en la Claude API los skills se ejecutan en un contenedor sandbox sin acceso a la red, mientras que en Claude Code lo hacen con el acceso a la red completo del equipo del usuario. La combinación de acceso de lectura a datos sensibles y comunicación saliente es lo crítico: Anthropic menciona explícitamente la interacción de herramientas de lectura de archivos y de red como riesgo combinado; la exfiltración también es posible a través de las propias respuestas del agente. El campo experimental del frontmatter «allowed-tools» puede restringir las herramientas utilizables, pero no todas las implementaciones lo aplican: no sustituye al endurecimiento del entorno de ejecución.

05

Enfoques de verificación: revisión, sandboxing, allowlisting, firma

Antes de la aprobación se realiza una revisión completa de todos los archivos de un skill: SKILL.md, archivos Markdown referenciados, scripts y recursos, buscando instrucciones adversariales (ignorar reglas de seguridad, ocultar acciones), accesos a la red, credenciales codificadas en duro, destinos de redirección inesperados y patrones de exfiltración. Los scripts incluidos deberían ejecutarse en una sandbox aislada para verificar que su comportamiento se corresponde con la finalidad declarada; para la operación conviene añadir entornos aislados como contenedores sin acceso a la red. El allowlisting significa que solo entran en servicio skills explícitamente revisados y aprobados. La integridad de las versiones revisadas se asegura con checksums que se verifican en el despliegue y con commits firmados en el repositorio del skill; en producción, los skills se fijan a versiones concretas.

06

Gobernanza: catálogos curados, least agency, pistas de auditoría

Las organizaciones deberían gestionar los skills a través de un catálogo interno curado: un registro por skill con finalidad, owner, versión, dependencias y estado de evaluación, junto con la segregación de funciones: quien escribe un skill no lo aprueba él mismo. El ciclo de vida abarca desde la creación y la revisión, pasando por las pruebas y el despliegue, hasta la monitorización y la retirada ordenada. El principio de «Least Agency» del OWASP Top 10 for Agentic Applications traslada el least privilege a los agentes: conceder únicamente los skills, herramientas y márgenes de actuación mínimos necesarios; los bundles de skills por rol mantienen reducido el conjunto activo. Para las pistas de auditoría, Anthropic recomienda un logging a nivel de aplicación que permita rastrear qué skills se cargaron en qué solicitudes; las reevaluaciones periódicas detectan la deriva entre skills, workflows y modelos.

Estándares y fuentes

Los contenidos de esta página se basan en las siguientes guías y estudios disponibles públicamente.

Anthropic (Claude Platform Docs) · 2026

Agent Skills

Fuente primaria sobre arquitectura, estructura de SKILL.md, progressive disclosure, entornos de ejecución y security considerations de los Agent Skills.

Anthropic (Claude Platform Docs) · 2026

Skills for enterprise

Guía de gobernanza con evaluación por niveles de riesgo, checklist de revisión de ocho pasos, modelo de ciclo de vida, recomendaciones de checksums/firmas y requisitos de registro de skills.

agentskills.io (offener Standard, initiiert von Anthropic) · 2026

Agent Skills Specification

Especificación del formato: campos de frontmatter obligatorios y opcionales (entre ellos el experimental «allowed-tools»), estructura de directorios y etapas de progressive disclosure.

OWASP GenAI Security Project · 2025

LLM01:2025 Prompt Injection

Define la prompt injection directa e indirecta, así como contramedidas como el privilege control, las aprobaciones humanas y la segregación de contenidos externos.

OWASP GenAI Security Project · 2025

OWASP Top 10 for Agentic Applications 2026

Catálogo de riesgos para aplicaciones agénticas (ASI01–ASI10); fuente del principio de gobernanza «Least Agency».

Red Hat Developer · 2026

Agent Skills: Explore security threats and controls

Catálogo práctico de amenazas y controles para Agent Skills, que incluye sandboxing en contenedores, escaneo de malware/secretos y permisos de archivos restrictivos.

¿Quiere introducir Agent Skills de forma segura?

Si utiliza skills en su empresa o desea establecer un proceso de aprobación para ellos, le apoyamos con gusto: desde revisiones de skills hasta la gobernanza. Contáctenos para una primera conversación.