01Qué son los Agent Skills
Un Agent Skill es un directorio con un archivo SKILL.md: un frontmatter YAML con los campos obligatorios «name» y «description» más instrucciones en Markdown; opcionalmente se añaden los directorios scripts/ (código ejecutable), references/ (documentación) y assets/ (plantillas, datos). Los agentes cargan los skills mediante progressive disclosure en tres etapas: al inicio, solo el nombre y la descripción (unos 100 tokens); al activarse, las instrucciones completas; los scripts y archivos de referencia, solo cuando se necesitan. Los scripts se ejecutan a través de la shell y únicamente su salida entra en el contexto. El formato fue desarrollado por Anthropic, publicado como estándar abierto (agentskills.io) y es compatible con numerosos agentes, entre ellos Claude y Claude Code, GitHub Copilot, VS Code, Gemini CLI y OpenAI Codex.
02Prompt injection a través del contenido de los skills
Las instrucciones de un skill entran directamente en el contexto del agente como indicaciones aparentemente fiables. Anthropic advierte de forma expresa: un skill malicioso puede llevar al agente a invocar herramientas o ejecutar código de una manera que no se corresponde con la finalidad declarada del skill, por ejemplo ocultando acciones al usuario o modificando el comportamiento solo bajo determinadas condiciones. Esto responde al patrón de la prompt injection indirecta (OWASP LLM01:2025): contenidos de fuentes externas alteran el comportamiento del modelo de forma no intencionada. Especialmente arriesgados son los skills que cargan en tiempo de ejecución contenidos desde URL externas: incluso un skill originalmente benigno puede quedar comprometido si sus dependencias externas cambian más adelante.
03Riesgo de cadena de suministro: skills de fuentes ajenas
Los skills se comparten como paquetes de software: a través de repositorios Git, catálogos de plugins y marketplaces comunitarios. Anthropic recomienda utilizar exclusivamente skills de fuentes de confianza y tratar la instalación de un skill con el mismo cuidado que la instalación de software en sistemas productivos. Indicadores de riesgo típicos son los scripts incluidos (se ejecutan con acceso completo al entorno del agente), las credenciales codificadas en duro, las referencias a servidores MCP (amplían el acceso más allá del skill), los accesos a la red y las rutas de archivos fuera del directorio del skill. Dado que los skills pueden cambiar con cada actualización, cada nueva versión cuenta como un nuevo despliegue, con una nueva revisión de seguridad.
04Permisos excesivos y fuga de datos
Un skill no aporta su propio modelo de permisos, sino que hereda los derechos del agente que lo ejecuta, y estos difieren considerablemente según el entorno de ejecución: en la Claude API los skills se ejecutan en un contenedor sandbox sin acceso a la red, mientras que en Claude Code lo hacen con el acceso a la red completo del equipo del usuario. La combinación de acceso de lectura a datos sensibles y comunicación saliente es lo crítico: Anthropic menciona explícitamente la interacción de herramientas de lectura de archivos y de red como riesgo combinado; la exfiltración también es posible a través de las propias respuestas del agente. El campo experimental del frontmatter «allowed-tools» puede restringir las herramientas utilizables, pero no todas las implementaciones lo aplican: no sustituye al endurecimiento del entorno de ejecución.
05Enfoques de verificación: revisión, sandboxing, allowlisting, firma
Antes de la aprobación se realiza una revisión completa de todos los archivos de un skill: SKILL.md, archivos Markdown referenciados, scripts y recursos, buscando instrucciones adversariales (ignorar reglas de seguridad, ocultar acciones), accesos a la red, credenciales codificadas en duro, destinos de redirección inesperados y patrones de exfiltración. Los scripts incluidos deberían ejecutarse en una sandbox aislada para verificar que su comportamiento se corresponde con la finalidad declarada; para la operación conviene añadir entornos aislados como contenedores sin acceso a la red. El allowlisting significa que solo entran en servicio skills explícitamente revisados y aprobados. La integridad de las versiones revisadas se asegura con checksums que se verifican en el despliegue y con commits firmados en el repositorio del skill; en producción, los skills se fijan a versiones concretas.
06Gobernanza: catálogos curados, least agency, pistas de auditoría
Las organizaciones deberían gestionar los skills a través de un catálogo interno curado: un registro por skill con finalidad, owner, versión, dependencias y estado de evaluación, junto con la segregación de funciones: quien escribe un skill no lo aprueba él mismo. El ciclo de vida abarca desde la creación y la revisión, pasando por las pruebas y el despliegue, hasta la monitorización y la retirada ordenada. El principio de «Least Agency» del OWASP Top 10 for Agentic Applications traslada el least privilege a los agentes: conceder únicamente los skills, herramientas y márgenes de actuación mínimos necesarios; los bundles de skills por rol mantienen reducido el conjunto activo. Para las pistas de auditoría, Anthropic recomienda un logging a nivel de aplicación que permita rastrear qué skills se cargaron en qué solicitudes; las reevaluaciones periódicas detectan la deriva entre skills, workflows y modelos.