Prendre rendez-vous

Sécurité des Agent Skills

Comment vérifier, sécuriser et piloter tout au long de leur cycle de vie les capacités packagées pour agents IA – instructions et code exécutable au format SKILL.md – avant leur mise en service.

Les Agent Skills sont un format ouvert qui permet de doter les agents IA de nouvelles capacités : un skill est un répertoire contenant un fichier SKILL.md avec métadonnées et instructions, qui peut en outre regrouper des scripts, des documents de référence et des modèles. Développé à l'origine par Anthropic et publié comme standard ouvert, le format est désormais pris en charge par de nombreux produits d'agents – de Claude Code à GitHub Copilot, en passant par Gemini CLI et OpenAI Codex. Mais cela signifie aussi : qui installe un skill installe des instructions et du code exécutable écrits par des tiers – avec les mêmes conséquences que toute installation logicielle, auxquelles s'ajoute une nouvelle surface d'attaque : des instructions en langage naturel qui pilotent directement le comportement de l'agent. Cet article met les risques en perspective et montre à quoi peuvent ressembler la vérification et la gouvernance des Agent Skills.

L'essentiel en un coup d'œil

01

Ce que sont les Agent Skills

Un Agent Skill est un répertoire contenant un fichier SKILL.md : un frontmatter YAML avec les champs obligatoires « name » et « description », plus des instructions en Markdown ; s'y ajoutent en option les répertoires scripts/ (code exécutable), references/ (documentation) et assets/ (modèles, données). Les agents chargent les skills par progressive disclosure en trois étapes : au démarrage, seuls le nom et la description (environ 100 tokens) ; à l'activation, les instructions complètes ; les scripts et fichiers de référence uniquement en cas de besoin – les scripts sont exécutés via le shell, et seule leur sortie entre dans le contexte. Le format a été développé par Anthropic, publié comme standard ouvert (agentskills.io) et est pris en charge par de nombreux agents, dont Claude et Claude Code, GitHub Copilot, VS Code, Gemini CLI et OpenAI Codex.

02

Prompt injection via le contenu des skills

Les instructions d'un skill entrent directement dans le contexte de l'agent, sous la forme de consignes en apparence dignes de confiance. Anthropic avertit expressément : un skill malveillant peut amener l'agent à appeler des outils ou à exécuter du code d'une manière qui ne correspond pas à la finalité déclarée du skill – par exemple en dissimulant des actions à l'utilisateur ou en ne modifiant le comportement que sous certaines conditions. Cela correspond au schéma de la prompt injection indirecte (OWASP LLM01:2025) : des contenus issus de sources externes modifient le comportement du modèle de manière non intentionnelle. Les skills qui chargent à l'exécution des contenus depuis des URL externes sont particulièrement risqués – même un skill initialement bénin peut être compromis si ses dépendances externes changent ultérieurement.

03

Risque supply chain : des skills de sources tierces

Les skills se partagent comme des paquets logiciels – via des dépôts Git, des catalogues de plugins et des places de marché communautaires. Anthropic recommande de n'utiliser que des skills provenant de sources de confiance et de traiter l'installation d'un skill avec le même soin que l'installation d'un logiciel sur des systèmes de production. Les indicateurs de risque typiques sont les scripts embarqués (ils s'exécutent avec un accès complet à l'environnement de l'agent), les identifiants codés en dur, les références à des serveurs MCP (elles étendent l'accès au-delà du skill), les accès réseau ainsi que les chemins de fichiers situés hors du répertoire du skill. Comme les skills peuvent changer à chaque mise à jour, chaque nouvelle version vaut nouveau déploiement – avec une nouvelle revue de sécurité.

04

Permissions excessives et fuite de données

Un skill n'apporte pas son propre modèle de permissions : il hérite des droits de l'agent qui l'exécute – et ceux-ci varient considérablement selon l'environnement d'exécution : dans la Claude API, les skills tournent dans un conteneur sandbox sans accès réseau ; dans Claude Code, en revanche, avec l'accès réseau complet de la machine de l'utilisateur. La combinaison d'un accès en lecture à des données sensibles et de communications sortantes est critique : Anthropic cite explicitement l'association d'outils de lecture de fichiers et d'outils réseau comme risque combiné ; l'exfiltration est également possible via les réponses mêmes de l'agent. Le champ frontmatter expérimental « allowed-tools » peut restreindre les outils utilisables, mais il n'est pas appliqué par toutes les implémentations – il ne remplace pas le durcissement de l'environnement d'exécution.

05

Approches de vérification : revue, sandboxing, allowlisting, signature

Avant toute approbation : une revue complète de tous les fichiers d'un skill – SKILL.md, fichiers Markdown référencés, scripts et ressources – à la recherche d'instructions adversariales (ignorer les règles de sécurité, dissimuler des actions), d'accès réseau, d'identifiants codés en dur, de cibles de redirection inattendues et de schémas d'exfiltration. Les scripts embarqués devraient être exécutés dans une sandbox isolée afin de vérifier que leur comportement correspond à la finalité déclarée ; pour l'exploitation, des environnements isolés supplémentaires, comme des conteneurs sans accès réseau, sont recommandés. L'allowlisting signifie que seuls des skills explicitement vérifiés et approuvés sont mis en service. L'intégrité des versions vérifiées est garantie par des checksums contrôlées au déploiement et par des commits signés dans le dépôt du skill ; en production, les skills sont épinglés sur des versions précises.

06

Gouvernance : catalogues maîtrisés, least agency, pistes d'audit

Les organisations devraient piloter les skills via un catalogue interne maîtrisé : un registre par skill avec finalité, owner, version, dépendances et statut d'évaluation, complété par une séparation des fonctions – celui qui écrit un skill ne l'approuve pas lui-même. Le cycle de vie s'étend de la création et de la revue aux tests et au déploiement, jusqu'au monitoring et à la mise hors service ordonnée. Le principe « Least Agency » de l'OWASP Top 10 for Agentic Applications transpose le least privilege aux agents : n'accorder que le strict minimum de skills, d'outils et de marges d'action – des bundles de skills par rôle maintiennent l'ensemble actif réduit. Pour les pistes d'audit, Anthropic recommande une journalisation au niveau applicatif permettant de retracer quels skills ont été chargés dans quelles requêtes ; des réévaluations régulières révèlent la dérive entre skills, workflows et modèles.

Normes & sources

Le contenu de cette page s'appuie sur les guides et études suivants, accessibles publiquement.

Anthropic (Claude Platform Docs) · 2026

Agent Skills

Source primaire sur l'architecture, la structure SKILL.md, la progressive disclosure, les environnements d'exécution et les security considerations des Agent Skills.

Anthropic (Claude Platform Docs) · 2026

Skills for enterprise

Guide de gouvernance avec évaluation par niveaux de risque, checklist de revue en huit étapes, modèle de cycle de vie, recommandations de checksums/signatures et exigences de registre de skills.

agentskills.io (offener Standard, initiiert von Anthropic) · 2026

Agent Skills Specification

Spécification du format : champs frontmatter obligatoires et optionnels (dont le champ expérimental « allowed-tools »), structure des répertoires et étapes de progressive disclosure.

OWASP GenAI Security Project · 2025

LLM01:2025 Prompt Injection

Définit la prompt injection directe et indirecte ainsi que des contre-mesures telles que le privilege control, les validations humaines et la ségrégation des contenus externes.

OWASP GenAI Security Project · 2025

OWASP Top 10 for Agentic Applications 2026

Catalogue de risques pour les applications agentiques (ASI01–ASI10) ; source du principe de gouvernance « Least Agency ».

Red Hat Developer · 2026

Agent Skills: Explore security threats and controls

Catalogue pratique de menaces et de contrôles pour les Agent Skills, incluant le sandboxing en conteneurs, le scan de malwares/secrets et des permissions de fichiers restrictives.

Déployer les Agent Skills en toute sécurité ?

Si vous utilisez des skills dans votre entreprise ou souhaitez mettre en place un processus d'approbation dédié, nous vous accompagnons volontiers – des revues de skills à la gouvernance. Contactez-nous pour un premier échange.