01Ce qu'est l'APTS — et ce qu'il n'est pas
L'APTS est un cadre de gouvernance pour le comportement des plateformes de pentest autonomes et une baseline de conformité pour les éditeurs, les MSSP et les entreprises — ce n'est ni un guide pratique du pentest, ni un substitut à PTES, OWASP WSTG ou OSSTMM, ni un classement d'outils ou d'éditeurs. Tandis que PTES décrit les sept phases d'un pentest et que l'OWASP WSTG catalogue les techniques de test web, l'APTS adresse les propriétés de la plateforme : Scope Enforcement, Safe Autonomy, accountability, pistes de décision et isolation des journaux d'audit pour les systèmes pilotés par IA. Le standard est publié en tant que projet OWASP en Version 0.1.0 (licence CC BY-SA 4.0) et librement accessible via la page du projet OWASP et GitHub.
02Les 8 domaines et leurs 173 exigences
Les 173 exigences « Tier-Required » se répartissent sur huit domaines : Scope Enforcement (SE, 26) impose les limites du périmètre par des moyens techniques, et non plus seulement contractuels ; Safety Controls (SC, 20) exigent une classification d'impact, une analyse du rayon d'impact (blast radius) et un kill switch ; Human Oversight (HO, 19) régit les portes d'approbation, les chemins d'escalade et les qualifications des opérateurs ; Graduated Autonomy (AL, 28) exige des niveaux d'autonomie déclarés avec matrice d'approbation et gating des capacités ; Auditability (AR, 20) exige des pistes d'audit et de décision exhaustives, signées et isolées de la plateforme ; Manipulation Resistance (MR, 23) adresse la prompt injection, les entrées adverses (adversarial inputs) et l'élargissement du périmètre (scope widening) ; Supply Chain Trust (TP, 22) exige la divulgation du modèle de fondation, la transparence du traitement des données, l'isolation multi-tenant et une SBOM ; Reporting (RP, 15) exige la validation des findings, le scoring de confiance et la divulgation de la couverture.
03Quatre niveaux d'autonomie : de L1 à L4
L'APTS prescrit un modèle d'autonomie gradué — pas de saut du manuel au tout-autonome. L1 Assisted : l'humain planifie et exécute, la plateforme propose (p. ex. scan de vulnérabilités avec recommandations). L2 Supervised : la plateforme planifie, l'humain approuve chaque étape (exploitation guidée avec portes d'approbation). L3 Delegated : la plateforme planifie et exécute, l'humain supervise (reconnaissance autonome avec exploitation surveillée). L4 Autonomous : fonctionnement autonome de bout en bout, par exemple sous forme de Red Team autonome en continu. Principe fondamental du standard : plus l'autonomie augmente, plus les exigences d'assurance s'élèvent — L4 n'est défendable qu'avec des preuves de niveau Tier 3. En pratique, L2 suffit à de nombreuses organisations ; l'essentiel n'est pas de savoir à quel point une plateforme peut être autonome, mais à quel point elle doit l'être pour le cas d'usage concret.
04Trois tiers de conformité : 72 → 157 → 173
Les exigences sont échelonnées de manière cumulative. Tier 1 Foundation (72 exigences) constitue la baseline : aucun test hors périmètre, kill switch fonctionnel, piste d'audit de base, classification d'impact par action — adapté aux tests internes et aux environnements hors production. Tier 2 Verified (+85, 157 en cumulé) ajoute des pistes d'audit signées et inviolables, la transparence des pistes de décision, des findings vérifiables de manière indépendante, une Manipulation Resistance complète et la transparence de la chaîne d'approvisionnement — la référence pour les déploiements en entreprise traitant des données sensibles et pour les secteurs régulés. Tier 3 Comprehensive (+16, 173 en cumulé) est le plus élevé des trois niveaux d'assurance : aptitude au niveau L4 Autonomous, adéquation aux infrastructures critiques (OT, KRITIS), Red Teaming externe de la plateforme elle-même et preuves de maturité de gouvernance. Comme voie de mise en œuvre, une démarche en cinq étapes a fait ses preuves : analyse d'écart par rapport au Tier 1, construction de la fondation, attestation Tier 1, extension vers le Tier 2, vérification externe.
05Ancrages réglementaires : un framework, quatre preuves
Les domaines de l'APTS se mappent sur les réglementations centrales de l'UE : dans l'EU AI Act (Regulation (EU) 2024/1689), AL, SC et MR adressent la gestion des risques selon l'Art. 9, AR les obligations de journalisation selon l'Art. 12, HO la supervision humaine selon l'Art. 14 et MR/RP les exigences d'exactitude et de robustesse selon l'Art. 15. Pour ISO/IEC 42001 (système de management de l'IA), les contrôles APTS servent de baseline de contrôles pour les contrôles opérationnels, le monitoring de performance et la chaîne d'approvisionnement. Sous NIS2 (RL (EU) 2022/2555), SE, SC et MR s'appliquent à la gestion des risques selon l'Art. 21, TP à la sécurité de la chaîne d'approvisionnement selon l'Art. 21, al. 2, point d). Pour DORA (VO (EU) 2022/2554), AL et SC soutiennent les tests de pénétration fondés sur la menace (TLPT), TP la gestion des risques liés aux prestataires tiers de services TIC et SE/HO le programme de tests selon les Art. 24–27. Qui satisfait au Tier 2 a ainsi déjà accompli une grande partie du travail réglementaire de base pour les composantes de test autonomes.
06Utiliser l'APTS en pratique : achats, exploitation, audit
Dans les achats auprès des éditeurs, l'APTS rend les offres comparables : au lieu de la question « Est-ce sûr ? », exigez une auto-déclaration de tier incluant la divulgation du modèle de fondation, la preuve des pistes d'audit et des réponses concrètes sur le Scope Enforcement et la propagation du kill switch — au minimum, le Tier 1 devrait être fixé contractuellement, le Tier 2 pour le périmètre NIS2, le Tier 3 pour les cas d'usage L4 et les fonctions cœur des infrastructures critiques (KRITIS). Pour votre propre exploitation, des mesures immédiatement applicables peuvent en être dérivées : tenir un inventaire de périmètre lisible par machine (JSON/YAML), intégrer des tests du kill switch dans chaque engagement et les documenter trimestriellement, définir une destination des journaux d'audit en dehors de la plateforme, documenter les qualifications des opérateurs, rapprocher la divulgation de couverture de l'inventaire de périmètre et exiger, pour chaque finding critique, un package de preuves reproductible. Lors de l'audit, vous vérifiez les pistes d'audit de manière isolée, les pistes de décision par échantillonnage et la divulgation de couverture par rapport au périmètre convenu.