Référentiel OWASP

OWASP LLM Top 10 2025

Les 10 risques critiques pour les applications basées sur les grands modèles de langage. Standard de facto publié par OWASP en 2023, mis à jour annuellement. Chaque risque mapé aux trois piliers d'audit : création d'agents, sécurité LLM, production.

OWASP LLM Top 10 est au langage des LLM ce que OWASP Top 10 (Web) est aux applications web : un cadre de risques priorisés par impact et probabilité. Contrairement aux vulnérabilités web classiques (injection SQL, XSS), les risques LLM sont nouveaux et peu intuuitifs (prompt injection, jailbreaking, extraction de données d'entraînement).

Cette page résume les 10 risques avec mapping directe aux audits Strategic Reasoning.

01
Prompt Injection
Définition

L'attaquant injecte des instructions dans l'input utilisateur. Le modèle exécute l'instruction injectée au lieu de suivre le system prompt. Deux formes : directe (l'utilisateur contrôle l'input) et indirecte (données externes contiennent injection cachée).

Impact
  • Contournement garde-fous
  • Exfiltration données sensibles
  • Exécution actions non autorisées
  • Confidentialité système compromise
Audit couvert
Audit LLM
Remédiations
  • Séparation input/instructions stricte
  • Sanitisation données externes
  • Prompt hierarchies (système → data → user)
  • Monitoring prompt patterns dangereux
02
Insecure Output Handling
Définition

L'application traite l'output du LLM sans validation : injecte directement en HTML, exécute comme code, passe à un autre LLM en cascade. L'output n'est pas forcément sûr — le modèle peut être manipulé pour générer du code malveillant ou injecté.

Impact
  • XSS si output → HTML
  • Code injection si output → exec
  • Chained LLM attacks (cascade)
  • Propagation toxicité/bias
Audit couvert
Audit LLM
Remédiations
  • Validation schéma output
  • Encoding context-aware (HTML, SQL, etc.)
  • Sandboxing LLM cascades
  • Content Security Policy
03
Training Data Poisoning
Définition

L'attaquant injecte des données malveillantes dans le corpus d'entraînement : fausses étiquettes, instructions cachées, contenu contaminé. Au re-training, le modèle apprend le poison et peut changer de comportement ou halluciner systématiquement.

Impact
  • Backdoor dans le modèle
  • Drift comportement invisible
  • Hallucinations systématiques
  • Bias ou toxicité amplifiés
Audit couvert
Audit Production
Remédiations
  • Validation corpus avant training
  • Data lineage tracking complet
  • Anomaly detection distributions
  • Audit logs sources données
04
Model Denial of Service
Définition

L'attaquant surcharge le modèle avec des prompts complexes, boucles de tokens, ou entrées crafted qui consomment des ressources exponentielles. Résultat : timeout, coûts explosent, ou modèle devient inaccessible.

Impact
  • Service indisponible
  • Coûts API/compute énormes
  • Dégradation expérience utilisateur
  • Cascade failure en agents
Audit couvert
Audit Agents
Remédiations
  • Rate limiting strict par user
  • Token/input size limits
  • Timeout court par requête
  • Cost monitoring alertes
05
Supply Chain Vulnerabilities
Définition

Dépendances externes (modèles, packages Python, APIs tiers) contiennent des vulnérabilités. Exemple : fine-tuning sur Llama 2 compromis, utilisation d'API modération malveillante, packages avec backdoors.

Impact
  • Injection code malveillant
  • Model compromise (poisoned weights)
  • Data exfiltration silencieuse
  • Perte contrôle applicatif
Audit couvert
Audit Production
Remédiations
  • Pinning exact versions dépendances
  • Checksums/signatures modèles
  • Audit dépendances (Snyk, pip-audit)
  • Sandbox trusted boundaries
06
Sensitive Information Disclosure
Définition

Le modèle divulgue des données sensibles : PII du training set via requêtage itératif, secrets injectés en contexte, data de production visibles dans les réponses. Deux vecteurs : training data et contexte runtime.

Impact
  • Violation GDPR/RGPD
  • Compromission données personnelles
  • Extraction secrets (API keys, etc.)
  • Exposition propriété intellectuelle
Audit couvert
Audit LLM
Remédiations
  • Data minimization en contexte
  • PII masking en output
  • Access control données injectées
  • Differential privacy au fine-tune
07
Insecure Plugin Design
Définition

Les plugins/tools fournis au LLM ont des vulnérabilités : pas de validation input, pas d'authentification, pas d'authorization. Le modèle peut abuser du plugin pour accéder à des ressources ou causer des dégâts.

Impact
  • Accès ressources non autorisées
  • Injection via paramètres plugin
  • Escalade privilèges
  • Data corruption ou destruction
Audit couvert
Audit Agents
Remédiations
  • Validation schéma paramètres strict
  • Authentification plugin
  • Authorization granulaire par tool
  • Error handling sans info leakage
08
Excessive Agency
Définition

L'agent a trop de libertés : il décide unilatéralement d'exécuter des actions irréversibles (supprimer compte, transférer argent) sans supervision. Aucune limite sur les itérations, pas de human-in-the-loop pour les décisions critiques.

Impact
  • Actions irréversibles non voulues
  • Boucles infinies (coûts)
  • Chaînes d'actions non contrôlées
  • Violation règles métier
Audit couvert
Audit Agents
Remédiations
  • Max iterations limit (5-10)
  • Human approval actions critiques
  • Constraints orchestration strictes
  • Audit logging exhaustif
09
Overreliance
Définition

Confiance aveugle dans les réponses du LLM. L'utilisateur/application accepte la sortie modèle sans validation, sans check factualité, sans supervision. Le LLM peut halluciner, inventer, ou être manipulé.

Impact
  • Décisions basées sur hallucinations
  • Misinformation propagée
  • Compliance/audit violations
  • Responsabilité légale flou
Audit couvert
Audit Production
Remédiations
  • Validation factcheck outputs
  • Source citations obligatoires
  • Confidence scores explicites
  • Human review inputs critiques
10
Model Theft
Définition

L'attaquant extrait ou vole les weights du modèle, le fine-tuning, ou la logique applicative via black-box queries. Le modèle propriétaire est alors reproduit ailleurs sans autorisation.

Impact
  • Perte avantage compétitif
  • Reproduction modèle non autorisée
  • Coûts développement non amortis
  • IP compromise
Audit couvert
Audit Production
Remédiations
  • Rate limiting strict extraction
  • Model obfuscation/distillation
  • Monitoring behavior patterns
  • Watermarking modèles
Mapping aux audits
Comment ces risques se distribuent
Audit Risques OWASP couverts Focus
Audit LLM 01, 02, 06 Vulnérabilités modèle seul (prompt injection, data extraction)
Audit Agents 04, 07, 08 Orchestration & tool use (validation, DoS, excessive agency)
Audit Production 03, 05, 09, 10 Runtime & supply chain (training poisoning, monitoring, theft)

Audit complet : Consultez les trois piliers (création agents, sécurité LLM, production) pour une stratégie end-to-end couvrant l'ensemble du Top 10.

Red teaming : Garak (NVIDIA), PyRIT (Microsoft) et PromptBench couvrent tous les vecteurs du Top 10. Démarrer avec Garak pour tester rapidement.

← Retour accueil