MITRE ATLAS, la cartographie des attaques contre l'IA.
Adversarial Threat Landscape for Artificial-Intelligence Systems — la base de connaissance publique de tactiques et techniques d'attaque contre les systèmes IA/ML, maintenue par le MITRE. Cette page couvre l'intégralité des 16 tactiques et détaille plus de 50 techniques spécifiques aux LLM et aux agents IA, chacune reliée quand c'est possible à un cas réel documenté par ATLAS.
- Origine et filiation avec ATT&CK
- La matrice complète — 16 tactiques
- Injection & jailbreak
- Découverte & fuite d'information système
- RAG — empoisonnement & exfiltration
- Agents & outils
- Chaîne d'approvisionnement des outils d'agents
- Manipulation de la sortie
- Déni de service & harvesting de coûts
- Techniques ML transverses critiques pour les LLM
Origine et filiation avec ATT&CK
Le MITRE est une organisation à but non lucratif américaine qui gère des centres de recherche financés par le gouvernement fédéral. Elle est à l'origine du framework ATT&CK (Adversarial Tactics, Techniques & Common Knowledge), devenu la référence mondiale pour documenter les tactiques d'attaque en cybersécurité classique.
ATLAS applique la même méthodologie et la même structure aux systèmes d'intelligence artificielle et de machine learning : au lieu de documenter comment un attaquant compromet un réseau d'entreprise, ATLAS documente comment un attaquant compromet un modèle, un pipeline d'entraînement ou une application construite autour d'un LLM ou d'un agent. Le format partagé avec ATT&CK permet aux équipes de sécurité déjà familières du second de monter en compétence rapidement sur le premier.
ATLAS est un projet vivant : chaque publication de version ajoute des techniques, des cas réels et des mitigations. La version 2026.06 couverte ici documente 173 techniques (sous-techniques incluses) réparties en 16 tactiques, 35 mitigations et 63 études de cas — dont une part croissante concerne spécifiquement les LLM et les systèmes agentiques, catégorie qui a connu la plus forte croissance du référentiel depuis 2023.
Tay, le premier cas ATLAS largement médiatisé
Bien avant les LLM modernes, Microsoft a lancé Tay, un chatbot Twitter capable d'apprendre de ses conversations. Une campagne coordonnée d'utilisateurs l'a délibérément entraîné à tenir des propos injurieux en quelques heures ; Microsoft a coupé le service en moins de 24h. C'est l'un des cas fondateurs d'ATLAS et il illustre un principe qui reste vrai aujourd'hui : un système qui apprend de ses interactions est aussi un système que l'on peut empoisonner par ses interactions.
La matrice complète — 16 tactiques
Comme ATT&CK, ATLAS organise les connaissances en deux niveaux : les tactiques (le pourquoi — l'objectif poursuivi par l'attaquant à un instant donné) et les techniques (le comment — la méthode concrète pour atteindre cet objectif). Voici les 16 tactiques, dans l'ordre où une attaque les traverse typiquement — les deux tactiques surlignées (AI Model Access et AI Attack Staging) n'existent pas dans ATT&CK classique : elles ont été ajoutées spécifiquement pour l'IA.
| Tactique | Objectif de l'attaquant |
|---|---|
| Reconnaissance | Rassembler de l'information sur le système IA cible pour préparer l'attaque. |
| Resource Development | Constituer les ressources (infrastructure, modèles, comptes) nécessaires à l'opération. |
| Initial Access | Obtenir un premier point d'entrée dans le système IA. |
| AI Model Access | Obtenir un accès (API, boîte noire, poids complets) au modèle lui-même. |
| Execution | Exécuter du code ou du contenu malveillant embarqué dans des artefacts IA. |
| Persistence | Maintenir un point d'ancrage via des artefacts ou des logiciels IA. |
| Privilege Escalation | Obtenir des permissions plus élevées que celles initialement accordées. |
| Defense Evasion | Éviter d'être détecté par les outils de sécurité assistés par IA. |
| Credential Access | Voler des identifiants et mots de passe accessibles via le système IA. |
| Discovery | Cartographier l'environnement IA de la victime (modèles, agents, outils, données). |
| Lateral Movement | Se déplacer à travers l'environnement IA vers d'autres ressources. |
| Collection | Rassembler les artefacts IA et informations utiles à l'objectif final. |
| AI Attack Staging | Exploiter la connaissance acquise du système cible pour affiner et préparer l'attaque. |
| Exfiltration | Voler des artefacts IA (poids, données) ou des informations sur le système. |
| Command and Control | Communiquer avec les systèmes IA compromis pour les piloter à distance. |
| Impact | Manipuler, interrompre, discréditer ou détruire les systèmes et données IA. |
Le reste de cette page se concentre sur le sous-ensemble de techniques directement pertinentes pour les LLM et les agents IA — la spécialité de ce site. ATLAS documente environ 120 techniques supplémentaires couvrant le machine learning classique (vision par ordinateur, détection de malware, systèmes de recommandation) qui sortent du périmètre de DEEP-5 ; la matrice complète est consultable sur atlas.mitre.org.
Injection & jailbreak
Le cœur du problème LLM : comment un attaquant fait dévier un modèle de ses instructions d'origine, et comment il maquille cette manipulation pour la faire passer inaperçue.
LLM Prompt Injection
Un attaquant fabrique une entrée qui fait agir le LLM d'une façon non prévue, en lui faisant ignorer tout ou partie de ses instructions d'origine au profit de celles de l'attaquant. C'est souvent le vecteur d'accès initial qui ouvre la voie à toutes les autres techniques de cette page.
- .000 Direct L'attaquant injecte lui-même le prompt malveillant en tant qu'utilisateur du LLM.
- .001 Indirect Le prompt malveillant est injecté via une source de données tierce que le LLM ingère (page web, document, email) — la variante la plus dangereuse pour les systèmes connectés.
- .002 Triggered L'injection se déclenche via une action utilisateur ou un événement système futur, souvent pour cibler des agents IA activés par un déclencheur précis.
LLM Jailbreak
Faire ignorer, contourner ou désactiver les comportements d'alignement et les guardrails d'un LLM pour en extraire des réponses normalement refusées. Les stratégies documentées par ATLAS incluent le roleplay/changement de persona, la fictionnalisation (« c'est pour un scénario »), l'escalade multi-tours (Crescendo — commencer anodin, établir la confiance, puis franchir progressivement les limites), les formats de sortie contraints (forcer un JSON/YAML qui contourne le refus), et des approches algorithmiques qui automatisent la recherche de jailbreaks à grande échelle. Sur les modèles open-weight, un jailbreak peut aussi se faire par modification directe des poids ou suppression des mécanismes de sécurité.
LLM Prompt Obfuscation
Dissimuler une injection pour échapper à la détection humaine ou aux guardrails : texte de la même couleur que le fond, éléments HTML cachés, instructions dissimulées dans les métadonnées (EXIF d'une image, tags ID3 d'un audio), ou encodage (base64, ROT13) que le LLM sait décoder mais qu'un filtre de motifs simples ne reconnaît pas.
LLM Prompt Crafting
Une fois la connaissance du système cible acquise (via les techniques de découverte ci-dessous), l'attaquant affine son prompt de façon itérative jusqu'à ce qu'il contourne les défenses de façon fiable et reproductible.
Prompt Infiltration via Public-Facing Application
L'attaquant dépose un prompt malveillant dans une application publique (email, OneDrive, Google Drive, ticket Jira) avec l'intention qu'il soit ingéré plus tard par un LLM — via indexation RAG, déclenchement d'un agent, ou lecture par un utilisateur. Le prompt peut persister longtemps et affecter plusieurs utilisateurs. Inclut l'infiltration via OCR : instructions cachées dans des images, captures d'écran ou factures scannées.
Delay Execution of LLM Instructions
Inclure une instruction conditionnelle (« si l'utilisateur soumet une nouvelle requête... ») pour que le prompt malveillant s'exécute plus tard, contournant les contrôles qui bloquent certains outils uniquement pendant le tour de conversation où une donnée non fiable est présente dans le contexte.
LLM Prompt Self-Replication
Un prompt injection conçu pour se faire recopier tel quel par le LLM dans sa propre sortie — lui permettant de se propager vers d'autres LLM connectés et de persister dans le système. Généralement combiné à un jailbreak ou à une fuite de données.
Découverte & fuite d'information système
Avant d'attaquer efficacement, l'adversaire cartographie ce que le LLM sait de lui-même — et cette même surface sert aussi à en faire fuir le contenu.
Extract LLM System Prompt
Extraire le system prompt d'un LLM, par injection (le faire révéler ses propres instructions) ou par accès à un fichier de configuration. Le system prompt est souvent un élément de l'avantage concurrentiel d'un fournisseur IA — une propriété intellectuelle à part entière.
Discover LLM System Information
Découvrir des informations sur le fonctionnement interne du LLM — system prompt complet, caractères spéciaux significatifs, mots-clés indiquant les fonctionnalités disponibles — pour comprendre les capacités du système et affiner un prompt malveillant.
- .000 Special Character Sets Découverte des délimiteurs utilisés (ex : pour séparer contexte RAG et prompt utilisateur), exploitables ensuite pour confondre le modèle.
- .001 System Instruction Keywords Découverte de mots-clés ayant une signification spéciale (noms de fonctions, d'objets) pour manipuler le LLM ou appeler des plugins.
- .002 System Prompt Découverte des instructions système fournies par le concepteur, pour comprendre les capacités et contourner les guardrails.
LLM Data Leakage
Concevoir des prompts qui induisent le LLM à divulguer des informations sensibles — données privées d'un utilisateur, informations propriétaires issues des données d'entraînement, de sources connectées, ou d'autres utilisateurs du même système.
Discover LLM Hallucinations
Interroger systématiquement des LLM pour identifier des entités hallucinées — noms de paquets logiciels, commandes, URLs, noms d'organisations — sans source réelle correspondante. Plusieurs LLM produisent souvent les mêmes hallucinations, ce qui rend l'attaque transférable à d'autres modèles.
Publish Hallucinated Entities
Créer une entité contrôlée par l'attaquant (paquet, site web, adresse email) correspondant à une hallucination découverte à l'étape précédente. Quand la victime interagit avec cette entité — pensant suivre une recommandation légitime du LLM — l'attaque se déclenche.
RAG — empoisonnement & exfiltration
La technique la plus sous-estimée en audit : le corpus indexé par un système RAG est une surface d'écriture autant qu'une surface de lecture.
Gather RAG-Indexed Targets
Identifier quelles sources de données alimentent un système RAG — via la documentation publique du système ou en observant les références aux sources externes dans ses réponses — pour cibler ensuite ces sources en empoisonnement.
RAG Poisoning
Injecter du contenu malveillant dans une source indexée par un RAG, pour contaminer les résultats de recherche d'un futur thread. Le contenu peut être ciblé pour ressortir systématiquement sur une requête utilisateur précise, et contenir de fausses informations, des prompt injections, ou de fausses entrées RAG.
False RAG Entry Injection
Introduire une fausse entrée dans la base RAG : un contenu conçu pour être interprété par le LLM comme un document légitime récupéré, dissimulé à l'intérieur d'une entrée RAG normale. Cette dissimulation permet de contourner les outils de surveillance des données et empêche la suppression directe du faux document.
RAG Credential Harvesting
Utiliser l'accès à un LLM pour collecter des identifiants stockés par inadvertance dans des documents internes ingérés dans une base RAG, puis récupérés par un agent IA lors d'une requête ultérieure.
Data from AI Services (sous-technique RAG Databases)
Utiliser l'accès à un service IA d'entreprise pour collecter des informations sensibles auxquelles un utilisateur normal n'aurait pas directement accès — un agent configuré avec des accès élargis à des bases RAG devient une cible de choix, capable de retrouver la majorité des documents internes d'une organisation en une seule requête bien formulée.
Agents & outils
C'est la catégorie qui a le plus grossi dans ATLAS depuis 2024 — le reflet direct de l'essor des agents IA avec accès à des outils et à des actions réelles.
AI Agent Tool Invocation
Utiliser l'accès à un agent pour invoquer les outils auxquels il a accès — appels d'API vers des applications intégrées, exécution de code, accès à des sources de données. Certains agents ont accès à des outils que l'utilisateur humain lui-même ne peut pas invoquer directement, ce qui permet à l'attaquant de gagner des privilèges via l'agent plutôt que par lui-même.
Discover AI Agent Configuration
Découvrir la configuration d'un agent — outils accessibles, sources de données, tableaux de bord — en y accédant directement ou en posant simplement la question à l'agent (« à quels outils as-tu accès ? »).
- .000 Embedded Knowledge Découvrir les sources de données/connaissances accessibles à l'agent, potentiellement des données propriétaires ou des identifiants.
- .001 Tool Definitions Découvrir les outils disponibles pour comprendre les chemins d'exfiltration possibles (envoi d'email, écriture de fichiers).
- .002 Activation Triggers Découvrir les mots-clés ou événements qui activent l'agent, pour le déclencher depuis l'extérieur de son environnement.
- .003 Call Chains Extraire les chaînes d'appel reliant une entrée utilisateur ou une sortie de LLM à un point d'exécution sensible (
exec,eval), exploitables ensuite via prompt injection.
Modify AI Agent Configuration
Modifier les fichiers de configuration d'un agent pour que le changement persiste au-delà d'une seule session et affecte tous les agents qui partagent cette configuration — modification du system prompt, remplacement des sources de connaissance, ou désactivation des contrôles de sécurité qui exigeraient normalement une validation humaine.
AI Agent Context Poisoning
Manipuler le contexte utilisé par le LLM d'un agent pour influencer durablement ses réponses et actions futures.
- .000 Memory Injecter de fausses « mémoires » persistantes via une conversation normale (« souviens-toi que... »), qui affecteront les sessions futures.
- .001 Thread Introduire des instructions malveillantes qui persistent pour le reste d'un fil de discussion — potentiellement partagé entre plusieurs utilisateurs (ex : un agent actif dans un canal Slack).
Manipulate User LLM Chat History
Effacer ou modifier l'historique de conversation pour couvrir les traces d'une manipulation — possible si l'attaquant dispose des jetons d'authentification de la victime. Les interfaces de chat desktop, qui ne rafraîchissent pas toujours l'affichage en direct, facilitent le fait que la manipulation passe inaperçue.
Exfiltration via AI Agent Tool Invocation
Invoquer un outil d'agent capable d'écriture pour exfiltrer des données vers l'attaquant — encodées dans les paramètres d'entrée d'un email envoyé, d'un document modifié, d'un enregistrement CRM mis à jour, ou d'un média généré. L'outil invoqué peut être parfaitement légitime : c'est son détournement via prompt injection qui constitue l'attaque.
AI Agent Tool Credential Harvesting
Utiliser l'accès à un agent pour récupérer des identifiants stockés dans les sources auxquelles ses outils sont connectés — SharePoint, OneDrive, dépôts de code (GitHub/GitLab), Slack, ou outils de prise de notes locaux.
Credentials from AI Agent Configuration
Récupérer directement des identifiants (clés API, jetons, chaînes de connexion) stockés en clair dans les fichiers de configuration d'un agent — souvent placés là par commodité plutôt que dans un coffre-fort de secrets dédié.
AI Agent Tool Data Poisoning
Placer du contenu malveillant à l'endroit où un outil d'agent ira le chercher — ciblé pour ressortir sur des requêtes courantes, contenant de fausses informations ou des prompt injections.
AI Agent Clickbait
Concevoir un contenu web trompeur destiné à piéger un agent IA capable d'utiliser un navigateur ou une interface graphique — en exploitant son interprétation des éléments visuels ou d'un texte à consonance d'instruction — pour le pousser à cliquer, copier du code, ou naviguer vers une page qui exécutera une action malveillante.
Data Destruction via AI Agent Tool Invocation
Invoquer un outil d'agent capable d'opérations destructrices pour détruire des données ou des fichiers, à des fins de sabotage ou d'interruption de service.
Deploy AI Agent
Déployer un agent dans l'environnement de la victime pour exécuter des actions pour le compte de l'attaquant — configuré avec un system prompt initial, un accès élargi aux outils, et une confiance excessive désactivant les confirmations utilisateur qui bloqueraient normalement ses actions.
Chaîne d'approvisionnement des outils d'agents (MCP & co.)
Les serveurs d'outils pour agents (au sens large, incluant l'écosystème MCP) ont explosé en popularité — et sont massivement publiés sans contrôle de sécurité, exactement comme les packages npm ou PyPI avant eux.
AI Agent Tool (chaîne d'approvisionnement)
Cibler les outils d'agent comme moyen de compromettre la chaîne d'approvisionnement IA d'une victime. Un outil compromis donne à l'attaquant des accès et permissions larges sur le système via les autres capacités de l'agent. Des milliers de serveurs MCP sont publics, souvent sur GitHub ou npm, sans garde-fous.
Poisoned AI Agent Tool
La victime invoque un outil empoisonné en interagissant avec son agent — l'outil exécute alors une prompt injection ou détourne l'invocation d'un autre outil.
Publish Poisoned AI Agent Tool
Créer et publier un outil d'agent empoisonné sur un dépôt open source, un registre de paquets, ou un hub de partage d'outils — des canaux souvent peu ou pas régulés.
AI Agent Tool Poisoning
Compromettre un outil déjà légitimement intégré à l'environnement de l'agent (y compris via une connexion MCP), en modifiant ses paramètres, sa description, ou en y injectant une logique cachée — pour maintenir une influence durable sur les décisions de l'agent sans éveiller les soupçons.
AI Supply Chain Rug Pull
Publier un composant IA légitime, gagner l'adoption des utilisateurs, puis pousser une mise à jour malveillante — contournant ainsi le contrôle habituellement renforcé lors de l'évaluation initiale d'une dépendance.
AI Supply Chain Reputation Inflation
Construire ou exploiter des signaux de confiance authentiques (comptes développeurs établis, téléchargements, étoiles GitHub, forks) pour faire paraître légitime un composant IA avant d'y introduire une version compromise — passant ainsi les contrôles humains et automatisés sans éveil de soupçon.
postmark-mcp sur npm, atteint plus de 1 000 téléchargements/semaine, puis publié une version malveillante ajoutant l'adresse email de l'attaquant en copie cachée de tous les emails envoyés via l'outil — exfiltrant silencieusement le courrier de tous les utilisateurs ayant mis à jour le paquet. Un exemple manuel complet du rug pull combiné à l'inflation de réputation.
Manipulation de la sortie
Une fois le modèle manipulé, encore faut-il que sa réponse paraisse légitime à l'utilisateur ou serve de canal d'exfiltration silencieux.
LLM Response Rendering
Faire répondre le LLM avec une information privée cachée dans un élément rendu automatiquement par le client — typiquement une image en Markdown ou HTML dont l'URL encode la donnée volée en paramètre de requête. Aucun clic n'est requis : le simple rendu de l'image côté client envoie la donnée au serveur de l'attaquant.
LLM Trusted Output Components Manipulation
Manipuler des éléments de la réponse du LLM pour la faire paraître digne de confiance — ton, liens, actions recommandées, métadonnées de document, ou citations — afin de pousser l'utilisateur à agir sur la base d'une information falsifiée.
- .000 Citations Fournir une mauvaise citation, en inventer une nouvelle, ou citer la bonne source mais avec un contenu fourni par l'attaquant.
Déni de service & harvesting de coûts
Les systèmes IA sont des goulots d'étranglement de calcul coûteux — ce qui en fait une cible directe pour l'épuisement de ressources et le sabotage financier.
Denial of AI Service
Inonder un système IA de requêtes pour dégrader ou interrompre le service. Les systèmes IA nécessitent souvent une quantité importante de calcul spécialisé, ce qui en fait des goulots d'étranglement coûteux et faciles à saturer avec des entrées conçues pour exiger un calcul disproportionné.
Cost Harvesting
Pousser délibérément un service IA au-delà de sa capacité normale dans le but d'augmenter son coût d'exploitation — via des requêtes nombreuses et simples (Excessive Queries), peu nombreuses mais coûteuses (Resource-Intensive Queries), ou via des prompts adverses injectés dans le contexte d'un agent. Particulièrement pertinent pour les API LLM facturées à l'usage : l'attaquant peut gonfler la facture, déclencher l'auto-scaling (amplifiant encore le coût), ou saturer les files d'attente GPU au point de dégrader le service pour les utilisateurs légitimes.
- .002 Agentic Resource Consumption Forcer un agent à effectuer des appels d'outils coûteux et inutiles — via des instructions du type « traduis ce texte dans les 50 langues principales » ou « résume ceci 1000 fois » — ou à entrer dans des boucles d'auto-délégation récursives qui provoquent des dépassements de pile et une consommation de ressources excessive.
Techniques ML transverses critiques pour les LLM
Ces techniques existaient avant les LLM dans ATLAS (issues du machine learning classique), mais restent directement applicables aux modèles de langage et à leurs pipelines de fine-tuning ou de RAG.
Poison Training Data
Corrompre les données ou les labels utilisés pour entraîner un modèle IA, y intégrant des vulnérabilités difficiles à détecter — activées plus tard par un déclencheur spécifique (Insert Backdoor Trigger). Les données empoisonnées peuvent provenir d'une compromission de la chaîne d'approvisionnement, ou être injectées après un premier accès au système.
Craft Adversarial Data
Modifier une entrée pour provoquer un effet précis chez le modèle cible (mauvaise classification, détection manquée, consommation d'énergie maximisée), tout en restant suffisamment proche de l'original pour qu'un humain ne remarque rien. Selon l'accès dont dispose l'attaquant, plusieurs approches existent : optimisation en boîte blanche (accès complet au modèle), en boîte noire (accès par requêtes seulement), transfert boîte noire (via un modèle de substitution), ou modification manuelle.
Exfiltration via AI Inference API
Exfiltrer des informations privées via l'accès à l'API d'inférence d'un modèle — en déduisant si une donnée précise faisait partie du jeu d'entraînement (Infer Training Data Membership), en inversant le modèle pour reconstruire des données d'entraînement (Invert AI Model), ou en extrayant le modèle lui-même par interrogation massive à des fins de vol de propriété intellectuelle.
External Harms
Utiliser l'accès obtenu à un système IA pour causer des préjudices externes à ce système : préjudice financier ou réputationnel pour l'organisation, préjudice direct pour ses utilisateurs, ou préjudice sociétal plus large (désinformation à grande échelle, contenu illicite généré en masse).