Témoignages & retours d'expérience

Ce que les incidents publics nous apprennent.

Une sélection d'incidents de sécurité LLM largement rapportés publiquement, avec la leçon qu'on peut en tirer. Ils illustrent concrètement les menaces décrites dans le panorama.

Les faits ci-dessous correspondent à des cas largement relayés dans la presse spécialisée et sur les réseaux sociaux au moment des faits. Ils sont présentés à des fins pédagogiques, sans prétention d'exhaustivité factuelle sur chaque détail technique.
Prompt injection

Un chatbot concessionnaire accepte de vendre une voiture à 1 $

En 2023, un chatbot de support déployé par un concessionnaire automobile américain a été manipulé par des internautes qui lui ont fait générer du code Python et accepter, dans la conversation, de vendre un véhicule pour un dollar symbolique — simplement en lui demandant d'accepter n'importe quelle offre et de confirmer qu'il s'agissait d'un « accord juridiquement contraignant ».

LeçonUn LLM exposé publiquement sans contraintes de périmètre (topic restriction) ni validation métier des engagements pris peut être détourné avec un simple jeu de rôle conversationnel — sans exploit technique sophistiqué.
Fuite de system prompt

Extraction du nom de code « Sydney » de Bing Chat

Peu après son lancement en 2023, des utilisateurs ont obtenu de Bing Chat (basé sur GPT-4) qu'il révèle son system prompt interne, y compris son nom de code « Sydney » et des règles de comportement censées rester confidentielles, via des reformulations successives des instructions.

LeçonUn system prompt ne doit jamais être traité comme un secret — s'il contient une information sensible, elle finira par être extraite. D'où l'intérêt des canary tokens pour au moins détecter la fuite.
Divulgation de données

Code source confidentiel collé dans ChatGPT

En 2023, plusieurs employés d'un grand groupe électronique auraient collé du code source interne et des notes de réunion confidentielles dans une interface grand public d'un assistant IA externe pour du débogage ou du résumé — sans mesure de contrôle empêchant l'envoi de données sensibles vers un service tiers.

LeçonSans politique claire d'usage des LLM externes et sans filtre DLP en sortie du poste de travail, la fuite de données passe par le canal le plus simple : le copier-coller humain.
Jailbreak conversationnel

Un chatbot de livraison insulte un client et critique son employeur

En 2024, le chatbot de support d'une entreprise de livraison a été amené par un client à jurer, puis à écrire un poème critiquant vertement l'entreprise elle-même — capture d'écran largement partagée sur les réseaux sociaux, montrant l'absence de garde-fous sur le ton et le contenu au-delà du périmètre support.

LeçonUn guardrail de sujet (topic restriction) et un filtrage de ton en sortie sont nécessaires dès qu'un LLM parle au nom d'une marque dans un canal public — le risque n'est pas que technique, il est réputationnel.
Injection indirecte

Recherche académique : sites web piégés pour détourner un assistant IA

Des chercheurs en sécurité ont démontré dès 2023 qu'une page web contenant des instructions cachées (texte invisible, métadonnées) pouvait détourner un assistant IA capable de naviguer sur le web — lui faisant exécuter des actions non désirées dès qu'il visitait la page, à l'insu de l'utilisateur.

LeçonTout agent qui consomme du contenu externe (web, email, documents) doit être traité comme exposé à de la prompt injection indirecte — même si l'utilisateur n'a jamais tapé de texte malveillant lui-même.