Ce que les incidents publics nous apprennent.
Une sélection d'incidents de sécurité LLM largement rapportés publiquement, avec la leçon qu'on peut en tirer. Ils illustrent concrètement les menaces décrites dans le panorama.
Un chatbot concessionnaire accepte de vendre une voiture à 1 $
En 2023, un chatbot de support déployé par un concessionnaire automobile américain a été manipulé par des internautes qui lui ont fait générer du code Python et accepter, dans la conversation, de vendre un véhicule pour un dollar symbolique — simplement en lui demandant d'accepter n'importe quelle offre et de confirmer qu'il s'agissait d'un « accord juridiquement contraignant ».
Extraction du nom de code « Sydney » de Bing Chat
Peu après son lancement en 2023, des utilisateurs ont obtenu de Bing Chat (basé sur GPT-4) qu'il révèle son system prompt interne, y compris son nom de code « Sydney » et des règles de comportement censées rester confidentielles, via des reformulations successives des instructions.
Code source confidentiel collé dans ChatGPT
En 2023, plusieurs employés d'un grand groupe électronique auraient collé du code source interne et des notes de réunion confidentielles dans une interface grand public d'un assistant IA externe pour du débogage ou du résumé — sans mesure de contrôle empêchant l'envoi de données sensibles vers un service tiers.
Un chatbot de livraison insulte un client et critique son employeur
En 2024, le chatbot de support d'une entreprise de livraison a été amené par un client à jurer, puis à écrire un poème critiquant vertement l'entreprise elle-même — capture d'écran largement partagée sur les réseaux sociaux, montrant l'absence de garde-fous sur le ton et le contenu au-delà du périmètre support.
Recherche académique : sites web piégés pour détourner un assistant IA
Des chercheurs en sécurité ont démontré dès 2023 qu'une page web contenant des instructions cachées (texte invisible, métadonnées) pouvait détourner un assistant IA capable de naviguer sur le web — lui faisant exécuter des actions non désirées dès qu'il visitait la page, à l'insu de l'utilisateur.