Apprenez à jailbreaker une IA en injectant des prompts dans un vrai modèle de langage pour fuiter son system prompt caché et abuser de son outil interne. Un lab pratique OWASP LLM01 et LLM06 à résoudre depuis le Terminal d'attaque avec curl.
La prompt injection est le premier risque de sécurité des applications à base de grands modèles de langage (OWASP LLM01). Elle survient lorsqu'une entrée utilisateur non fiable atteint un modèle qui porte aussi des instructions de confiance, et que l'attaquant façonne cette entrée pour outrepasser ces instructions : fuiter des secrets, ignorer les règles de sécurité ou déclencher des actions que le développeur n'avait jamais prévues. Apprendre à jailbreaker une IA dans un cadre sûr et légal est le moyen le plus rapide de comprendre pourquoi cette classe de bugs est si difficile à éradiquer.
Vous discutez avec Qwenly, un assistant de support client propulsé par un vrai modèle de langage exécuté en local. Rien n'est simulé ici : un modèle authentique lit un system prompt et applique son propre entraînement de sécurité, et une surcouche ajoute un filtre en entrée et un filtre en sortie, exactement comme les équipes en production greffent des garde-fous sur un LLM. En travaillant entièrement depuis le Terminal d'attaque avec curl sur son endpoint /api/chat, vous injecterez des prompts pour fuiter le flag utilisateur caché dans son system prompt, puis vous convaincrez son outil interne de base de connaissances de lire un fichier bien en dehors du périmètre qui lui a été confié (le flag root). Les astuces évidentes sont bloquées : il faut donc trouver ce qu'un petit modèle peut, ou non, se laisser convaincre de faire.
Chaque entreprise qui livre une fonctionnalité d'IA se défend désormais contre ces attaques précises. La prompt injection et l'agentivité excessive (OWASP LLM06) sont derrière des incidents réels comme l'exploit zero-click EchoLeak de 2025 contre Microsoft 365 Copilot. Les produits de garde-fous, le durcissement du system prompt et les filtres de sortie sont les défenses standard, et ce lab pratique vous montre comment elles échouent du côté de l'attaquant. S'entraîner à la prompt injection sur HackerDNA développe l'instinct de repérer un filtre d'entrée faible, de remarquer quand la sortie d'un modèle peut passer sous un redacteur naïf, et de comprendre que donner un outil à un LLM confie cette capacité à quiconque peut lui parler.
Créez un compte gratuit et pratiquez la cybersécurité.
Créez un compte gratuit pour démarrer votre propre serveur dédié, soumettre des flags et gagner des XP au classement.
Commencer à Hacker GratuitementChoisissez comment vous voulez commencer
Connectez-vous à votre compte