Aprenda a fazer jailbreak de uma IA injetando prompts em um modelo de linguagem real para vazar seu system prompt oculto e abusar de sua ferramenta interna. Um lab prático de OWASP LLM01 e LLM06 para resolver no Terminal de Ataque com curl.
Prompt injection é o principal risco de segurança das aplicações com grandes modelos de linguagem (OWASP LLM01). Ela ocorre quando uma entrada de usuário não confiável chega a um modelo que também carrega instruções confiáveis, e o atacante molda essa entrada para sobrepor tais instruções: vazar segredos, ignorar regras de segurança ou disparar ações que o desenvolvedor nunca pretendeu. Aprender a fazer jailbreak de uma IA em um ambiente seguro e legal é a forma mais rápida de entender por que essa classe de bug é tão difícil de eliminar.
Você está conversando com o Qwenly, um assistente de suporte ao cliente movido por um modelo de linguagem real, executado localmente. Nada aqui é falso: um modelo genuíno lê um system prompt e aplica o próprio treinamento de segurança, e uma camada adiciona um filtro de entrada e um filtro de saída ao redor dele, exatamente como as equipes em produção acoplam guardrails a um LLM. Trabalhando inteiramente no Terminal de Ataque com curl no endpoint /api/chat, você fará prompt injection para vazar a flag de usuário escondida no system prompt e então convencerá a ferramenta interna de base de conhecimento a ler um arquivo bem fora do escopo que lhe foi dado (a flag de root). Os truques óbvios estão bloqueados, então você precisa descobrir o que um modelo pequeno pode, ou não, ser convencido a fazer.
Toda empresa que lança um recurso de IA agora se defende exatamente desses ataques. Prompt injection e agência excessiva (OWASP LLM06) estão por trás de incidentes reais como o exploit zero-click EchoLeak de 2025 contra o Microsoft 365 Copilot. Produtos de guardrail, endurecimento do system prompt e filtros de saída são as defesas padrão, e este lab prático mostra como elas falham do lado do atacante. Praticar prompt injection no HackerDNA desenvolve o instinto de identificar um filtro de entrada fraco, perceber quando a saída de um modelo pode ser contrabandeada por um redator ingênuo e entender que dar uma ferramenta a um LLM entrega essa capacidade a qualquer um que possa falar com ele.
Crie uma conta gratuita e pratique cibersegurança.
Crie uma conta gratuita para iniciar seu próprio servidor dedicado, enviar flags e ganhar XP no ranking.
Começar a Hackear GrátisEscolha como deseja começar
Entre na sua conta