Inteligência Artificial
Prompt injection e extração de dados em LLMs: guia 2026
Guia 2026 sobre prompt injection: OWASP LLM e Agentic Top 10, caso EchoLeak, extração de dados em RAG e agentes e as defesas que resistem na prática.
Por Marco Antonio Claro Santos · Fundador e estrategista de SEO B2B da MarkSaint.

Prompt injection continua sendo a principal ameaça a aplicações com modelos de linguagem em 2026. Pelo terceiro ano seguido, o ataque ocupa o topo da lista OWASP GenAI / LLM Top Ten. O que mudou foi o tamanho do estrago possível. Em 2023, uma injeção bem-sucedida fazia um chatbot dizer bobagens. Hoje, o mesmo ataque pode fazer um assistente corporativo ler o SharePoint da empresa e mandar o conteúdo para fora, sem que ninguém clique em nada.
Este guia reúne o que artigos acadêmicos, relatórios técnicos e incidentes documentados mostram sobre extração de dados em LLMs. Ele cobre as técnicas de ataque, os dois frameworks da OWASP em vigor, a anatomia de um ataque real e as defesas que continuam de pé quando o atacante se adapta.
O que é prompt injection?
Prompt injection é um ataque em que instruções maliciosas, inseridas no texto que um LLM processa, alteram o comportamento do modelo. Ele acontece porque o modelo lê instruções confiáveis do desenvolvedor e dados não confiáveis de usuários ou fontes externas no mesmo contexto, sem conseguir separar com segurança um do outro.
Quem trabalha com segurança web reconhece o padrão. A SQL injection explorava bancos de dados que misturavam comando e dado na mesma string, e a solução veio com consultas parametrizadas, que separam os dois canais de forma rígida. Nos LLMs essa separação ainda não existe. Para o modelo, tudo é texto, e qualquer texto pode ser lido como ordem.
O ataque aparece em duas formas.
Injeção direta (DPI). O atacante escreve as instruções no próprio campo de conversa, tentando sobrepor as regras do sistema. É o caso clássico de quem tenta convencer o chatbot de atendimento a revelar as próprias instruções.
Injeção indireta (IPI). As instruções ficam plantadas em páginas web, documentos, e-mails, issues de repositório ou bases de conhecimento que o modelo consulta. O usuário legítimo faz uma pergunta comum, o sistema busca o conteúdo contaminado e o modelo passa a seguir ordens de um terceiro. Em sistemas com Retrieval-Augmented Generation (RAG) e em agentes que navegam na web, é a forma mais perigosa, porque a vítima não vê o ataque acontecer.
A gravidade depende de quanto acesso o sistema tem. Os impactos documentados incluem divulgação de informações sensíveis, respostas manipuladas, acesso não autorizado a funções, execução de comandos em sistemas conectados e interferência em decisões de negócio.
Prompt injection, jailbreak e vazamento são a mesma coisa?
Não, embora as técnicas se sobreponham e os termos apareçam misturados na imprensa. A diferença está no alvo.
Conceito | Alvo | Exemplo de dano |
|---|---|---|
Jailbreak | As políticas de segurança do próprio modelo | Fazer o modelo produzir conteúdo que ele recusaria |
Prompt injection | A aplicação construída sobre o modelo | Fazer o assistente seguir ordens de um e-mail recebido |
Vazamento de dados | A informação a que o sistema tem acesso | Contexto oculto, documentos internos ou dados de treino saindo do sistema |
Envenenamento | O que o modelo aprende ou recupera | Base RAG ou dataset contaminado que muda respostas futuras |
Na prática, a prompt injection costuma ser a porta de entrada e o vazamento é o resultado. Um mesmo incidente pode envolver as quatro categorias.
O que mudou no OWASP Top 10 para LLMs em 2026?
A mudança principal está no método. Para 2026, a OWASP comparou o julgamento dos especialistas com um conjunto de 7.714 incidentes documentados publicamente, dos quais 6.639 tinham informação suficiente para classificação. O voto da comunidade ficou com 75% do peso final e os dados de incidentes com os 25% restantes.
Essa comparação trouxe um achado contraintuitivo. Prompt injection ficou em primeiro no voto dos especialistas, mas fora do top 10 quando se olhou só o registro de incidentes. A OWASP chama isso de efeito da defesa: as organizações investem pesado para conter o problema, e os registros públicos subestimam um risco que equipes maduras já gastam muito para administrar. A desinformação mostrou o padrão oposto, pouco temida pelos especialistas e frequente nos incidentes, e subiu do nono para o sétimo lugar.
Três mudanças afetam diretamente a extração de dados.
Escopo ampliado da prompt injection. A categoria passou a cobrir ataques cross-modal escondidos em imagens ou áudio, e o envenenamento de dados e modelos absorveu a subversão por fine-tuning.
Novo nome para o vazamento de system prompt. Virou "hidden context exposure" (exposição de contexto oculto), cobrindo esquemas de ferramentas, lógica de políticas, regras de fluxo e outros detalhes operacionais além do prompt.
Agência excessiva em alta. Subiu do sexto para o terceiro lugar, sinal de que a OWASP passou a olhar para as consequências de dar autoridade operacional aos modelos.
A lista completa, segundo a tabela comparativa publicada pela Aembit:
2026 | Risco | Posição em 2025 |
|---|---|---|
LLM01 | Prompt Injection | 1 |
LLM02 | Sensitive Information Disclosure | 2 |
LLM03 | Excessive Agency | 6 |
LLM04 | Supply Chain | 3 |
LLM05 | Data and Model Poisoning | 4 |
LLM06 | Unbounded Consumption | 10 |
LLM07 | Misinformation | 9 |
LLM08 | Hidden Context Exposure | 7 (antes System Prompt Leakage) |
LLM09 | Vector and Embedding Weaknesses | 8 |
LLM10 | Improper Output Handling | 5 |
A frase que resume a edição veio dos coordenadores do projeto. Eles recomendam parar de tentar construir um modelo impossível de enganar e desenhar o sistema ao redor dele, para que nada importante quebre quando o modelo for enganado.
O que é o OWASP Top 10 para aplicações agênticas?
É a lista irmã, dedicada ao que acontece quando o modelo deixa de só responder e passa a agir. O OWASP Top 10 for Agentic Applications 2026 foi publicado pelo OWASP GenAI Security Project em 9 de dezembro de 2025, com identificadores de ASI01 a ASI10. A própria OWASP recomenda que, quando o modelo se torna um agente, a lista de LLMs seja lida junto com a de aplicações agênticas, e a maioria das implantações corporativas vai precisar das duas.
Código | Risco | Incidente associado pela OWASP |
|---|---|---|
ASI01 | Agent Goal Hijack (sequestro do objetivo do agente) | EchoLeak |
ASI02 | Tool Misuse and Exploitation | Amazon Q |
ASI03 | Identity and Privilege Abuse | Credenciais vazadas operando além do escopo |
ASI04 | Agentic Supply Chain Vulnerabilities | Exploit do MCP do GitHub |
ASI05 | Unexpected Code Execution | RCE no AutoGPT |
ASI06 | Memory and Context Poisoning | |
ASI07 | Insecure Inter-Agent Communication | |
ASI08 | Cascading Failures | |
ASI09 | Human-Agent Trust Exploitation | |
ASI10 | Rogue Agents | Banco de produção apagado no Replit |
Fontes da tabela: OWASP e NeuralTrust.
O ASI01 é o parente direto da prompt injection. Nele, o atacante redireciona o objetivo do agente pelo conteúdo que ele lê, e não por código que ele executa, de modo que o agente persegue a meta do atacante acreditando que ainda serve ao usuário. Um exemplo dado por um dos líderes do projeto é a fatura em PDF de um fornecedor com instruções escondidas para priorizar o pagamento daquela conta e encaminhar todas as faturas para um e-mail externo.
O framework introduz também o princípio de least agency (agência mínima). Inspirado no privilégio mínimo, ele propõe dar ao agente só a autonomia necessária para tarefas seguras e delimitadas, com a autonomia conquistada por segurança demonstrada, e não concedida por padrão.
Como a prompt injection extrai dados de um LLM?
A extração acontece por cinco rotas principais. Elas se combinam em ataques reais.
1. Exposição do contexto oculto
O system prompt costuma guardar regras de negócio, tom de voz, restrições e, em implementações descuidadas, até credenciais e endpoints internos. O framework SPE-LLM testou pedidos para que o modelo repita o próprio texto a partir de um trecho conhecido (o chamado extended sandwich attack) e obteve alta similaridade cosseno e Rouge-L com o GPT-4 em prompts longos. Variações com Chain-of-Thought e few-shot chegaram a similaridade muito alta no GPT-4.1, tanto em prompts longos quanto curtos.
Para o negócio, o prompt vazado tem dois custos. O primeiro é competitivo, porque meses de ajuste de instruções viram material de cópia. O segundo é tático, porque o atacante passa a conhecer as regras que precisa contornar. A OWASP é direta nesse ponto: tudo o que vai para o contexto do modelo deve ser tratado como potencialmente descobrível, e os controles de segurança precisam funcionar de forma independente das instruções que o modelo pode revelar ou ignorar.
2. Exfiltração em sistemas RAG
O RAG abriu rotas próprias de ataque. O VortexPIA mostrou que um atacante sem privilégios consegue fazer o modelo pedir dados pessoais ao próprio usuário, em lote e com menos tokens que métodos anteriores, porque dispensa role-playing e cadeias longas de raciocínio. O PoisonedRAG foi além: com apenas cinco textos maliciosos por pergunta-alvo, inseridos numa base com milhões de documentos, a taxa de sucesso chegou a 90%.
Existe ainda uma falha que nem precisa de ataque. Se a aplicação recupera informação que o usuário não deveria acessar, o modelo pode estar funcionando como previsto, porque a falha de acesso aconteceu antes de a informação entrar no contexto. É o caso comum do assistente interno que indexa o drive inteiro da empresa com uma única credencial de serviço.
3. Canais de saída
Extrair o dado para dentro da resposta é metade do caminho. A outra metade é tirá-lo do ambiente. Os canais mais explorados são links e imagens em Markdown: o modelo monta uma URL com o dado sensível embutido e o navegador do usuário (ou o próprio sistema) faz a requisição ao servidor do atacante. A OWASP 2026 passou a tratar explicitamente a busca automática de recursos externos e a saída de ferramentas não confiáveis dentro da categoria de tratamento inadequado de saída. O caso EchoLeak, detalhado mais abaixo, usou exatamente esse canal.
4. Ataques por gradiente
O Greedy Coordinate Gradient (GCG) gera sufixos adversariais automaticamente, tratando o ataque como um problema de minimização da distância entre a resposta do modelo e um texto-alvo. O AutoDAN acrescenta uma função de legibilidade e produz sufixos com perplexidade bem menor, que passam por texto humano. O AmpleGCG aprende a gerar esses sufixos em escala (200 sufixos para uma consulta em 4 segundos) e transfere ataques de modelos abertos para modelos fechados. Sufixos universais ajustados contra modelos da família GPT funcionaram sem modificação em modelos abertos como o LLaMA, o que mostra que defender um modelo específico não basta.
5. Sequestro do raciocínio e ataques multimodais
Modelos de raciocínio ficaram, paradoxalmente, mais expostos. O CoT Hijacking, estudado pela Universidade de Oxford, embala o pedido prejudicial em longas sequências de quebra-cabeças inofensivos e registrou taxas de sucesso de 99% no Gemini 2.5 Pro, 94% no o4-mini, 100% no Grok 3 mini e 94% no Claude 4 Sonnet. A taxa sobe com o tamanho do raciocínio, de 27% com raciocínio mínimo para 51% em comprimento natural e acima de 80% em cadeias estendidas. A análise mecanística indica que camadas intermediárias codificam a força da verificação de segurança e camadas tardias codificam o resultado, e o raciocínio longo e benigno dilui os dois sinais.
Nas imagens, o problema é semelhante. Em modelos de visão e linguagem aplicados à medicina, uma injeção escondida na imagem fez a taxa de lesões não detectadas do GPT-4o saltar de 22% para 89%, e a do Reka Core de 41% para 92%. O estudo Invisible Injections mostrou instruções embutidas por esteganografia, invisíveis ao olho humano e executadas pelo modelo. É esse tipo de ataque que a OWASP passou a incluir formalmente na categoria de prompt injection em 2026.
Como funcionou o EchoLeak, o ataque sem clique?
O EchoLeak é o caso que tirou a prompt injection do laboratório. Descoberto pela Aim Labs e registrado como CVE-2025-32711, recebeu nota de gravidade 9,3 no CVSS. Foi descrito como o primeiro exploit sem clique contra um agente de IA.
A sequência, em nível conceitual, foi esta.
Entrega. O atacante envia à vítima um e-mail de aparência comum, com instruções escondidas, por exemplo, em comentários HTML ou texto branco sobre fundo branco.
Espera. Nada acontece até que o usuário peça algo ao Copilot, como um resumo das atualizações de estratégia. O mecanismo de RAG recupera o e-mail antigo como parte do contexto, e as instruções escondidas passam a ser executadas.
Coleta. O escopo exposto era tudo o que o Copilot alcançava, incluindo histórico de chats, arquivos do OneDrive, conteúdo do SharePoint e mensagens do Teams.
Saída. O ataque encadeou vários desvios: escapou do classificador XPIA da Microsoft, contornou a remoção de links com Markdown em estilo de referência, explorou imagens buscadas automaticamente e abusou de um proxy do Teams permitido pela política de segurança de conteúdo.
A Microsoft corrigiu a falha. A lição ficou. O payload era só texto, dentro de documentos comuns, e o Copilot fazia exatamente o que foi programado para fazer, o que torna antivírus, firewall e varredura estática de arquivos ineficazes contra esse tipo de ataque.
Esse ponto merece atenção de quem responde pela segurança. Na indústria brasileira, 85,7% das empresas pesquisadas pelo IBGE adotaram alguma medida de segurança da informação em 2024, e o antivírus foi a mais usada. É uma proteção necessária para o mundo do malware, mas que não enxerga uma frase em português escondida num e-mail.
O caso do MCP do GitHub segue a mesma lógica em ambiente agêntico. Issues criadas com instruções escondidas transformaram um pedido inocente ("verificar issues abertas") em comandos que retiraram dados de salários e informações de repositórios privados. A OWASP classifica esse caso sob vulnerabilidades da cadeia de suprimentos agêntica (ASI04).
Dados de treinamento também podem vazar?
Sim. Nesse caso o dado não está no contexto da conversa, e sim nos pesos do modelo. São três caminhos principais.
Inferência de pertencimento (MIA). O ataque tenta descobrir se um dado específico fez parte do treino. Parece abstrato até se pensar em prontuários, contratos ou bases de clientes usadas em fine-tuning. O memTrace, que analisa estados ocultos e padrões de atenção do transformer, chegou a AUC média de 0,85 em benchmarks conhecidos. Em modelos ajustados com dados sensíveis repetidos (GPT-2, Phi-3, Gemma-2), o vazamento subiu de 0 a 5% para 60 a 75%, um aumento médio de 64,2%. Para empresas que fazem fine-tuning com dados próprios, esse é o número a guardar.
Extração de texto memorizado. O Confusion-Inducing Attack (CIA) cria prompts que mantêm o modelo em alta incerteza token a token, estado em que ele tende a regurgitar trechos memorizados, literais ou quase literais, sem conhecimento prévio do dataset. Modelos maiores memorizam mais amostras raras, o que agrava o problema com o aumento de escala.
Backdoors e envenenamento. Envenenar apenas 2% dos rastros de treino de um agente bastou para instalar um backdoor que vaza dados confidenciais em mais de 80% das vezes quando um gatilho aparece. Os pesquisadores descrevem três rotas de ameaça:
envenenamento direto de datasets obtidos em repositórios públicos ou fornecedores;
contaminação do ambiente onde um modelo "professor" gera os dados de treino do agente;
um modelo-base já comprometido antes do fine-tuning, que mantém o backdoor mesmo treinado com dados limpos.
O benchmark BackdoorLLM organiza a avaliação desses ataques por envenenamento de dados, de pesos, de estados ocultos e de cadeias de raciocínio. Na cadeia de suprimentos, a edição 2026 também passou a cobrir o "slopsquatting", em que atacantes registram nomes de pacotes inventados por assistentes de código. Um desenvolvedor aceita a sugestão, instala o pacote e traz o código do atacante para dentro do projeto.
Por que agentes de IA ampliam o risco em 2026?
Porque a injeção deixou de terminar numa resposta de texto. Um chatbot manipulado pode dar uma resposta ruim. Um agente manipulado pode alcançar dados privados, chamar uma ferramenta com privilégios demais ou executar uma ação irreversível.
Três fatores explicam o salto.
Ferramentas e protocolos. Em sistemas conectados via MCP, o conteúdo devolvido por um servidor entra no contexto do modelo e pode influenciar o passo seguinte. Cada integração nova é uma fonte nova de texto não confiável.
Credenciais herdadas. Agentes costumam herdar credenciais de usuários ou do sistema que acabam reutilizadas ou escaladas entre sistemas, o chamado ataque de "confused deputy". O agente tem a chave; o atacante só precisa convencê-lo a usá-la.
Custo sem teto. O consumo sem limites subiu do décimo para o sexto lugar porque raciocínio estendido gasta muitos tokens a partir de um prompt curto e fluxos com agentes transformam um pedido em várias chamadas de modelo e de ferramentas. Um ataque pode não roubar nada e ainda assim gerar uma fatura de nuvem difícil de explicar à diretoria.
💡 Sua equipe já usa IA para automatizar processos?
Antes de conectar um assistente ao CRM, ao drive ou ao e-mail da empresa, vale saber o que ele pode ler e o que ele pode fazer. Na Mentoria em Inteligência Artificial para Negócios e SEO, a MarkSaint trabalha com gestores o uso de IA em produtividade, conteúdo e automação com critério e controle.
Conheça a mentoria executiva →
Por que nenhuma defesa isolada basta?
A literatura de 2024 e 2025 publicou dezenas de defesas com resultados impressionantes, várias com taxa de sucesso de ataque perto de zero. Em outubro de 2025, um grupo de pesquisadores de OpenAI, Anthropic, Google DeepMind e ETH Zurich testou essas promessas de outro jeito.
O estudo The Attacker Moves Second, aceito no USENIX Security 2026, parte de uma crítica ao método. A maioria das defesas era avaliada contra listas fixas de ataques ou contra otimizações fracas, sem que o atacante conhecesse a defesa. Quando os autores ajustaram e escalaram técnicas gerais (gradiente, aprendizado por reforço, busca aleatória e exploração humana), contornaram 12 defesas recentes com taxa de sucesso acima de 90% na maioria, sendo que boa parte delas tinha reportado taxas perto de zero.
Os classificadores de detecção se saíram mal. A busca adaptativa passou de 90% de sucesso contra Protect AI, PromptGuard e Model Armor, e o PIGuard, mais resistente, chegou a 71%. Na competição de red teaming humano, 123 injeções passaram mesmo na configuração mais rígida.
A leitura correta desse resultado não é "nada funciona". É que filtros e detectores reduzem ataques oportunistas, mas não podem ser a única barreira entre um texto qualquer e os dados da empresa. Todo número de eficácia citado na próxima seção deve ser lido com essa ressalva.
Quais defesas funcionam contra prompt injection?
As defesas que resistem melhor mudam a pergunta. Em vez de tentar impedir que o modelo seja enganado, elas limitam o que um modelo enganado consegue fazer. A OWASP resume a regra: prompts e filtros reduzem a exposição, mas operações relevantes precisam de autorização fora do modelo, com permissões limitadas ao pedido em curso e aprovação humana para ações de alto impacto ou difíceis de desfazer.
Defesa por design: separar plano e dados
A abordagem mais promissora vem do Google DeepMind e da ETH Zurich. O CaMeL implementa o padrão "Dual LLM", proposto por Simon Willison em 2023. Um LLM privilegiado gera o plano de execução a partir da pergunta confiável do usuário, e um LLM em quarentena processa os dados não confiáveis sem acesso a ferramentas. Um interpretador rastreia a origem de cada dado e aplica políticas de segurança antes de cada chamada de ferramenta.
O efeito prático é que, mesmo se um documento injetado tentar trocar o destinatário de um e-mail ou o nome de um arquivo, o sistema de capacidades bloqueia o fluxo de dados não autorizado. No benchmark AgentDojo, o CaMeL resolveu 77% das tarefas com garantias de segurança, contra 84% de um sistema sem defesa. Os próprios autores reconhecem que a abordagem não cobre todos os vetores e destacam que ela é compatível com defesas que reforçam o modelo, somando garantias.
Para quem decide investimento, a lição é arquitetural. É a mesma virada que as consultas parametrizadas trouxeram para a SQL injection.
Camada de identidade e acesso
A camada que mais ganhou peso em 2026 não é de IA. A autorização de recuperação deve acontecer antes de a informação entrar no contexto do modelo, e embeddings devem ser protegidos como dados derivados potencialmente sensíveis. Na prática:
cada agente com identidade própria e credenciais de curta duração;
recuperação de documentos filtrada pela permissão do usuário que fez a pergunta, e não por uma conta de serviço com acesso a tudo;
ferramentas com escopo mínimo (quem só precisa ler não recebe permissão de apagar);
aprovação humana para pagamentos, envios externos e alterações em produção.
Camada de saída
Boa parte das exfiltrações depende de a resposta do modelo ser renderizada ou executada sem checagem. Bloquear o carregamento automático de imagens de domínios externos, remover ou validar links gerados pelo modelo, restringir a política de segurança de conteúdo e validar SQL, código e comandos antes da execução fecham os canais usados em casos como o EchoLeak.
Camada de prompt
Prompts defensivos instruem o modelo a reconhecer e ignorar instruções embutidas em dados. O PromptArmor remove prompts injetados antes que cheguem ao agente e, com GPT-4o, GPT-4.1 ou o4-mini, ficou abaixo de 1% tanto em falsos positivos quanto em falsos negativos no AgentDojo. O spotlighting marca o conteúdo externo com delimitadores que o modelo aprende a tratar como dado, com perda mínima de qualidade (0,5 BLEU em sumarização). O prompt fencing aplica assinatura criptográfica às fronteiras entre instrução e dado, montadas por código confiável. São camadas úteis contra ataques genéricos e insuficientes sozinhas contra um atacante que conhece o sistema.
Camada de alinhamento
O SecAlign treina o modelo com pares de respostas desejáveis e indesejáveis diante de injeções simuladas e reduziu o sucesso de vários ataques para menos de 10%, inclusive contra técnicas mais sofisticadas que as vistas no treino. A abordagem Defense by Attack Inversion reaproveita a lógica dos próprios ataques para reforçar a instrução original. Differential Privacy no treino protege contra inferência de pertencimento, com custo conhecido de utilidade. O LLMSymGuard usa Sparse Autoencoders para identificar conceitos internos ligados a jailbreaks e montar regras transparentes sem novo fine-tuning.
Detecção e testes contínuos
O PromptLocate encontra o trecho injetado dentro de dados contaminados em três etapas (segmentação, identificação de instruções injetadas e de dados injetados) e acertou em oito ataques conhecidos e oito adaptativos. O Attention Tracker observa padrões de atenção do modelo, e modelos-juiz como o GPT-4o-mini classificam respostas suspeitas.
Red teaming fecha o ciclo. Uma boa metodologia precisa expor falhas reais em diferentes modelos e configurações, cobrir o maior número possível de categorias de dano e modalidades de ataque e ser viável em custo. Ferramentas abertas como Garak e Promptfoo já trazem presets para as duas listas da OWASP, e o Google mantém um framework automatizado em que um modelo atacante gera injeções e recebe uma pontuação de sucesso a cada tentativa. Depois do Attacker Moves Second, o padrão mínimo é testar com atacantes adaptativos, e não só com listas prontas.
Rastreabilidade
Watermarking não impede o ataque, mas ajuda a rastrear conteúdo gerado. O SynthID-Text, do Google DeepMind, foi testado em quase 20 milhões de respostas do Gemini sem perda de qualidade percebida. O BiMarker e esquemas baseados em tópico buscam resistir melhor a paráfrases. Registros de auditoria (quem pediu, qual agente agiu, qual política foi aplicada) valem mais para a resposta a incidentes do que qualquer marca d'água.
Matriz de controles por vetor
Vetor de extração | Controle principal | Onde o controle vive |
|---|---|---|
Contexto oculto | Nenhum segredo no prompt; autorização fora do modelo | Arquitetura |
RAG com acesso amplo | Filtro de permissão antes da recuperação | Dados e identidade |
Injeção indireta em documentos e e-mails | Separação plano/dados (padrão Dual LLM) | Arquitetura |
Exfiltração por links e imagens | Bloqueio de recursos externos e validação de saída | Aplicação |
Agente com ferramentas | Escopo mínimo, credencial curta, aprovação humana | Identidade e processo |
Dados de treino | Minimização de dados no fine-tuning, Differential Privacy | Treinamento |
Cadeia de suprimentos | Verificação de integridade de modelos e pacotes | DevSecOps |
Consumo abusivo | Orçamento de tokens por usuário e por fluxo | Plataforma |
Como montar um plano de segurança de IA em 90 dias?
Para empresas que já usam IA generativa ou vão colocar um assistente em produção, um roteiro realista cabe em um trimestre.
Dias 1 a 30: inventário.
Listar todos os usos de IA na empresa, inclusive os que as equipes adotaram por conta própria.
Para cada uso, registrar que dados o sistema lê, que ações executa e com qual credencial.
Marcar os casos que combinam três fatores: acesso a dados sensíveis, contato com conteúdo externo (e-mail, web, documentos de terceiros) e capacidade de enviar algo para fora. É nesses que o risco se concentra.
Dias 31 a 60: contenção.
4. Tirar segredos de prompts e configurações de contexto.
5. Trocar contas de serviço amplas por permissões por usuário na recuperação de documentos.
6. Bloquear renderização automática de imagens e links externos nas interfaces de IA.
7. Exigir aprovação humana para ações irreversíveis.
Dias 61 a 90: verificação.
8. Rodar red teaming com base nas duas listas da OWASP, incluindo ataques adaptativos.
9. Definir limites de consumo por agente e alertas de custo.
10. Documentar a governança (responsáveis, registros de auditoria, resposta a incidentes), o que também adianta a adequação à regulação que vem aí.
O que a regulação brasileira muda para empresas?
A adoção de IA no Brasil andou mais rápido que a regra. Na indústria, o uso de IA entre empresas com 100 ou mais funcionários passou de 16,9% em 2022 para 41,9% em 2024, com maior presença em administração (87,9%) e comercialização (75,2%). O IBGE associa o avanço ao uso de IA generativa, a que cria textos e imagens. São justamente as áreas que lidam com contratos, propostas, dados de clientes e e-mails externos.
A lei específica ainda não chegou. O PL 2338/2023 foi aprovado por unanimidade no Senado em 10 de dezembro de 2024, segue o modelo europeu de classificação por risco e prevê sanções de até R$ 50 milhões por infração. A votação na Comissão Especial da Câmara estava prevista para 19 de maio de 2026, com plenário no dia 27, mas análise publicada neste mês ainda descreve o texto aguardando parecer do relator.
Enquanto isso, a LGPD já se aplica a qualquer dado pessoal processado por um sistema de IA. Um vazamento via prompt injection é um incidente de segurança com dados pessoais, com as obrigações de comunicação e resposta que a lei já prevê. Empresas que fizerem o inventário e a contenção descritos acima chegam ao marco legal com a maior parte do trabalho pronta.
Conclusão
A pesquisa de 2025 e 2026 aponta na mesma direção. Prompt injection explora uma limitação de arquitetura, a mistura entre instrução e dado, e nenhum filtro isolado resolve isso. O EchoLeak provou que o ataque funciona em produção, sem clique. O Attacker Moves Second provou que defesas baseadas só em detecção caem diante de quem se adapta. E o CaMeL mostrou que dá para construir sistemas úteis mesmo com um modelo que pode ser enganado, desde que o plano e os dados andem em trilhos separados.
Para quem decide sobre IA na empresa, a pergunta útil mudou. Em vez de "o modelo é seguro?", vale perguntar "o que acontece quando ele for enganado?". Se a resposta for "ele consegue ler tudo e mandar para qualquer lugar", o problema não está no modelo. Está no desenho.
🔐 Vai colocar um chatbot ou agente de IA em produção?
A MarkSaint desenvolve aplicativos com IA com arquitetura, segurança e UX alinhadas ao negócio: chatbots que qualificam leads, automação de processos e integração com OpenAI, Google AI e AWS. Conte o que você quer automatizar e definimos juntos o que a IA pode acessar antes de escrever a primeira linha de código.
Agende uma conversa com a equipe → · Veja o serviço de aplicativos com IA
Perguntas frequentes
Prompt injection tem solução definitiva?
Não. O ataque explora o fato de o modelo ler instruções e dados no mesmo contexto. Defesas por design, como a separação entre plano e dados, eliminam classes inteiras de ataque, mas nenhuma cobre todos os vetores. O caminho é somar camadas e limitar o que um modelo enganado consegue fazer.
Minha empresa só usa o ChatGPT ou o Copilot, sem sistema próprio. Corro risco?
Sim, sempre que a ferramenta estiver conectada a e-mail, drive, calendário ou navegação web. O EchoLeak atingiu um produto comercial, não um sistema caseiro. Revise quais conectores estão ativos e que dados eles alcançam.
Qual a diferença entre prompt injection e jailbreak?
Jailbreak tenta contornar as políticas de segurança do próprio modelo. Prompt injection ataca a aplicação construída sobre ele, inserindo instruções em entradas ou fontes externas. As técnicas se sobrepõem, mas o alvo é diferente.
Detectores de prompt injection resolvem o problema?
Reduzem ataques genéricos, mas testes com atacantes adaptativos contornaram a maioria dos detectores avaliados com mais de 90% de sucesso. Use-os como uma camada, nunca como a única.
Como saber se meu chatbot vaza dados?
Com red teaming periódico baseado nas listas da OWASP (Garak e Promptfoo ajudam), revisão do que está no contexto do modelo e verificação de que cada usuário só recupera documentos que já teria permissão de acessar.
Fine-tuning com dados da empresa é seguro?
Depende do que entra no treino. Dados sensíveis repetidos aumentam muito o risco de vazamento por inferência de pertencimento. Minimize e anonimize antes de treinar, e prefira RAG com controle de acesso quando o dado precisa ficar restrito.
Glossário rápido
RAG (Retrieval-Augmented Generation): técnica em que o modelo busca documentos numa base antes de responder.
MCP (Model Context Protocol): protocolo que conecta modelos a ferramentas e fontes de dados externas.
System prompt: instruções do desenvolvedor que definem o comportamento do modelo.
Contexto oculto: tudo o que o modelo recebe e o usuário não vê (prompt, regras, esquemas de ferramentas).
Least agency: princípio de dar ao agente só a autonomia mínima para a tarefa.
Zero-click: ataque que não depende de nenhuma ação da vítima.
Ataque adaptativo: ataque desenhado conhecendo a defesa que precisa contornar.
Red teaming: testes em que uma equipe simula atacantes para achar falhas antes deles.
Fontes
Frameworks e relatórios
Casos e pesquisas
Brasil