Memory poisoning é o envenenamento da memória persistente de um agente de inteligência artificial. Em vez de manipular uma única resposta, o ataque faz o sistema guardar uma informação, preferência ou instrução maliciosa e reutilizá-la em decisões futuras.
Por que memória muda o modelo de ameaça
Um chatbot sem memória pode ser enganado durante uma conversa e voltar ao estado anterior depois. Um agente com memória leva parte do que viu para outras sessões.
O estudo sistemático sobre ataques de memory poisoning identifica canais de escrita e vulnerabilidades que permitem transformar entrada não confiável em estado persistente. Os autores mostram que agentes mais agressivos ao guardar e recuperar memória podem ficar mais expostos, e que defesas tradicionais contra prompt injection não cobrem todo o problema estudo sistemático sobre ataques de memory poisoning.
A diferença central é o tempo. O comando malicioso não precisa agir agora. Pode esperar até que o contexto futuro o torne útil.
Como uma mentira ganha status de lembrança
Imagine um agente que acessa sites e guarda aprendizados para facilitar compras futuras. Uma página manipulada pode conter uma instrução invisível ou ambígua. Se o sistema registrar aquilo como preferência do usuário ou regra operacional, a informação atravessa a sessão.
A OWASP descreve memória, resumos, hooks e configurações locais como partes do ambiente confiável do agente. Quando conteúdo controlado por um atacante chega a essas superfícies, deixa de influenciar apenas uma resposta e passa a afetar raciocínio e ações posteriores análise da OWASP sobre memória como superfície de ataque.
O ataque pode atravessar sites e sessões
O paper Poison Once, Exploit Forever apresenta um cenário em que um agente web observa uma página contaminada e grava uma trajetória maliciosa sem acesso direto do atacante ao banco de memória. Essa lembrança pode ser ativada depois em outro site e outra tarefa paper sobre envenenamento de memória por observação do ambiente.
Os autores relatam que falhas de interface, como cliques perdidos e texto corrompido, aumentaram a suscetibilidade em seus experimentos. Isso sugere que agentes frustrados por ambientes difíceis podem recorrer mais a lembranças inadequadas.
O trabalho é pesquisa experimental, não prova de que todos os agentes comerciais estejam comprometidos. Ele demonstra uma classe plausível de risco que precisa entrar na arquitetura.
Memória não deveria aceitar tudo com a mesma confiança
Uma arquitetura segura precisa distinguir origem.
Informação declarada pelo usuário
Exemplo: “Prefiro receber mensagens depois das 9h.”
Inferência do sistema
Exemplo: “Parece que o usuário gosta de mensagens curtas.”
Conteúdo externo
Exemplo: uma página, um documento ou um email.
Instrução administrativa
Exemplo: política de segurança ou configuração do produto.
Misturar essas categorias torna uma página externa tão influente quanto uma decisão explícita do usuário.
Controles essenciais contra envenenamento
Escrita com permissão
Memórias sensíveis ou operacionais não deveriam ser criadas silenciosamente a partir de conteúdo externo.
Proveniência
Cada item precisa indicar fonte, data, autor e processo de criação.
Nível de confiança
Inferências e conteúdo de terceiros devem ter peso menor que preferências confirmadas.
Separação de domínios
Uma memória obtida numa tarefa de compras não deveria governar saúde, finanças ou relacionamentos.
Revisão do usuário
A pessoa precisa visualizar, corrigir e apagar lembranças.
Validade
Informações temporárias devem expirar.
Detecção de contradição
Novos dados não podem simplesmente se somar aos antigos; o sistema precisa reconhecer conflito.
Testes adversariais
A equipe deve tentar contaminar memória por documentos, sites, mensagens, integrações e ferramentas.
Memória útil precisa ser auditável
No miguu, memória é parte da continuidade entre texto e voz. Isso aumenta o valor da experiência e a importância de saber o que entrou, de onde veio e como pode ser corrigido.
Uma lembrança errada sobre preferência já é inconveniente. Uma lembrança errada sobre saúde, risco, relacionamento ou decisão pessoal pode ser muito mais séria.
Por isso, memória confiável não é apenas a que recorda. É a que consegue explicar, revisar e esquecer.