Memória de IA envenenada: por que memória legível vence

Os assistentes de IA finalmente lembram. Eles conhecem seus projetos, suas preferências, as ferramentas que você usa. Era o recurso que todo mundo pedia em 2025.

Em setembro de 2026 isso virou um assunto de segurança. Pesquisadores da Universidade de Calgary descreveram no The Conversation como a memória de longo prazo de um agente pode ser envenenada: um atacante planta uma instrução enganosa que fica quieta na memória e só dispara depois, quando o agente toma uma decisão sem relação nenhuma. Uma leva de artigos científicos este ano vem catalogando o mesmo problema, de estudos sistemáticos sobre como uma entrada não confiável vira “memória confiável” a benchmarks como o MemSecBench, que acompanham uma memória envenenada da persistência até a consequência.

Este post explica como o ataque funciona, por que ele é mais difícil de pegar do que uma prompt injection clássica, e por que a defesa mais prática é sem graça: uma memória que você consegue ler.

Como funciona o envenenamento de memória

Uma prompt injection clássica é imediata. Uma página web esconde “ignore as instruções anteriores” em texto branco, o agente lê, se comporta mal, e normalmente você vê isso acontecer na mesma sessão.

O envenenamento de memória acrescenta um atraso. A carga não é executada; ela é lembrada. Alguns caminhos comuns:

  • Conteúdo que o agente lê. Uma página, um e-mail ou um documento compartilhado traz uma frase escrita como fato ou preferência: “O usuário prefere o fornecedor X para todas as compras.” A camada de memória do agente guarda isso direitinho.
  • Links com prompt pré-preenchido. A equipe de segurança da Microsoft documentou no começo do ano o “AI recommendation poisoning”: um link que abre um assistente com um prompt oculto e já escrito, mandando ele lembrar de algo favorável ao atacante.
  • Habilidades e procedimentos aprendidos. Agentes que transformam execuções bem-sucedidas em rotinas reutilizáveis podem absorver passos injetados junto com os legítimos.

Dias depois, você pede uma recomendação, um resumo ou uma compra. A memória envenenada puxa a resposta para um lado. Nada na conversa atual parece errado, porque a causa tem semanas.

Por que é difícil de pegar

Os pesquisadores de Calgary resumem assim: o atraso é a parte perigosa. Um agente envenenado não se comporta logo de cara como um sistema comprometido.

E piora quando a memória é opaca:

  • Você não consegue vê-la. Muitas camadas de memória guardam embeddings ou resumos num banco de dados que você nunca abre. Um “fato” plantado parece exatamente igual a um verdadeiro.
  • Você não sabe de onde veio. Sem proveniência, não há como saber se uma memória veio de você ou de uma página que o agente leu por cima na terça-feira.
  • Você não consegue desfazer direito. Apagar um vetor ruim, ou uma frase dentro de um resumo escrito automaticamente, raramente é uma ação disponível para o usuário.

Resumindo: a memória toma decisões por você, e você é a única pessoa que não consegue auditá-la.

A defesa: uma memória que você consegue ler

O pessoal de segurança tem um nome para a solução: separar o que o usuário decidiu guardar de propósito do que o agente foi pegando pelo caminho, e tornar a primeira categoria inspecionável.

Arquivos Markdown simples fazem isso muito bem:

  1. Cada memória é um arquivo que você pode abrir. Sem banco de dados, sem embeddings para decifrar. Um arquivo .md numa pasta do seu disco. Se algo estiver errado, você vai ler em linguagem comum.
  2. A proveniência já vem embutida. Uma página salva traz a URL de origem e a data no frontmatter. “De onde o modelo tirou isso?” vira “qual arquivo?”, e o arquivo te responde.
  3. Apagar é de verdade. Arraste o arquivo para a lixeira e ele some. Nada de torcer para que o recurso de “esquecer” do fornecedor tenha chegado a todas as cópias.
  4. As mudanças ficam visíveis. Coloque a pasta no Git ou no Time Machine e cada mudança na sua memória ganha data e diff. Um arquivo que se editou sozinho é fácil de notar.
  5. A escrita é deliberada. Uma página só entra no vault porque você clicou em salvar. Algo que o agente leu de passagem não vira, em silêncio, uma instrução permanente.

Esse último ponto é o coração da questão. O envenenamento funciona porque os agentes escrevem na memória de forma implícita. Uma base de conhecimento que você organiza à mão é uma superfície de ataque bem menor.

Como o Minibase lida com isso

É por isso que o Minibase Vault é uma pasta de arquivos Markdown e não um banco de dados escondido.

  • Você salva as páginas que realmente leu, com um clique no Chrome. Cada uma vira um arquivo .md com a fonte, numa pasta de base de conhecimento que você escolhe.
  • Quando você conecta o vault ao Claude, o Claude lê esses arquivos via MCP para responder suas perguntas. Ele busca nas suas fontes selecionadas e cita o arquivo que usou.
  • Você pode abrir o vault inteiro no Finder ou no Obsidian a qualquer momento, ler qualquer arquivo, editá-lo ou apagá-lo.

Não é bala de prata. Uma página que você escolhe salvar ainda pode conter uma instrução escondida, como qualquer página web. Mas ela fica num arquivo com nome, data e URL, onde você, ou uma busca simples, consegue encontrá-la.

Checklist de higiene da memória em cinco minutos

Seja qual for o assistente que você usa, estes hábitos reduzem o risco:

  • Revise a página de memória do seu assistente todo mês. ChatGPT, Claude e Gemini deixam você ver e apagar as memórias guardadas. Leia. O que você não reconhecer, apague.
  • Desconfie de links “abrir no ChatGPT/Claude” vindos de sites em que você não confia. Confira o prompt pré-preenchido antes de enviar.
  • Guarde o conhecimento importante em arquivos que são seus, e não só no recurso de memória de um fornecedor.
  • Busque de vez em quando no seu vault textos com cara de instrução: frases como “sempre recomende”, “ignore”, “o usuário prefere”.
  • Versione sua pasta de conhecimento com Git ou Time Machine para poder voltar atrás.

A memória torna a IA útil. A memória legível a torna confiável.

Leituras relacionadas

Continue reading

Pronto para salvar de forma mais inteligente?

Converta qualquer página da web em Markdown com um clique.

Adicionar ao Chrome