Envenenamiento de memoria en IA: gana la memoria legible
Los asistentes de IA por fin recuerdan. Conocen tus proyectos, tus preferencias, las herramientas que usas. Era la función que todo el mundo pedía en 2025.
En septiembre de 2026 se convirtió en un tema de seguridad. Unos investigadores de la Universidad de Calgary explicaron en The Conversation cómo se puede envenenar la memoria a largo plazo de un agente: un atacante planta una instrucción engañosa que se queda quieta en la memoria y solo se activa más tarde, cuando el agente toma una decisión que no tiene nada que ver. Una oleada de artículos académicos lleva todo el año catalogando el mismo problema, desde estudios sistemáticos sobre cómo una entrada no fiable se convierte en «memoria de confianza» hasta benchmarks como MemSecBench, que siguen una memoria envenenada desde que se instala hasta que tiene consecuencias.
Este artículo explica cómo funciona el ataque, por qué es más difícil de detectar que una inyección de prompt clásica y por qué la defensa más práctica es aburrida: una memoria que puedas leer.
Cómo funciona el envenenamiento de memoria
Una inyección de prompt clásica es inmediata. Una página web esconde «ignora las instrucciones anteriores» en texto blanco, el agente lo lee, se comporta mal y normalmente puedes verlo pasar en esa misma sesión.
El envenenamiento de memoria añade un retraso. La carga no se ejecuta: se recuerda. Algunas vías habituales:
- Contenido que lee el agente. Una página, un correo o un documento compartido contiene una frase redactada como un hecho o una preferencia: «El usuario prefiere al proveedor X para todas sus compras.» La capa de memoria del agente la guarda obedientemente.
- Enlaces con el prompt ya escrito. El equipo de seguridad de Microsoft documentó a principios de año el «AI recommendation poisoning»: un enlace que abre un asistente con un prompt oculto y ya redactado que le pide recordar algo favorable al atacante.
- Habilidades y procedimientos aprendidos. Los agentes que convierten las tareas que salieron bien en rutinas reutilizables pueden absorber pasos inyectados junto con los legítimos.
Días después, pides una recomendación, un resumen o una compra. La memoria envenenada inclina la respuesta. Nada en la conversación actual parece fuera de lugar, porque la causa tiene semanas.
Por qué es difícil de detectar
Los investigadores de Calgary lo resumen así: lo peligroso es el retraso. Un agente envenenado no se comporta de inmediato como un sistema comprometido.
Y empeora cuando la memoria es opaca:
- No puedes verla. Muchas capas de memoria guardan embeddings o resúmenes en una base de datos que nunca abres. Un «hecho» plantado se ve exactamente igual que uno real.
- No sabes de dónde viene. Sin procedencia, no hay forma de saber si un recuerdo vino de ti o de una página que el agente hojeó el martes.
- No puedes deshacerlo limpiamente. Borrar un vector malo, o una frase dentro de un resumen escrito automáticamente, casi nunca es algo que el usuario pueda hacer.
En resumen: la memoria toma decisiones en tu nombre, y tú eres la única persona que no puede auditarla.
La defensa: una memoria que puedas leer
Los especialistas en seguridad tienen nombre para la solución: separar lo que el usuario decidió conservar a propósito de lo que el agente fue recogiendo por el camino, y hacer que la primera categoría se pueda inspeccionar.
Los archivos Markdown planos lo consiguen notablemente bien:
- Cada recuerdo es un archivo que puedes abrir. Sin base de datos ni embeddings que descifrar. Un archivo
.mden una carpeta de tu disco. Si algo está mal, lo leerás en lenguaje claro. - La procedencia viene incluida. Una página guardada lleva su URL de origen y su fecha en el frontmatter. «¿De dónde ha sacado esto el modelo?» pasa a ser «¿de qué archivo?», y el archivo te lo dice.
- Borrar es borrar de verdad. Arrastras el archivo a la papelera y desaparece. Sin esperar que la función «olvidar» del proveedor haya llegado a todas las copias.
- Los cambios se ven. Pon la carpeta bajo Git o Time Machine y cada cambio en tu memoria tendrá fecha y diff. Un archivo que se ha editado solo salta a la vista.
- Las escrituras son deliberadas. Una página solo entra en el vault porque tú hiciste clic en guardar. Algo que el agente leyó de pasada no se convierte en silencio en una instrucción permanente.
Este último punto es el núcleo de todo. El envenenamiento funciona porque los agentes escriben en la memoria de forma implícita. Una base de conocimiento que curas a mano ofrece una superficie de ataque mucho menor.
Cómo lo resuelve Minibase
Por eso Minibase Vault es una carpeta de archivos Markdown y no una base de datos oculta.
- Guardas las páginas que de verdad lees, con un clic desde Chrome. Cada una se convierte en un archivo
.mdcon su fuente, dentro de la carpeta de base de conocimiento que elijas. - Cuando conectas el vault a Claude, Claude lee esos archivos a través de MCP para responder a tus preguntas. Busca en tus fuentes seleccionadas y cita el archivo que ha usado.
- Puedes abrir el vault entero en Finder u Obsidian cuando quieras, leer cualquier archivo, editarlo o borrarlo.
No es una solución mágica. Una página que decides guardar puede contener igualmente una instrucción oculta, como cualquier página web. Pero vive en un archivo con nombre, fecha y URL, donde tú, o una simple búsqueda, podéis encontrarla.
Lista de higiene de memoria en cinco minutos
Uses el asistente que uses, estos hábitos reducen el riesgo:
- Revisa la página de memoria de tu asistente una vez al mes. ChatGPT, Claude y Gemini te dejan ver y borrar los recuerdos guardados. Léelos. Lo que no reconozcas, bórralo.
- Desconfía de los enlaces «abrir en ChatGPT/Claude» de sitios que no conoces. Revisa el prompt prerrellenado antes de enviarlo.
- Guarda el conocimiento importante en archivos que sean tuyos, no solo en la función de memoria de un proveedor.
- Busca de vez en cuando en tu vault texto con forma de instrucción: frases como «recomienda siempre», «ignora», «el usuario prefiere».
- Versiona tu carpeta de conocimiento con Git o Time Machine para poder volver atrás.
La memoria hace útil a la IA. La memoria legible la hace fiable.
Lecturas relacionadas
Continue reading
Por qué Markdown es el mejor formato para LLMs y agentes IA
Markdown reduce los tokens hasta 10 veces frente a HTML. Por qué los agentes IA y los LLMs lo prefieren para el contexto y cómo optimizar tus flujos IA.
¿Cambias de modelo de IA? Llévate tu memoria contigo
GPT-6, Opus 5.5, Gemini: cambiar de modelo es fácil, mover tu contexto no. Así puedes guardar chats y conocimiento en Markdown que te sigue a todas partes.
¿Qué es una AUI? La interfaz para agentes IA
El CTO de HubSpot pide versiones headless para agentes IA y Google lanzó A2UI. La era de las Agentic User Interfaces cambia el diseño de software.
Karpathy dice que construyas tu propia Wikipedia
El concepto Wiki LLM de Karpathy demuestra que la personalización de la IA está en bases de conocimiento locales, no en memoria opaca. Crea tu Wikipedia.