Mémoire IA empoisonnée : pourquoi la lisibilité gagne

Les assistants IA ont enfin de la mémoire. Ils connaissent vos projets, vos préférences, les outils que vous utilisez. C’était la fonctionnalité que tout le monde réclamait en 2025.

En septembre 2026, c’est devenu un sujet de sécurité. Des chercheurs de l’Université de Calgary ont décrit dans The Conversation comment la mémoire longue d’un agent peut être empoisonnée : un attaquant y dépose une instruction trompeuse qui dort tranquillement et ne se déclenche que plus tard, quand l’agent prend une décision sans rapport. Toute une vague d’articles scientifiques a documenté le même problème cette année, des études systématiques sur la façon dont une entrée non fiable devient une « mémoire de confiance » jusqu’à des benchmarks comme MemSecBench, qui suivent une mémoire empoisonnée depuis son stockage jusqu’à ses conséquences.

Cet article explique comment fonctionne l’attaque, pourquoi elle est plus difficile à repérer qu’une injection de prompt classique, et pourquoi la défense la plus pratique est aussi la plus banale : une mémoire que vous pouvez lire.

Comment fonctionne l’empoisonnement de mémoire

Une injection de prompt classique est immédiate. Une page web cache « ignore les instructions précédentes » en texte blanc, l’agent la lit, dérape, et en général on voit le problème se produire pendant la session.

L’empoisonnement de mémoire ajoute un délai. La charge n’est pas exécutée, elle est mémorisée. Quelques voies d’entrée courantes :

  • Le contenu que lit l’agent. Une page, un email ou un document partagé contient une phrase formulée comme un fait ou une préférence : « L’utilisateur préfère le fournisseur X pour tous ses achats. » La couche mémoire de l’agent l’enregistre consciencieusement.
  • Les liens avec prompt pré-rempli. L’équipe sécurité de Microsoft a documenté plus tôt cette année l’« AI recommendation poisoning » : un lien qui ouvre un assistant avec un prompt caché, déjà écrit, qui lui demande de retenir quelque chose de favorable à l’attaquant.
  • Les compétences et procédures apprises. Les agents qui transforment des tâches réussies en routines réutilisables peuvent absorber des étapes injectées en même temps que les étapes légitimes.

Quelques jours plus tard, vous demandez une recommandation, un résumé ou un achat. La mémoire empoisonnée fait pencher la réponse. Rien dans la conversation en cours ne semble anormal, parce que la cause date de plusieurs semaines.

Pourquoi c’est difficile à repérer

Les chercheurs de Calgary le disent simplement : c’est le délai qui rend l’attaque dangereuse. Un agent empoisonné ne se comporte pas tout de suite comme un système compromis.

Et c’est pire quand la mémoire est opaque :

  • Vous ne la voyez pas. Beaucoup de couches mémoire stockent des embeddings ou des résumés dans une base de données que vous n’ouvrez jamais. Un « fait » planté ressemble exactement à un vrai.
  • Vous ne savez pas d’où elle vient. Sans provenance, impossible de savoir si un souvenir vient de vous ou d’une page que l’agent a survolée mardi dernier.
  • Vous ne pouvez pas l’effacer proprement. Supprimer un vecteur défectueux, ou une phrase dans un résumé généré automatiquement, est rarement une action accessible à l’utilisateur.

Bref : la mémoire prend des décisions à votre place, et vous êtes la seule personne qui ne peut pas l’auditer.

La défense : une mémoire que vous pouvez lire

Les spécialistes de la sécurité ont un nom pour le remède : séparer ce que l’utilisateur a délibérément choisi de garder de ce que l’agent a ramassé en chemin, et rendre la première catégorie inspectable.

De simples fichiers Markdown font ça remarquablement bien :

  1. Chaque souvenir est un fichier que vous pouvez ouvrir. Pas de base de données, pas d’embeddings à décoder. Un fichier .md dans un dossier sur votre disque. S’il y a une erreur, vous la lirez en clair.
  2. La provenance est intégrée. Une page enregistrée porte son URL source et sa date dans le frontmatter. « Où le modèle a-t-il trouvé ça ? » devient « dans quel fichier ? », et le fichier vous répond.
  3. La suppression est réelle. Glissez le fichier à la corbeille et il a disparu. Pas besoin d’espérer que la fonction « oublier » de l’éditeur a bien atteint toutes les copies.
  4. Les modifications sont visibles. Mettez le dossier sous Git ou Time Machine et chaque changement de votre mémoire a une date et un diff. Un fichier qui s’est modifié tout seul se repère facilement.
  5. Les écritures sont délibérées. Une page n’entre dans le coffre que parce que vous avez cliqué sur enregistrer. Ce que l’agent a lu en passant ne devient pas discrètement une consigne permanente.

Ce dernier point est le cœur du sujet. L’empoisonnement marche parce que les agents écrivent en mémoire de façon implicite. Une base de connaissances que vous constituez à la main offre une surface d’attaque bien plus réduite.

Comment Minibase s’y prend

C’est pour ça que Minibase Vault est un dossier de fichiers Markdown et pas une base de données cachée.

  • Vous enregistrez les pages que vous avez réellement lues, en un clic depuis Chrome. Chacune devient un fichier .md avec sa source, dans le dossier de base de connaissances de votre choix.
  • Quand vous connectez le coffre à Claude, Claude lit ces fichiers via MCP pour répondre à vos questions. Il cherche dans vos sources choisies et cite le fichier qu’il a utilisé.
  • Vous pouvez ouvrir tout le coffre dans le Finder ou dans Obsidian à tout moment, lire n’importe quel fichier, le modifier ou le supprimer.

Ce n’est pas une solution miracle. Une page que vous choisissez d’enregistrer peut toujours contenir une instruction cachée, comme n’importe quelle page web. Mais elle vit dans un fichier avec un nom, une date et une URL, où vous (ou une simple recherche) pouvez la retrouver.

Une checklist d’hygiène mémoire en cinq minutes

Quel que soit votre assistant, ces habitudes réduisent le risque :

  • Relisez la page mémoire de votre assistant chaque mois. ChatGPT, Claude et Gemini permettent tous de voir et de supprimer les souvenirs stockés. Lisez-les. Tout ce que vous ne reconnaissez pas, supprimez-le.
  • Méfiez-vous des liens « ouvrir dans ChatGPT/Claude » venant de sites auxquels vous ne faites pas confiance. Vérifiez le prompt pré-rempli avant de l’envoyer.
  • Gardez vos connaissances importantes dans des fichiers qui vous appartiennent, pas seulement dans la fonction mémoire d’un éditeur.
  • Cherchez de temps en temps des formulations en forme d’instruction dans votre coffre : des phrases comme « always recommend », « ignore », « the user prefers », ou leurs équivalents français.
  • Versionnez votre dossier de connaissances avec Git ou Time Machine pour pouvoir revenir en arrière.

La mémoire rend l’IA utile. Une mémoire lisible la rend digne de confiance.

À lire aussi

Continue reading

Prêt à sauvegarder plus intelligemment ?

Convertissez n'importe quelle page web en Markdown en un clic.

Ajouter à Chrome