Отравление памяти ИИ: почему выигрывает читаемая память

ИИ-ассистенты наконец-то запоминают. Они знают ваши проекты, ваши предпочтения, инструменты, которыми вы пользуетесь. Именно этой функции все ждали в 2025 году.

В сентябре 2026 года это стало историей о безопасности. Исследователи из Университета Калгари рассказали в The Conversation, как долговременную память агента можно отравить: злоумышленник подбрасывает вводящую в заблуждение инструкцию, которая тихо лежит в памяти и срабатывает позже, когда агент принимает никак не связанное с ней решение. За этот год вышла целая волна статей об этой же проблеме: от систематических исследований того, как непроверенный ввод становится «доверенной памятью», до бенчмарков вроде MemSecBench, которые прослеживают отравленную запись от момента сохранения до последствий.

В этой статье разберём, как работает атака, почему её сложнее заметить, чем классическую prompt injection, и почему самая практичная защита на удивление скучная: память, которую можно прочитать.

Как работает отравление памяти

Классическая prompt injection срабатывает сразу. Веб-страница прячет «ignore previous instructions» белым текстом, агент это читает, ведёт себя не так, и обычно вы видите это в той же сессии.

Отравление памяти добавляет задержку. Полезная нагрузка не выполняется, она запоминается. Несколько типичных путей:

  • Контент, который читает агент. Страница, письмо или общий документ содержит фразу, оформленную как факт или предпочтение: «Пользователь предпочитает поставщика X для всех покупок». Слой памяти агента послушно её сохраняет.
  • Ссылки с заранее заполненным промптом. Команда безопасности Microsoft описала в начале года «AI recommendation poisoning»: ссылку, которая открывает ассистента со скрытым готовым промптом, велящим запомнить что-то выгодное атакующему.
  • Выученные навыки и процедуры. Агенты, которые превращают успешные прогоны задач в переиспользуемые рутины, могут впитать внедрённые шаги вместе с законными.

Через несколько дней вы просите рекомендацию, сводку или покупку. Отравленная память склоняет ответ в нужную сторону. В текущем разговоре ничего не выглядит подозрительно, потому что причине уже несколько недель.

Почему это трудно заметить

Исследователи из Калгари сформулировали это просто: опасна именно задержка. Отравленный агент не начинает сразу вести себя как взломанная система.

Всё ещё хуже, когда память непрозрачна:

  • Её не видно. Многие слои памяти хранят эмбеддинги или сводки в базе данных, которую вы никогда не открываете. Подброшенный «факт» выглядит точно так же, как настоящий.
  • Непонятно, откуда она взялась. Без указания происхождения невозможно узнать, пришло ли воспоминание от вас или со страницы, которую агент пролистал во вторник.
  • Её нельзя чисто отменить. Удалить один плохой вектор или одно предложение внутри автоматически написанной сводки обычно нельзя средствами, доступными пользователю.

Короче говоря, память принимает решения за вас, а вы единственный, кто не может её проверить.

Защита: память, которую можно прочитать

У специалистов по безопасности есть название для решения: отделить то, что пользователь сознательно решил сохранить, от того, что агент подхватил по пути, и сделать первую категорию доступной для проверки.

Обычные Markdown-файлы справляются с этим на удивление хорошо:

  1. Каждое воспоминание это файл, который можно открыть. Никакой базы данных, никаких эмбеддингов, которые надо расшифровывать. Файл .md в папке на вашем диске. Если что-то не так, вы прочитаете это обычным текстом.
  2. Происхождение встроено. Сохранённая страница несёт свой исходный URL и дату во frontmatter. Вопрос «откуда модель это взяла?» превращается в «из какого файла?», и файл сам вам ответит.
  3. Удаление настоящее. Перетащите файл в корзину, и его больше нет. Не нужно надеяться, что функция «забыть» у вендора добралась до каждой копии.
  4. Изменения видны. Положите папку под Git или Time Machine, и у каждого изменения вашей памяти будут дата и diff. Файл, который отредактировал себя сам, легко заметить.
  5. Запись осознанная. Страница попадает в хранилище только потому, что вы нажали «сохранить». То, что агент прочитал мимоходом, не становится тихо постоянной инструкцией.

Последний пункт и есть суть. Отравление работает потому, что агенты пишут в память неявно. База знаний, которую вы курируете вручную, даёт куда меньшую поверхность атаки.

Как с этим работает Minibase

Именно поэтому Minibase Vault это папка с Markdown-файлами, а не скрытая база данных.

  • Вы сохраняете страницы, которые действительно прочитали, одним кликом из Chrome. Каждая становится файлом .md со своим источником, в папке базы знаний, которую вы выбираете.
  • Когда вы подключаете хранилище к Claude, Claude читает эти файлы через MCP, чтобы отвечать на ваши вопросы. Он ищет по вашим отобранным источникам и указывает файл, которым воспользовался.
  • Вы в любой момент можете открыть всё хранилище в Finder или Obsidian, прочитать любой файл, отредактировать его или удалить.

Это не серебряная пуля. Страница, которую вы решили сохранить, всё равно может содержать скрытую инструкцию, как и любая веб-страница. Но она лежит в файле с именем, датой и URL, где её найдёте вы сами или простой поиск.

Пятиминутный чек-лист гигиены памяти

Каким бы ассистентом вы ни пользовались, эти привычки снижают риск:

  • Раз в месяц просматривайте страницу памяти ассистента. ChatGPT, Claude и Gemini позволяют видеть и удалять сохранённые воспоминания. Читайте их. Всё, что не узнаёте, удаляйте.
  • Осторожнее со ссылками «open in ChatGPT/Claude» с сайтов, которым вы не доверяете. Проверяйте заранее заполненный промпт перед отправкой.
  • Храните важные знания в файлах, которые принадлежат вам, а не только в функции памяти вендора.
  • Время от времени ищите в хранилище текст, похожий на инструкции: фразы вроде «always recommend», «ignore», «the user prefers», «всегда рекомендуй», «пользователь предпочитает».
  • Версионируйте папку со знаниями через Git или Time Machine, чтобы можно было откатиться.

Память делает ИИ полезным. Читаемая память делает его достойным доверия.

Что почитать ещё

Continue reading

Готовы сохранять умнее?

Конвертируйте любую веб-страницу в Markdown одним кликом.

Добавить в Chrome