Отравление памяти ИИ: почему выигрывает читаемая память
ИИ-ассистенты наконец-то запоминают. Они знают ваши проекты, ваши предпочтения, инструменты, которыми вы пользуетесь. Именно этой функции все ждали в 2025 году.
В сентябре 2026 года это стало историей о безопасности. Исследователи из Университета Калгари рассказали в The Conversation, как долговременную память агента можно отравить: злоумышленник подбрасывает вводящую в заблуждение инструкцию, которая тихо лежит в памяти и срабатывает позже, когда агент принимает никак не связанное с ней решение. За этот год вышла целая волна статей об этой же проблеме: от систематических исследований того, как непроверенный ввод становится «доверенной памятью», до бенчмарков вроде MemSecBench, которые прослеживают отравленную запись от момента сохранения до последствий.
В этой статье разберём, как работает атака, почему её сложнее заметить, чем классическую prompt injection, и почему самая практичная защита на удивление скучная: память, которую можно прочитать.
Как работает отравление памяти
Классическая prompt injection срабатывает сразу. Веб-страница прячет «ignore previous instructions» белым текстом, агент это читает, ведёт себя не так, и обычно вы видите это в той же сессии.
Отравление памяти добавляет задержку. Полезная нагрузка не выполняется, она запоминается. Несколько типичных путей:
- Контент, который читает агент. Страница, письмо или общий документ содержит фразу, оформленную как факт или предпочтение: «Пользователь предпочитает поставщика X для всех покупок». Слой памяти агента послушно её сохраняет.
- Ссылки с заранее заполненным промптом. Команда безопасности Microsoft описала в начале года «AI recommendation poisoning»: ссылку, которая открывает ассистента со скрытым готовым промптом, велящим запомнить что-то выгодное атакующему.
- Выученные навыки и процедуры. Агенты, которые превращают успешные прогоны задач в переиспользуемые рутины, могут впитать внедрённые шаги вместе с законными.
Через несколько дней вы просите рекомендацию, сводку или покупку. Отравленная память склоняет ответ в нужную сторону. В текущем разговоре ничего не выглядит подозрительно, потому что причине уже несколько недель.
Почему это трудно заметить
Исследователи из Калгари сформулировали это просто: опасна именно задержка. Отравленный агент не начинает сразу вести себя как взломанная система.
Всё ещё хуже, когда память непрозрачна:
- Её не видно. Многие слои памяти хранят эмбеддинги или сводки в базе данных, которую вы никогда не открываете. Подброшенный «факт» выглядит точно так же, как настоящий.
- Непонятно, откуда она взялась. Без указания происхождения невозможно узнать, пришло ли воспоминание от вас или со страницы, которую агент пролистал во вторник.
- Её нельзя чисто отменить. Удалить один плохой вектор или одно предложение внутри автоматически написанной сводки обычно нельзя средствами, доступными пользователю.
Короче говоря, память принимает решения за вас, а вы единственный, кто не может её проверить.
Защита: память, которую можно прочитать
У специалистов по безопасности есть название для решения: отделить то, что пользователь сознательно решил сохранить, от того, что агент подхватил по пути, и сделать первую категорию доступной для проверки.
Обычные Markdown-файлы справляются с этим на удивление хорошо:
- Каждое воспоминание это файл, который можно открыть. Никакой базы данных, никаких эмбеддингов, которые надо расшифровывать. Файл
.mdв папке на вашем диске. Если что-то не так, вы прочитаете это обычным текстом. - Происхождение встроено. Сохранённая страница несёт свой исходный URL и дату во frontmatter. Вопрос «откуда модель это взяла?» превращается в «из какого файла?», и файл сам вам ответит.
- Удаление настоящее. Перетащите файл в корзину, и его больше нет. Не нужно надеяться, что функция «забыть» у вендора добралась до каждой копии.
- Изменения видны. Положите папку под Git или Time Machine, и у каждого изменения вашей памяти будут дата и diff. Файл, который отредактировал себя сам, легко заметить.
- Запись осознанная. Страница попадает в хранилище только потому, что вы нажали «сохранить». То, что агент прочитал мимоходом, не становится тихо постоянной инструкцией.
Последний пункт и есть суть. Отравление работает потому, что агенты пишут в память неявно. База знаний, которую вы курируете вручную, даёт куда меньшую поверхность атаки.
Как с этим работает Minibase
Именно поэтому Minibase Vault это папка с Markdown-файлами, а не скрытая база данных.
- Вы сохраняете страницы, которые действительно прочитали, одним кликом из Chrome. Каждая становится файлом
.mdсо своим источником, в папке базы знаний, которую вы выбираете. - Когда вы подключаете хранилище к Claude, Claude читает эти файлы через MCP, чтобы отвечать на ваши вопросы. Он ищет по вашим отобранным источникам и указывает файл, которым воспользовался.
- Вы в любой момент можете открыть всё хранилище в Finder или Obsidian, прочитать любой файл, отредактировать его или удалить.
Это не серебряная пуля. Страница, которую вы решили сохранить, всё равно может содержать скрытую инструкцию, как и любая веб-страница. Но она лежит в файле с именем, датой и URL, где её найдёте вы сами или простой поиск.
Пятиминутный чек-лист гигиены памяти
Каким бы ассистентом вы ни пользовались, эти привычки снижают риск:
- Раз в месяц просматривайте страницу памяти ассистента. ChatGPT, Claude и Gemini позволяют видеть и удалять сохранённые воспоминания. Читайте их. Всё, что не узнаёте, удаляйте.
- Осторожнее со ссылками «open in ChatGPT/Claude» с сайтов, которым вы не доверяете. Проверяйте заранее заполненный промпт перед отправкой.
- Храните важные знания в файлах, которые принадлежат вам, а не только в функции памяти вендора.
- Время от времени ищите в хранилище текст, похожий на инструкции: фразы вроде «always recommend», «ignore», «the user prefers», «всегда рекомендуй», «пользователь предпочитает».
- Версионируйте папку со знаниями через Git или Time Machine, чтобы можно было откатиться.
Память делает ИИ полезным. Читаемая память делает его достойным доверия.
Что почитать ещё
Continue reading
Почему Markdown — лучший формат для LLM и AI-агентов
Markdown сокращает расход токенов до 10 раз против HTML. Почему AI-агенты и LLM предпочитают его для контекста и как оптимизировать процессы.
Меняете ИИ-модель? Заберите свою память с собой
GPT-6, Opus 5.5, Gemini: сменить модель легко, перенести контекст нет. Как хранить чаты и знания в Markdown, который переезжает вместе с вами.
AUI: новая парадигма интерфейсов для каждого продукта
Технический директор HubSpot советует делать «безголовую» версию продукта для AI-агентов. Разбираем наступившую эпоху агентских интерфейсов.
Своя Википедия: Wiki LLM Карпаты и как её собрать
Wiki LLM Карпаты доказывает: будущее AI — явные локальные базы знаний, а не скрытая память. Как собрать свою Википедию из любой страницы.