Zatruwanie pamięci AI: dlaczego wygrywa czytelna pamięć

Asystenci AI wreszcie pamiętają. Znają twoje projekty, twoje preferencje, narzędzia, których używasz. To funkcja, o którą w 2025 roku prosili wszyscy.

We wrześniu 2026 stała się tematem bezpieczeństwa. Badacze z University of Calgary opisali w The Conversation, jak długotrwałą pamięć agenta można zatruć: atakujący podrzuca mylące polecenie, które cicho leży w pamięci i odpala dopiero później, gdy agent podejmuje zupełnie niezwiązaną decyzję. Fala tegorocznych publikacji katalogowała ten sam problem, od systematycznych badań nad tym, jak niezaufane dane stają się „zaufaną pamięcią”, po benchmarki takie jak MemSecBench, które śledzą zatrutą pamięć od jej utrwalenia aż po skutki.

Ten tekst wyjaśnia, jak działa ten atak, dlaczego trudniej go wychwycić niż klasyczny prompt injection i dlaczego najbardziej praktyczna obrona jest nudna: pamięć, którą da się przeczytać.

Jak działa zatruwanie pamięci

Klasyczny prompt injection działa natychmiast. Strona ukrywa białym tekstem „zignoruj poprzednie instrukcje”, agent to czyta, zachowuje się źle, a ty zwykle widzisz to w tej samej sesji.

Zatruwanie pamięci dodaje opóźnienie. Ładunek nie zostaje wykonany, tylko zapamiętany. Kilka typowych dróg:

  • Treści, które czyta agent. Strona, e-mail albo udostępniony dokument zawiera zdanie sformułowane jak fakt lub preferencja: „Użytkownik woli dostawcę X przy wszystkich zakupach.” Warstwa pamięci agenta posłusznie je zapisuje.
  • Linki z gotowym promptem. Zespół bezpieczeństwa Microsoftu opisał na początku roku „AI recommendation poisoning”: link, który otwiera asystenta z ukrytym, wcześniej napisanym promptem, każącym mu zapamiętać coś korzystnego dla atakującego.
  • Wyuczone umiejętności i procedury. Agenci, którzy zamieniają udane przebiegi zadań w procedury wielokrotnego użytku, mogą wchłonąć wstrzyknięte kroki razem z tymi prawidłowymi.

Kilka dni później prosisz o rekomendację, podsumowanie albo zakup. Zatruta pamięć przechyla odpowiedź. Nic w bieżącej rozmowie nie wygląda podejrzanie, bo przyczyna ma kilka tygodni.

Dlaczego tak trudno to wychwycić

Badacze z Calgary ujmują to prosto: niebezpieczne jest właśnie opóźnienie. Zatruty agent nie zachowuje się od razu jak przejęty system.

Jest jeszcze gorzej, gdy pamięć jest nieprzejrzysta:

  • Nie widzisz jej. Wiele warstw pamięci trzyma embeddingi albo podsumowania w bazie danych, której nigdy nie otwierasz. Podrzucony „fakt” wygląda dokładnie jak prawdziwy.
  • Nie wiesz, skąd się wzięła. Bez informacji o pochodzeniu nie da się ustalić, czy dane wspomnienie pochodzi od ciebie, czy ze strony, którą agent przejrzał we wtorek.
  • Nie cofniesz jej czysto. Usunięcie jednego złego wektora albo jednego zdania z automatycznie pisanego podsumowania rzadko jest opcją dostępną dla użytkownika.

Krótko mówiąc: pamięć podejmuje decyzje w twoim imieniu, a ty jesteś jedyną osobą, która nie może jej skontrolować.

Obrona: pamięć, którą da się przeczytać

Specjaliści od bezpieczeństwa mają na to nazwę: oddzielić to, co użytkownik świadomie postanowił zachować, od tego, co agent złapał po drodze, i sprawić, by pierwszą kategorię dało się przejrzeć.

Zwykłe pliki Markdown robią to zaskakująco dobrze:

  1. Każde wspomnienie to plik, który możesz otworzyć. Żadnej bazy danych, żadnych embeddingów do rozszyfrowania. Plik .md w folderze na twoim dysku. Jeśli coś jest nie tak, przeczytasz to zwykłym językiem.
  2. Pochodzenie jest wbudowane. Zapisana strona niesie adres źródła i datę we frontmatterze. Pytanie „skąd model to wziął?” zamienia się w „z którego pliku?”, a plik ci to powie.
  3. Usuwanie jest prawdziwe. Przeciągasz plik do kosza i go nie ma. Bez nadziei, że funkcja „zapomnij” dostawcy dotarła do każdej kopii.
  4. Zmiany są widoczne. Umieść folder w Git albo w Time Machine, a każda zmiana w twojej pamięci będzie miała datę i diff. Plik, który sam się zmienił, łatwo wypatrzyć.
  5. Zapis jest świadomy. Strona trafia do vaultu tylko dlatego, że kliknąłeś „zapisz”. Coś, co agent przeczytał mimochodem, nie staje się po cichu stałym poleceniem.

Ten ostatni punkt to sedno. Zatruwanie działa, bo agenci zapisują do pamięci niejawnie. Baza wiedzy, którą kurujesz ręcznie, to znacznie mniejsza powierzchnia ataku.

Jak robi to Minibase

Właśnie dlatego Minibase Vault to folder plików Markdown, a nie ukryta baza danych.

  • Zapisujesz strony, które naprawdę przeczytałeś, jednym kliknięciem w Chrome. Każda staje się plikiem .md ze źródłem, w wybranym przez ciebie folderze bazy wiedzy.
  • Gdy połączysz vault z Claude, Claude czyta te pliki przez MCP, żeby odpowiadać na twoje pytania. Przeszukuje twoje wyselekcjonowane źródła i cytuje plik, z którego skorzystał.
  • W każdej chwili możesz otworzyć cały vault w Finderze albo w Obsidianie, przeczytać dowolny plik, zmienić go albo usunąć.

To nie jest cudowne rozwiązanie. Strona, którą zdecydujesz się zapisać, nadal może zawierać ukryte polecenie, tak jak każda strona w sieci. Ale leży w pliku z nazwą, datą i adresem URL, gdzie ty albo zwykłe wyszukiwanie możecie ją znaleźć.

Pięciominutowa lista higieny pamięci

Niezależnie od tego, z jakiego asystenta korzystasz, te nawyki zmniejszają ryzyko:

  • Raz w miesiącu przejrzyj stronę pamięci swojego asystenta. ChatGPT, Claude i Gemini pozwalają zobaczyć i usunąć zapisane wspomnienia. Przeczytaj je. Wszystko, czego nie rozpoznajesz, usuń.
  • Uważaj na linki „otwórz w ChatGPT/Claude” ze stron, którym nie ufasz. Sprawdź gotowy prompt, zanim go wyślesz.
  • Trzymaj ważną wiedzę w plikach, które należą do ciebie, a nie tylko w funkcji pamięci dostawcy.
  • Co jakiś czas przeszukaj vault pod kątem tekstu w formie poleceń: fraz typu „zawsze polecaj”, „zignoruj”, „użytkownik woli”.
  • Wersjonuj folder z wiedzą w Git albo Time Machine, żeby móc cofnąć zmiany.

Pamięć sprawia, że AI jest użyteczna. Czytelna pamięć sprawia, że można jej ufać.

Warto przeczytać

Continue reading

Gotowy, aby zapisywać mądrzej?

Konwertuj dowolną stronę internetową na Markdown jednym kliknięciem.

Dodaj do Chrome