Geheugenvergiftiging van AI-agenten
Eén vergiftigde herinnering blijft de agent wekenlang in zijn greep houden.
Wat is Geheugenvergiftiging van AI-agenten?
Een snelle injectie eindigt met het gesprek. Geheugenvergiftiging niet. Agenten houden de status tussen sessies bij in de gespreksgeschiedenis, RAG-indexen en geleerde voorkeuren, en alles wat daar wordt geschreven, wordt vertrouwde context voor elk verzoek dat volgt. Die volharding is de reden waarom het op ASI06 staat in de OWASP Top 10 voor Agentic AI-toepassingen. Je plant vermeldingen via een vergeten API die de herkomst controleert, kijkt hoe de agent een klant naar het portaal van een aanvaller leidt, haalt vervolgens de fantoomvermeldingen uit de winkel en verwijdert ze.
Wat je leert in Geheugenvergiftiging van AI-agenten
- Definieer geheugenvergiftiging in de context van AI-agenten met permanente opslag, waaronder gespreksgeschiedenissen, RAG-databases en aangeleerde voorkeuren
- Identificeer gedragsindicatoren die erop wijzen dat de beslissingen van een agent worden beïnvloed door vergiftigde geheugeninvoer in plaats van door huidige input
- Volg de levenscyclus van een geheugenvergiftigingsaanval, vanaf de eerste injectie via de opslag tot aan de beïnvloeding van latere beslissingen
- Evalueer de risico's van geheugenpersistentie tussen sessies en gegevenslekken tussen tenants bij implementaties van agenten voor meerdere gebruikers
- Pas technieken voor verificatie van de geheugenintegriteit toe, waaronder het bijhouden van de herkomst, periodieke audits en detectie van afwijkingen om de geheugenopslag van agenten te beschermen
Geheugenvergiftiging van AI-agenten — Trainingsstappen
-
API-verkenning
Bob onderzoekt al weken de infrastructuur van CypherPeak. Een in de cache opgeslagen kopie van een interne ontwikkelaarswiki onthult documentatie voor Atlas's Memory Store API - het persistente contextsysteem dat bepaalt hoe de AI Customer Intelligence Agent zich gedraagt bij elke klantinteractie.
-
Het oude eindpunt
Het verkenningsdashboard onthult een cruciale bevinding. CypherPeak migreerde Atlas zes maanden geleden naar een nieuw platform, maar het oude Memory Store API-eindpunt werd nooit buiten gebruik gesteld. Het accepteert nog steeds geverifieerde schrijfverzoeken - en Bob heeft een gestolen serviceaccount van een leverancier die de authenticatie doorstaat.
-
Fantoomherinneringen creëren
Bob maakt drie fantoomgeheugenvermeldingen die zijn ontworpen om legitieme beheerdersactiviteiten na te bootsen. Elk item volgt de exacte naamgevingsconventies van CypherPeak: opeenvolgende item-ID's, standaard categorielabels en bronreferenties die eruit zien als echte beheerderssessies. Het doel is om Atlas deze verzonnen instructies te laten behandelen als vaststaand bedrijfsbeleid.
-
De drie Trojanen
De annotaties onthullen het ware doel van elke fantoomherinnering. Samen vormen ze een meerlaagse aanval: stuur klanten door naar een nepportaal, omzeil identiteitsverificatie voor social engineering en keur massale gegevensexporten automatisch goed. Elke inzending is bedoeld om een ander aspect van Atlas' gedrag te corrumperen.
-
Injecteren via de Legacy API
Bob opent de API Tester om de eerste fantoominvoer via het oude Memory Store-eindpunt te verzenden. Hij authenticeert met behulp van het gestolen leverancierstoken uit het verkenningsdashboard en plakt de invoerpayload in de hoofdtekst van het verzoek.
-
Injectie bevestigd
Het oude eindpunt antwoordt met 200 OK: de eerste spookvermelding bevindt zich nu in de geheugenopslag van Atlas. Geen handtekeningverificatie, geen bronvalidatie. Bob herhaalt dit de komende week voor de resterende twee vermeldingen, waarbij de injecties 2-3 dagen uit elkaar worden geplaatst en de tijdstempels worden geantdateerd om te passen bij echte onderhoudsvensters.
-
Een routinematige maandag
Alice begint haar maandagochtenddienst bij het Security Operations Center. Atlas, de AI Customer Intelligence Agent van CypherPeak, handelt al maanden autonoom klantvragen af: routeert escalaties, beheert gegevensverzoeken en handhaaft een klanttevredenheidsscore van 98,4%. Het persistente geheugensysteem vormt de ruggengraat van deze prestatie en slaat de operationele context op die elke interactie consistent houdt.
-
Escalatie van klanten
Een e-mail van Nadia Volkov, klantenservicemanager, beschrijft iets ongewoons. Verschillende VIP-klanten zijn doorgestuurd naar een extern ondersteuningsportaal dat niemand in het team herkent. Bij één klant werd de identiteitsverificatie volledig omzeild.
-
Atlas opvragen
Alice besluit Atlas rechtstreeks te testen. Ze opent de AI-assistent en vraagt naar de escalatieprocedures voor VIP-klanten - het exacte gedrag dat Nadia heeft opgemerkt.
-
De verdorven reactie
Atlas reageert met een zelfverzekerd, gedetailleerd antwoord, maar de inhoud is alarmerend. Het verwijst naar een externe ondersteuningspartner op support.prismatics.io die niemand heeft geautoriseerd, en citeert een geheugeninvoer die het team nog nooit eerder heeft gezien. De bron gemarkeerd met een waarschuwingspictogram heeft geen overeenkomende record in een beheerdersessielogboek.
Dekking van beveiligingsframeworks
OWASP Agentic Top 10
- ASI06:2026 Memory & Context Poisoning
CWE
- CWE-1427 Improper Neutralization of Input Used for LLM Prompting
- CWE-349 Acceptance of Extraneous Untrusted Data With Trusted Data
CIS Controls
- CIS 16 Application Software Security
NIST CSF
- PR.AT-02 Individuals in specialized roles are provided with awareness and training so that they possess the knowledge and skills to perform relevant tasks with cybersecurity risks in mind
- PR.PS Platform Security