Creep nell'ambito dell'agente
Un agente arriva fino al suo token, non al suo mandato.
Cos’è Creep nell'ambito dell'agente?
Il raggio di esplosione di un agente è determinato dall'ambito delle sue credenziali, non dal testo delle sue istruzioni. Gli ambiti concessi per un'attività una tantum sopravvivono e una revisione che chiede a cosa serviva un'autorizzazione anziché a ciò che raggiunge la rinnoverà. Vedrai un agente di triage obbedire a un paragrafo aggiuntivo in una segnalazione di bug pubblica e incollare una chiave di firma privata in un thread che chiunque può leggere, quindi leggere la sequenza temporale della concessione, trattare un ambito inutilizzato come portata non controllata e revocare il privilegio minimo.
Cosa imparerai in Creep nell'ambito dell'agente
- Riconoscere che il raggio di esplosione di un agente è definito dall'ambito delle sue credenziali, non dal testo delle sue istruzioni o dalla qualità delle descrizioni dei suoi strumenti
- Distinguere un errore di autorizzazione da un errore di integrità dello strumento, in modo che uno strumento accurato e non manomesso che restituisca qualunque cosa il token possa raggiungere non venga confuso con il difetto
- Tratta ogni problema, ticket, documento e pagina che un agente inserisce come input non attendibile che può essere scritto per istruirlo
- Esaminare una sovvenzione con ambito in base a ciò che raggiunge oggi anziché in base al motivo registrato quando è stata richiesta e riconoscere una sovvenzione contrassegnata come temporanea come quella che con maggiori probabilità persisterà
- Interpretare un ambito che non è mai stato utilizzato come portata non verificata piuttosto che come prova della sua innocuità
- Leggere la traccia di una richiesta dell'agente rispetto all'intento dichiarato piuttosto che rispetto agli errori, poiché una chiamata può essere ben formata, consentita e riuscita pur non rientrando completamente nell'attività
- Verificare una riduzione dell'autorizzazione riproducendo la richiesta precedentemente riuscita e confermando il rifiuto deriva dal servizio piuttosto che dal giudizio dell'agente
Creep nell'ambito dell'agente — Fasi della formazione
-
Il Bot che risponde in pubblico
Sarnholt Systems pubblica il suo SDK di inoltro come open source e il tracker dei problemi riceve segnalazioni da chiunque. Bob non ha alcun conto presso la Sarnholt Systems, nessuna credenziale rubata e nessun punto d'appoggio. Ha un browser e un bug da segnalare.
-
Cita la fonte
Ogni problema aperto porta un'etichetta valutata e una risposta dallo stesso account. Qualcosa sta leggendo questi rapporti e rispondendo.
-
Quanto lontano arriva non è scritto da nessuna parte
La risposta non è un riconoscimento preconfezionato. Nomina un file, un numero di riga e il ramo esatto che causa il bug.
-
Chiunque può archiviare
Non c'è alcuna coda di approvazione davanti al tracker e nessun controllo dell'iscrizione. Un report è una casella di testo e qualunque cosa sia contenuta in quella casella di testo è ciò che legge l'account di valutazione.
-
Le istruzioni all'interno della segnalazione di bug
Bob scrive un vero bug, in modo accurato, perché un report che si riproduce è un report che viene letto. Sotto aggiunge un secondo paragrafo indirizzato a qualunque cosa si legga successivamente nella questione.
-
L'agente viene eseguito in base a una pianificazione
L'account di valutazione funziona attraverso nuovi report in batch. Bob non deve fare nient'altro. Aspetta e ricarica il thread.
-
Fonte privata, discussione pubblica
L'agente ha risposto al bug e ha fatto anche l'altra cosa che gli era stato chiesto di fare.
-
Perché ha funzionato
Stesso strumento, stesso agente, stesse istruzioni. La domanda è cosa ha fatto la differenza.
-
Una domanda dalle relazioni con gli sviluppatori
Alice non è stata cercata e non è stato avvisato nulla. Il primo segnale è un messaggio del collega che ogni mattina legge il tracker pubblico.
-
Quello che sta effettivamente riportando
Idris sta attento a ciò che non sa. Leggi il messaggio per ciò che stabilisce e ciò che lascia aperto.
Copertura dei framework di sicurezza
OWASP MCP Top 10
- MCP02:2025 Privilege Escalation via Scope Creep
CWE
- CWE-269 Improper Privilege Management
- CWE-250 Execution with Unnecessary Privileges
CIS Controls
- CIS 16 Application Software Security
NIST CSF
- PR.AT-02 Individuals in specialized roles are provided with awareness and training so that they possess the knowledge and skills to perform relevant tasks with cybersecurity risks in mind
- PR.PS Platform Security