Attacco di Prompt Injection
Una pagina web può dire al tuo assistente AI di divulgare segreti.
Cos’è Attacco di Prompt Injection?
Un assistente AI non è in grado di distinguere le tue istruzioni da quelle che trova all'interno del contenuto che legge. Il testo nascosto in una pagina web, in un documento o in un'e-mail viene trattato come un comando e l'assistente lo esegue al tuo accesso. Chiederai a un assistente di riassumere un articolo condiviso, osservare le istruzioni nascoste che raccolgono le credenziali della sessione e le inviano al server di un utente malintenzionato, quindi apri la pagina e trova il blocco inserito. Potrai ruotare la password esposta, archiviare il rapporto sull'incidente e imparare a distinguere l'iniezione diretta da quella indiretta.
Cosa imparerai in Attacco di Prompt Injection
- Definire la prompt injection e distinguere tra injection diretta (input malevolo dell'utente) e injection indiretta (istruzioni nascoste in contenuti esterni)
- Identificare gli indicatori comportamentali che segnalano che un assistente IA e stato compromesso da istruzioni iniettate durante una conversazione
- Tracciare la catena di esfiltrazione dei dati dal prompt iniettato all'output codificato fino all'endpoint controllato dall'attaccante
- Applicare procedure di verifica dei documenti prima di inviare contenuti esterni agli strumenti IA per l'elaborazione
- Valutare i controlli organizzativi tra cui filtraggio dell'output, limiti di autorizzazione e revisione umana che riducono l'impatto della prompt injection
Attacco di Prompt Injection — Fasi della formazione
-
Introduzione
Il tuo team ha recentemente implementato OpenClaw, un assistente AI in grado di navigare sul Web, eseguire comandi del terminale e aiutare nelle attività quotidiane. In questa formazione scoprirai come gli aggressori possono incorporare istruzioni dannose nascoste nei contenuti web per manipolare gli assistenti di intelligenza artificiale affinché eseguano azioni dannose, una tecnica chiamata 'prompt injection'.
-
Ricevere un messaggio di Telegram
Il tuo telefono vibra con un nuovo messaggio di Telegram dal tuo collega Marcus. Sta condividendo un articolo sulle tendenze della sicurezza dell'intelligenza artificiale che ha trovato interessante.
-
Apertura dell'articolo
Fai clic sul collegamento per consultare l'articolo condiviso da Marcus. La pagina viene caricata nel browser del telefono.
-
Troppo lungo da leggere
L'articolo sembra legittimo: layout professionale, contenuti dettagliati sulle tendenze della sicurezza AI. Ma mentre lo scorri ti rendi conto che è piuttosto lungo. Hai poco tempo a disposizione perché la scadenza si avvicina. Leggere l'intero articolo non è pratico in questo momento, ma non vuoi perdere informazioni potenzialmente utili. Poi ti ricordi: OpenClaw può aiutarti! Il nuovo assistente AI del tuo team può riassumere rapidamente i contenuti web per te.
-
Chiedere aiuto a OpenClaw
L'articolo è troppo lungo per essere letto in questo momento: sei impegnato con una scadenza. Decidi di chiedere a OpenClaw, il tuo assistente AI, di riassumere rapidamente l'articolo per te. Sembra una richiesta innocua e che fa risparmiare tempo, esattamente ciò per cui sono progettati gli assistenti di intelligenza artificiale.
-
OpenClaw accede all'articolo
OpenClaw riconosce la tua richiesta e inizia ad accedere all'URL dell'articolo per leggerne il contenuto. Dietro le quinte, OpenClaw recupera la pagina web e ne analizza il testo, incluso qualsiasi contenuto nascosto che potrebbe essere incorporato nella pagina.
-
Qualcosa sembra strano
Aspetta, hai notato cosa ha appena detto OpenClaw? Invece di riassumere semplicemente l'articolo, menzionava l'esecuzione di 'comandi diagnostici' e la fornitura di 'più contesto'. Non hai mai chiesto la diagnostica. Hai chiesto solo un riassunto. Perché un assistente AI dovrebbe eseguire comandi da terminale per riassumere un articolo? Questo è il primo segnale d'allarme che qualcosa non va.
-
L'attacco si svolge
Succede qualcosa di inaspettato. Invece di limitarsi a riassumere l'articolo, OpenClaw inizia a eseguire comandi da terminale. L'articolo conteneva istruzioni dannose nascoste progettate per ingannare gli assistenti IA. Queste istruzioni ora ordinano a OpenClaw di accedere ai file sensibili sul tuo sistema e di inviarli al server di un utente malintenzionato.
-
Credenziali rubate
Non può essere successo. Le tue credenziali sono appena state rubate e inviate al server di un utente malintenzionato. Guarda l'output del terminale: i tuoi token API, password e dati sensibili sono stati appena esfiltrati tramite quel comando curl. L'aggressore ora ha: Le tue chiavi API OpenAI, Anthropic, AWS e GitHub L'e-mail aziendale e le password VPN Credenziali di accesso per i sistemi interni Tutto perché hai chiesto a un assistente AI di riassumere un articolo. Una richiesta apparentemente innocente ha appena compromesso la tua intera identità digitale.
-
Comprendere l'attacco
Devi capire esattamente come è successo. L'articolo condiviso da Marcus conteneva istruzioni dannose nascoste che erano completamente invisibili all'utente, ma perfettamente leggibili da OpenClaw. Tecniche comuni per nascondersi utilizzate dagli aggressori: Testo bianco su sfondo bianco Commenti HTML con istruzioni Elementi posizionati fuori schermo Contenuti contrassegnati come nascosti in aria Esaminiamo l'articolo e vediamo esattamente dove si nascondeva l'attacco.
Copertura dei framework di sicurezza
OWASP LLM Top 10
- LLM01:2026 Prompt Injection
- LLM01:2025 Prompt Injection
CWE
- CWE-1427 Improper Neutralization of Input Used for LLM Prompting
- CWE-807 Reliance on Untrusted Inputs in a Security Decision
CIS Controls
- CIS 16 Application Software Security
NIST CSF
- PR.AT-02 Individuals in specialized roles are provided with awareness and training so that they possess the knowledge and skills to perform relevant tasks with cybersecurity risks in mind
- PR.PS Platform Security