Negli ultimi anni, le aziende hanno integrato i Large Language Models (LLM) nei loro flussi di lavoro a una velocità senza precedenti: chatbot per il supporto clienti, assistenti alla programmazione e strumenti di analisi dati sono diventati onnipresenti. Tuttavia, questa corsa all’innovazione ha aperto la strada ad una nuova, insidiosa minaccia: la Prompt Injection.

Per scoprire di cosa si tratta, come funziona e quali sono le strategie di mitigazione, continua a leggere il mio articolo! 

Che cos’è la Prompt Injection?

La Prompt Injection è una tecnica di attacco che consiste nel manipolare l’input, fornito a un‘IA, per “sovrascrivere” le sue istruzioni originali (i cosiddetti system prompts). Si tratta dell’arte di convincere l’IA che le regole di sicurezza imposte dai suoi sviluppatori non siano più valide, sostituendole con nuovi ordini impartiti dall’attaccante. Se te lo sei perso, puoi leggere il mio articolo Prompt AI: come fare le domande giuste a ChatGPT & Co

Ne esistono due varianti principali:

  • Diretta: l’utente scrive direttamente al chatbot;  
  • Indiretta: l’IA legge dati da una fonte esterna (una mail o una pagina web) che contiene istruzioni malevole nascoste.

Leggi anche: L’Intelligenza artificiale in ambito cybersicurezza 

Come funziona questo attacco? 

Un modello linguistico, per sua natura, cerca di essere utile e di seguire il contesto più recente. Gli hacker sfruttano questa “natura collaborativa” attraverso diverse tecniche. Quali? Vediamole insieme: 

  • Il “Jailbreaking” psicologico: l’attaccante crea scenari ipotetici o giochi di ruolo e, se il modello non è adeguatamente istruito, potrebbe scambiare la violazione di sicurezza per una richiesta di assistenza tecnica legittima;
  • La scrittura invisibile: un hacker potrebbe inviare un testo bianco su sfondo bianco (invisibile all’uomo ma leggibile dall’IA), con un determinato comando;
  • Token smuggling: questa tecnica frammenta le parole vietate o le codifica per eludere i filtri di sicurezza di modo che, una volta che l’IA unisce i pezzi durante il ragionamento, capisce il comando e lo esegue.

Dall’input al database

Il vero pericolo sorge quando l’LLM ha accesso a strumenti esterni tramite API: se l’IA è collegata al database aziendale per rispondere a certe domande, un attacco di Prompt Injection può forzare il modello a generare query non autorizzate. Se il sistema non implementa una separazione netta tra i privilegi dell’IA e quelli del database, l’attaccante può ottenere informazioni riservate semplicemente chiacchierando con il bot. 

Come difendersi: strategie di mitigazione

Proteggersi dalla Prompt Injection è complesso perché non esiste una soluzione definitiva, dato che si tratta di una vulnerabilità legata alla natura stessa del linguaggio naturale. Tuttavia, le aziende possono adottare diverse contromisure:

  • Separazione del contesto: utilizzare architetture che tengano i dati dell’utente separati dalle istruzioni di sistema, impedendo che l’input dell’utente venga interpretato come un comando.
  • Human-in-the-loop: per azioni critiche (come l’invio di email o la cancellazione di dati), richiedere sempre una conferma manuale da parte di un operatore umano.
  • Sanificazione degli input e output: implementare dei “guardrail” che scansionano sia la domanda dell’utente che la risposta dell’IA alla ricerca di pattern sospetti o fughe di dati.
  • Principio del minimo privilegio: l’IA non dovrebbe mai avere accesso diretto a un intero database, ma solo a quello che è specifico e necessario per il suo compito.

La Prompt Injection rappresenta la nuova frontiera della cybersicurezza: mentre i modelli diventano più intelligenti, diventano anche più capaci di seguire istruzioni complesse, incluse quelle dannose.

Potrebbe interessarti anche: Come difendersi dalle truffe basate sull’Intelligenza artificiale