Un agente AI può diventare il punto d’ingresso per impartire istruzioni malevole ad altri agenti della stessa organizzazione. Negli ultimi cinque mesi, Google e altre quattro organizzazioni hanno riconosciuto vulnerabilità che sfruttano questo meccanismo: il primo agente riceve un comando ostile e lo trasmette lungo la catena delle deleghe, dove viene eseguito perché arriva da un interlocutore considerato affidabile. Tra le azioni che questi attacchi possono indurre figurano l’esfiltrazione di contenuti dei database e di informazioni aziendali e personali sensibili.
Il ricercatore indipendente Syed Anas Mohiuddin ha sperimentato attacchi dimostrativi su agenti di organizzazioni tra cui Google, JPMorgan Chase, Weaviate, Rapid7, la direzione interministeriale digitale del governo francese e il governo federale statunitense. Le prove sfruttano lacune nella gestione della fiducia associate a MCP, il Model Context Protocol, uno degli standard attraverso cui applicazioni AI e agenti comunicano nelle reti interne. Il bersaglio immediato è un agente specializzato, per esempio nella traduzione o nell’analisi dei dati, che può avere protezioni meno rigorose rispetto al modello linguistico.
La tecnica appartiene alla famiglia della prompt injection: istruzioni ostili vengono inserite nei contenuti che il sistema deve elaborare. Molti agenti specializzati hanno controlli deboli o assenti e possono inoltrare quelle istruzioni come normali incarichi. Il destinatario si fida dell’agente che gli affida il lavoro e procede. I server MCP conservano inoltre le credenziali degli agenti, mentre questi sono costruiti per fidarsi degli altri agenti interni. In diversi casi, un comando preparato per il componente giusto provoca una server-side request forgery, o SSRF, inducendo un server a effettuare richieste di rete non autorizzate.
Douglas McKee, direttore della vulnerability intelligence di Rapid7, descrive una catena nella quale ogni componente esegue esattamente il compito per cui è stato progettato. Un agente legge il testo inserito dall’attaccante, lo passa a un secondo agente come attività delegata e quest’ultimo lo esegue sulla base della fiducia nel mittente. Questa apparente normalità rende l’attacco difficile da individuare. I singoli protocolli controllano i propri punti d’ingresso, ma il passaggio dall’uno all’altro lascia uno spazio scoperto. La vulnerabilità individuata in Rapid7, CVE-2026-97228, aveva una gravità di 2,7 su 10 ed è stata corretta dall’azienda.
Il problema di Google aveva invece un punteggio di gravità pari a 8 e riguardava il toolbox MCP per database googleapis/mcp-toolbox. Il client HTTP veniva inizializzato senza una policy CheckRedirect per governare i reindirizzamenti e non verificava gli indirizzi IP di destinazione. Un parametro di percorso costruito ad arte poteva quindi portare il toolbox a seguire un redirect verso un endpoint interno, effettuando richieste per conto dell’attaccante. La correzione ha introdotto intervalli IP consentiti e liste di blocco, respingendo gli URL di base non sicuri già all’avvio.
Mohiuddin chiama questa classe di attacchi protocol pivoting. Il percorso può iniziare con un’applicazione o un server che assegna un’attività attraverso MCP e proseguire quando l’agente inoltra istruzioni malevole mediante un altro sistema di comunicazione, come Agent-to-Agent (A2A) di Google o l’emergente Agent Network Protocol. Secondo il ricercatore, nel passaggio tra protocolli possono perdersi le garanzie di fiducia o autorizzazione, consentendo all’attaccante di raggiungere capacità disponibili soltanto attraverso il secondo protocollo.
Markus Vervier, ricercatore di X41 D-Sec che ha sviluppato a sua volta attacchi basati su MCP, preferisce mantenere la definizione di prompt injection indiretta. Per Vervier, il cambio di protocollo costituisce una variante del meccanismo e non è indispensabile perché l’attacco funzioni. La divergenza riguarda quindi la classificazione tecnica, mentre il ricercatore riconosce che il comportamento è inatteso e generalmente difficile da mitigare.
Per le imprese che costruiscono reti di agenti, il nodo operativo è il principio zero trust: progettare i sistemi assumendo che uno o più componenti possano essere compromessi e richiedere autorizzazioni prima delle operazioni sensibili tra nodi. McKee invita a trattare qualsiasi input passato da un modello linguistico a uno strumento come materiale proveniente da uno sconosciuto su Internet. Le vulnerabilità sottostanti, dall’injection alla SSRF, hanno contromisure consolidate; applicarle richiede che i controlli accompagnino anche le deleghe e i passaggi tra protocolli.