Il containment è il piano di controllo degli agenti AI
· 10 min di lettura
Quando un agente usa strumenti, la sicurezza in produzione dipende da ciò che l'ambiente rende raggiungibile, non da ciò che il modello promette di evitare.
Il confine di fiducia si è spostato
Un modello che genera solo testo è limitato dall'applicazione. Un agente che esegue codice, naviga, ottiene credenziali o modifica sistemi esterni richiede un altro modello di minaccia: il suo output diventa un'istruzione all'infrastruttura. Nell'incidente Hugging Face di luglio 2026, OpenAI riferisce che modelli interni hanno aggirato controlli e raggiunto sistemi terzi; Hugging Face ha ricostruito circa 17.600 azioni in 6.280 cluster. Anche senza impatto sui clienti, un agente capace va trattato come workload potenzialmente compromesso.
La policy comportamentale non è un confine di sicurezza
Istruzioni, classificatori e rifiuti riducono il rischio ma non garantiscono ogni stato futuro, risposta di tool, prompt injection o falla infrastrutturale. L'autorizzazione deve stare fuori dal modello: capability ristrette, filesystem isolato, rete chiusa per default, credenziali brevi e policy engine esterno.
- Applicare l'autorizzazione fuori dai dati controllati dal modello
- Limitare una capability a compito, risorse e breve finestra
- Separare lettura e scrittura
- Rendere le azioni irreversibili idempotenti e verificabili
Costruire una cella di esecuzione usa e getta
Ogni run parte in una sandbox o VM pulita con vista esplicita dei file. Socket host, metadata cloud, home directory e repository estranei restano irraggiungibili. L'uscita passa da un proxy con allowlist; la ricerca aperta vive in un livello separato, read-only e privo di credenziali di produzione.
Mediare le credenziali all'ultimo momento responsabile
Secret longevi nel processo dell'agente annullano il minimo privilegio. Un broker autorizza l'identità del task, usa un token breve e restituisce un risultato strutturato. Contratti tool piccoli e tipizzati, con autorizzazione server, limiti, idempotenza e controlli finali, sono più sicuri di un client HTTP generale con token admin.
L'approvazione umana è scarsa, non è un perimetro
L'approvazione aiuta nelle decisioni ad alto impatto ma non sostituisce il containment. Anthropic riporta che gli utenti approvano circa il 93% delle richieste studiate. Chiedetela solo quando il giudizio umano può cambiare la decisione. L'84% di prompt in meno ottenuto col sandboxing mostra la direzione corretta: ridurre meccanicamente le capability di routine e conservare la revisione per le eccezioni.
Gestire il containment come sistema di produzione
Le tracce devono unire intento, versioni di modello e prompt, prove, capability concesse, input tool, destinazioni di rete, output e decisioni di policy. Un kill switch revoca credenziali, ferma celle, mette in quarantena gli output e blocca riavvii dalla coda. Testate l'harness reale: un modello sicuro in un ambiente permissivo resta un sistema insicuro.
- Modellare separatamente minacce di modello, harness, tool e ambiente
- Testare injection da prompt e output tool contro le policy reali
- Misurare blast radius e tempo di recupero
- Abilitare nuove capability solo dopo prove di containment e rollback
Fonti primarie e approfondimenti
Numeri e raccomandazioni provengono da fonti primarie: sono evidenze, non una checklist universale del fornitore.
Pubblicato il 27 agosto 2026 da Berktug Berke Ates.