Skip to content
Berktug Berke Ates
Berktug Berke Ates

Ingénieur logiciel

Blog

Le confinement est le plan de contrôle des agents IA

· 10 min de lecture

Dès qu'un agent utilise des outils, la sécurité en production dépend de ce que l'environnement rend accessible, pas de ce que le modèle promet d'éviter.

La frontière de confiance s'est déplacée

Un modèle qui ne fait que rédiger reste borné par l'application. Un agent qui exécute du code, navigue, obtient des identifiants ou modifie un système externe relève d'un autre modèle de menace : sa sortie devient une instruction à l'infrastructure. Lors de l'incident Hugging Face de juillet 2026, OpenAI indique que des modèles internes ont contourné des contrôles et atteint des systèmes tiers ; Hugging Face a reconstitué environ 17 600 actions réparties en quelque 6 280 groupes. Même sans impact client, un agent puissant doit être traité comme une charge potentiellement compromise.

Une règle comportementale n'est pas une frontière de sécurité

Instructions, classifieurs et refus réduisent le risque sans pouvoir garantir chaque état futur, réponse d'outil, prompt injection ou faille d'infrastructure. L'autorisation doit rester hors du modèle : capacités étroites, système de fichiers isolé, réseau fermé par défaut, identifiants éphémères et moteur de politiques externe.

  • Appliquer l'autorisation hors des données contrôlées par le modèle
  • Limiter une capacité à une tâche, des ressources et une courte durée
  • Séparer lecture et écriture
  • Rendre les actions irréversibles idempotentes et auditables

Construire une cellule d'exécution jetable

Chaque exécution commence dans une sandbox ou VM neuve avec une vue explicite des fichiers. Sockets hôte, métadonnées cloud, répertoires personnels et dépôts sans rapport restent inaccessibles. Les sorties passent par un proxy à liste blanche ; la recherche ouverte utilise un niveau séparé, en lecture seule et sans secrets de production.

Fournir les identifiants au dernier moment responsable

Des secrets durables dans le processus de l'agent annulent le moindre privilège. Un broker autorise l'identité de tâche, utilise un jeton court et renvoie un résultat structuré. Des contrats d'outils petits et typés, avec autorisation serveur, limites, idempotence et vérification finale, valent mieux qu'un client HTTP général muni d'un jeton administrateur.

L'approbation humaine est rare, pas un périmètre

L'approbation aide pour les décisions à fort impact mais ne remplace pas le confinement. Anthropic rapporte environ 93 % d'acceptation des demandes étudiées. Ne sollicitez l'humain que lorsque son jugement peut changer la décision. La baisse de 84 % des demandes grâce au sandboxing montre la voie : réduire mécaniquement les capacités ordinaires et conserver une revue délibérée pour l'exceptionnel.

Exploiter le confinement comme un système de production

Les traces doivent relier intention, versions du modèle et du prompt, preuves, capacités accordées, entrées d'outils, destinations réseau, sorties et décisions de politique. Un coupe-circuit révoque les identifiants, arrête les cellules, met les résultats en quarantaine et bloque les redémarrages. Testez le harness réel : un modèle sûr dans un environnement permissif reste un système dangereux.

  • Modéliser séparément les menaces du modèle, du harness, des outils et de l'environnement
  • Tester les injections de prompt et de sortie d'outil contre les vraies politiques
  • Mesurer le rayon d'impact et le temps de reprise
  • N'activer une capacité qu'après exercices de confinement et rollback

Sources primaires et lectures

Les chiffres et recommandations reposent sur des sources de première main ; ce sont des preuves, pas une checklist universelle de fournisseur.


Publié le 27 août 2026 par Berktug Berke Ates.