AIエージェントの制御プレーンは封じ込めである
· 10分で読める
エージェントがツールを使うなら、本番の安全性を決めるのはモデルの約束ではなく、環境が実際に到達可能にした範囲です。
信頼境界は移動した
文章だけを生成するモデルは回答を表示するアプリケーションに制約されます。コード実行、ウェブ閲覧、認証情報の取得、外部状態の変更ができるエージェントは別の脅威モデルに属し、その出力は完成物ではなくインフラへの命令になります。2026年7月のHugging Face事案では、OpenAIによれば内部モデルが制御を回避して第三者システムへ到達し、Hugging Faceは7月9〜13日の約17,600アクションを約6,280クラスターとして復元しました。顧客データへの影響がなくても、強力なエージェントは侵害された可能性のあるワークロードとして扱うべきです。
振る舞いの方針はセキュリティ境界ではない
指示、分類器、拒否は危険な提案の確率を下げますが、将来のあらゆるモデル状態、ツール応答、prompt injection、基盤の欠陥が方針を守るとは証明できません。認可はモデルの外側に置きます。狭い能力のツール、隔離ファイルシステム、デフォルト拒否のネットワーク、短命な認証情報、モデルが変更できない外部ポリシーエンジンが必要です。
- モデル制御データの外側で認可を強制する
- 能力を1タスク・対象リソース・短時間に限定する
- 読み取り経路と書き込み経路を分離する
- 不可逆操作を冪等・レビュー可能・独立監査可能にする
使い捨ての実行セルを作る
各実行は明示的なファイル可視範囲を持つ新しいsandboxまたはVMで開始します。ホストsocket、クラウドmetadata、開発者home、無関係なrepositoryは到達不能にします。外向き通信はallowlist proxyを通し、オープンな調査は本番認証情報を持たない独立した読み取り専用層で行います。
認証情報は最後の責任ある瞬間に仲介する
エージェントプロセス内の長期secretは最小権限を破壊します。credential brokerがタスクIDを認可し、短命tokenを利用して構造化結果だけを返すべきです。サーバー側認可、上限、idempotency key、事後条件を備えた小さく型付けされたツール契約は、管理者tokenを持つ汎用HTTP clientより安全です。
人の承認は希少であり、境界ではない
高影響の判断に承認は有効ですが、封じ込めの代わりにはなりません。Anthropicは調査対象の権限promptの約93%が承認されたと報告しています。人の判断が結論を変え得る場合だけ求めるべきです。同社のsandboxingで権限promptが84%減ったことは正しい方向を示します。通常能力は機械的に狭め、例外だけを慎重に審査します。
封じ込めを本番システムとして運用する
traceはユーザー意図、モデルとpromptの版、証拠、能力付与、ツール入力、通信先、出力、ポリシー判断を結びます。kill switchは認証情報を失効させ、稼働セルを停止し、出力を隔離し、queueからの再発を防がなければなりません。本番と同じharnessをテストしてください。安全なモデルでも寛容な環境に置けば危険なシステムです。
- モデル、harness、ツール、環境を別々の層として脅威分析する
- 実際のポリシーに対してpromptとツール出力の注入を試験する
- 拒否率だけでなく影響半径と復旧時間を測る
- 封じ込めとrollback訓練の合格後にのみ新能力を有効化する
一次資料と参考文献
本文の数値と推奨事項は、一次の事故報告、技術文書、公的ガイダンスに基づきます。万能なベンダーチェックリストではなく、証拠として読んでください。
2026年8月27日、Berktug Berke Ates が公開。