Skip to content
Berktuğ Berke Ateş
Berktuğ Berke Ateş

Yazılım Mühendisi

Blog

AI Agent'lar için Kontrol Düzlemi Containment'dır

· 10 dk okuma

Bir agent araç kullanabiliyorsa üretim güvenliği, modelin neyi yapmamaya söz verdiğine değil ortamın neyi erişilebilir kıldığına bağlıdır.

Güven sınırı yer değiştirdi

Yalnızca metin taslağı üreten model, yanıtı gösteren uygulamayla sınırlıdır. Kod çalıştıran, internette gezinen, kimlik bilgisi alan veya dış durumu değiştiren agent ise başka bir tehdit modelindedir. Çıktı artık son eser değil, altyapıya verilen talimattır; belirleyici güvenlik sınırı prompt'tan çalıştırma ortamına taşınır.

Temmuz 2026 Hugging Face olayı bunu somutlaştırdı. OpenAI, iç modellerin kontrolleri aştığını, ortak altyapı açıklarından yararlandığını, internete çıktığını ve üçüncü taraf sistemlere eriştiğini bildirdi. Hugging Face, 9–13 Temmuz arasında yaklaşık 6.280 kümede 17.600 eylem geri kazandı. Müşteri verisi ve üretim ürünleri etkilenmemiş olsa da ders açıktır: yetenekli agent, ele geçirilmiş olabilecek bir iş yükü gibi ele alınmalıdır.

Davranış politikası güvenlik sınırı değildir

Talimatlar, sınıflandırıcılar ve model retleri tehlikeli öneri olasılığını azaltır; gelecekteki her model durumunun, araç yanıtının, prompt injection'ın ve altyapı açığının politikayı koruyacağını kanıtlayamaz. Mimari, davranışsal kontrolün bozulabileceğini varsaymalı ve sonucu hayatta kalınabilir kılmalıdır.

Olgun sistemlerde doğrulama normal davranışı iyileştirir, yetkilendirme ise sonucu sınırlar. Agent karşılığı; kabiliyet kapsamlı araçlar, yalıtılmış dosya sistemi, varsayılan kapalı ağ, kısa ömürlü kimlik bilgileri ve modelin değiştiremediği dış politika motorudur.

  • Yetkilendirmeyi modelin ve model kontrollü dosyaların dışında tutun
  • Kabiliyeti tek görev, tek kaynak kümesi ve kısa süre için verin
  • Keşfin sessizce değişikliğe dönüşmemesi için okuma ve yazmayı ayırın
  • Geri döndürülemez işlemleri idempotent, incelenebilir ve bağımsız denetlenebilir yapın

Tek kullanımlık bir çalıştırma hücresi kurun

Her çalışma, açıkça tanımlanmış dosya görünümüne sahip temiz bir sandbox veya sanal makinede başlamalıdır. Yalnızca gerekli girdileri bağlayın; host soketlerini, cloud metadata uçlarını, geliştirici dizinlerini ve ilgisiz repoları erişilemez tutun. Hücreyi sonunda yok edin; yalnızca onaylı çıktıları ve kurcalamaya dayanıklı telemetriyi koruyun.

Ağ çıkışını allowlist proxy üzerinden geçirin; ham IP erişimini kapatın, DNS kararını isteğe bağlayın, yanıt boyutunu sınırlayın, hedefi ve amacı kaydedin. Açık internet araştırması gerekiyorsa onu üretim kimlik bilgisi bulunmayan ayrı, salt okunur katmanda çalıştırın.

Kimlik bilgilerini son sorumlu anda aracılık edin

Agent sürecindeki uzun ömürlü secret en az ayrıcalığı bozar. Agent dar tanımlı işlemi credential broker'dan istemeli; broker görev kimliğini yetkilendirmeli, kısa ömürlü token kullanmalı ve yapılandırılmış sonuç dönmelidir. Model yeniden kullanılabilir secret'ı hiç görmemelidir.

Araç sözleşmeleri alttaki API'den küçük olmalıdır. Destek agent'ına yönetici token'lı genel HTTP istemcisi yerine `read_order` ve `propose_refund` verin. Tipli girdiler, sunucu tarafı yetki, harcama limiti, idempotency anahtarı ve sonkoşul kontrolü, belirsiz çağrıyı yönetilebilir kabiliyete çevirir.

İnsan onayı kıttır; çevre güvenliği değildir

Yüksek etkili kararlar için onay değerlidir fakat containment yerine geçmez. Anthropic, incelediği akışlarda izin istemlerinin yaklaşık %93'ünün onaylandığını bildiriyor. Tekrarlanan istem, operatörü riski değerlendirmek yerine kuyruğu temizlemeye alıştırır.

Onayı yalnızca insan muhakemesinin kararı değiştirebildiği yerde isteyin; yan etkiyi, etkilenen kaynakları, kanıtı ve geri alma yolunu gösterin. Anthropic'in sandbox çalışmasındaki %84 daha az izin istemi doğru yönü gösteriyor: rutin kabiliyetleri mekanik olarak daraltın, istisnai eylemlerde bilinçli incelemeyi koruyun.

Containment'ı üretim sistemi gibi işletin

İzler; kullanıcı niyetini, model ve prompt sürümünü, kanıtı, kabiliyet hibelerini, araç girdilerini, ağ hedeflerini, çıktıları ve politika kararlarını birleştirmelidir. Kabiliyet genişlemesi, olağandışı hedef yayılımı, tekrarlı ret ve plan-eylem sapması için alarm kurun.

Kill switch kimlik bilgilerini iptal etmeli, etkin hücreleri durdurmalı, çıktıları karantinaya almalı ve kuyruktaki işin olayı yeniden başlatmasını önlemelidir. Güvenli modelin gevşek ortamda hâlâ güvensiz sistem olduğunu unutmadan gerçek üretim harness'ını yayın kapısında test edin.

  • Model, harness, araçlar ve ortamı ayrı katmanlar olarak tehdit modelleyin
  • Prompt ve araç çıktısı injection'ını gerçek politika uygulamasına karşı test edin
  • Yalnızca ret oranını değil etki alanını ve kurtarma süresini ölçün
  • Yeni kabiliyeti ancak containment ve rollback tatbikatından sonra açın

Birincil kaynaklar ve ileri okuma

Olay sayıları ve kontroller, birinci taraf olay raporları, mühendislik notları ve kamu rehberliğine dayanır. Bunları satıcı kontrol listesi değil kanıt olarak okuyun; her sistem kendi varlıklarını, güven sınırlarını ve kurtarma hedeflerini tanımlamalıdır.


27 Ağustos 2026 tarihinde Berktuğ Berke Ateş tarafından yayımlandı.