İçeriğe geç
Tüm içgörü yazıları

Üretken Yapay Zeka Red Team - İçgörü

Yapay Zeka Ajanlarında İstem, Araç ve Yetki Zinciri

Karar

Yapay zeka ajanını yalnız ürettiği yanıtlarla değerlendirmeyin. İstem, RAG, araç, MCP, veri ve yetki akışını uçtan uca test ederek kötüye kullanım yolunu doğrulayın.

Segment: yapay zeka doğrulaması arayan ekiplerHizmet: AIS-1 - Üretken Yapay Zeka Red Team

Yapay zeka ajanının güvenliği, yalnız verdiği yanıtların doğruluğuyla ölçülemez. Ajanın okuyabildiği içerik, çağırabildiği araçlar, erişebildiği veriler ve gerçekleştirebildiği işlemler aynı çalışma zamanı (runtime) akışının parçalarıdır. Güvenlik testi bu zincirin tamamını kapsamalıdır.

Yanlış çerçeve

Değerlendirmeyi halüsinasyon ve yanıt filtresiyle sınırlamak, bağlı sistemlerden doğan riski görünmez bırakır. Bir e-posta, web sayfası, RAG kaydı veya araç tanımı gizli talimat taşıdığında ajan kullanıcı niyetinin dışına çıkabilir.

Doğru çerçeve

Dolaylı istem enjeksiyonunda saldırgan talimatı doğrudan sohbet kutusuna yazmaz; modelin daha sonra okuyacağı içeriğe yerleştirir. OWASP LLM Top 10 bu saldırı sınıfını öne çıkarmaktadır. Test, güvenilmez içeriğin sistem talimatını, veri erişimini ve araç kullanımını nasıl etkilediğini izlemelidir.

Ajanlı sistemlerde özel veri erişimi, güvenilmez içerik ve dış işlem yeteneği aynı oturumda birleştiğinde risk büyür. Mimari hedef, bu koşulları ayrıştırmak; yüksek etkili işlemleri tanımlı onay, en az ayrıcalık ve ayrıntılı kayıtla sınırlandırmaktır.

Saha: vakalar

EchoLeak vakası, Microsoft 365 Copilot’un bir e-postadaki dolaylı talimatı işlemesiyle veri sızıntısına uzanan bir zinciri gösterdi. GitHub Copilot Chat ve Slack AI üzerinde açıklanan benzer çalışmalar, aynı örüntünün kod deposu ve iş birliği araçlarında da görülebildiğini ortaya koydu.

Bu olaylarda tek bir savunma katmanı aşılmadı; içerik işleme, bağlantı gösterimi, izinli servis ve dış iletişim adımları birbirine bağlandı. Etkiyi belirleyen unsur, zincirdeki kontrollerin birlikte nasıl davrandığıydı.

Mitigasyonun sınırı

Sistem istemini güçlendirmek, sınıflandırıcı eklemek veya kara liste kullanmak saldırıyı zorlaştırabilir. Yine de ajanın gereğinden geniş veri ve işlem yetkisi varsa mimari risk devam eder. Kontroller oturum, araç ve veri kaynağı seviyesinde birlikte uygulanmalıdır.

Teslim ve doğrulama

Üretken Yapay Zeka Red Team, istem, RAG, araç, MCP ve yetki akışlarını onaylı sınırlar içinde test etmektedir. Doğrulanmış kötüye kullanım yolu güvenli PoC, etkilenen veri ve iş etkisiyle raporlanır; zinciri kesen kontroller kapatma önceliğine dönüştürülür ve yeniden test edilir.

Doğru ilk adım

Ajan iş akışını, araç kataloğunu, izin matrisini ve veri kaynaklarını çıkararak başlayın. Test edilen konu modelin kökeni ve dağıtım hattıysa Yapay Zeka Model Tedarik Zinciri Güvencesi; müşteriye ait ajanın koşu zamanı davranışıysa Üretken Yapay Zeka Red Team uygundur.

Yazıda Geçen Kavramlar ve Kısaltmalar

Dolaylı istem enjeksiyonu

Saldırgan talimatının modele doğrudan verilmek yerine modelin okuyacağı belge, e-posta, web sayfası veya araç tanımına yerleştirilmesidir.

Üçlü risk koşulu (Lethal Trifecta)

Özel veri erişimi, güvenilmez içerik ve dış işlem yeteneğinin aynı ajan oturumunda birleşmesidir.

MCP (Model Context Protocol)

Yapay zeka uygulamalarının dış araçlara ve veri kaynaklarına standart bir arayüz üzerinden bağlanmasını sağlayan serbest kullanımlı protokoldür.

// SONRAKİ ADIM

Ajanın araç ve yetki zincirini birlikte sınayın

Ajan iş akışını, veri kaynaklarını ve yüksek etkili işlemleri birlikte netleştirelim. Red Team kapsamını keşif görüşmesinde belirleyebiliriz.

Yapay Zeka Ajanlarında İstem, Araç ve Yetki Zinciri | RinP · Offensive Security