Bölüm 03 · 35 kaynak
Guardrail ve Savunma
Modelin girdisini ve çıktısını denetleyen koruma katmanları — ve bu katmanların gerçekte ne kadar işe yaradığı.
Çerçeveler15 kaynak
- NeMo Guardrails
Konuşma akışını Colang adlı bir dille programlayarak sınır koyan araç seti; diyalog düzeyinde kural yazmak isteyenler için en olgun seçenek.
- Guardrails AI
Çıktıyı şemaya ve doğrulayıcı zincirine tabi tutan çerçeve; hazır doğrulayıcı kütüphanesi (hub) sayesinde sıfırdan yazmadan kural eklenebilir.
- LLM Guard
Girdi/çıktı için hazır tarayıcı seti: injection, PII, toksisite, gizli veri sızıntısı ve zararlı URL kontrolleri bir arada.
- PurpleLlama
Meta'nın güvenlik araç seti; Llama Guard sınıflandırıcıları ve CyberSecEval değerlendirme paketi buradan çıkıyor.
- Prompt Guard
Doğrudan ve dolaylı injection'ı yakalamak için eğitilmiş küçük sınıflandırıcı; düşük gecikmeli ön filtre olarak konumlanır.
- Qwen3Guard
Alibaba'nın 119 dili kapsayan çok dilli guardrail model ailesi; "Gen" varyantı tam prompt/yanıt bağlamını okurken "Stream" varyantı üretim sürerken token-token skorlar, yani cevabı bitmeden kesebilirsiniz. Güvenli/tartışmalı/güvensiz üçlü etiketi, ikili sınıflandırıcıların Türkçe gri alanlarda yaptığı aşırı-red hatasını azaltmak için doğrudan kullanışlı.
- gpt-oss-safeguard-20b
OpenAI'ın açık ağırlıklı güvenlik muhakeme modeli: sabit bir taksonomiye değil, çıkarım anında verdiğiniz YAZILI POLİTİKAYA göre sınıflandırma yapar ve gerekçe izi üretir. Kendi KVKK/kurumsal politikanızı Türkçe yazıp yeniden eğitim olmadan uygulatabilmeniz, sabit kategorili guard modellerinden ayıran temel fark.
- Granite Guardian (IBM)
IBM'in risk tespit modeli ailesi; sosyal önyargı/şiddet gibi klasik başlıkların yanında jailbreak denemesi ve RAG halüsinasyonu (bağlam-dışılık, cevap uygunsuzluğu) için ayrı riskler tanımlaması onu diğer guard modellerinden ayırıyor. RAG kuran ekipler için "cevap gerçekten kaynakta yazıyor mu" kontrolünü hazır veriyor.
- ShieldGemma
Google'ın Gemma 2 üstüne kurulu içerik denetim modeli; 2B/9B/27B üç boyutta gelmesi sayesinde 2B'yi ucuz ön-filtre, büyüğünü ikinci kademe hakem olarak zincirleyebilirsiniz. Çıktısı Evet/Hayır + olasılık skoru olduğu için eşiği kendi aşırı-red toleransınıza göre kalibre etmeye elverişli.
- WildGuard
AI2'nin üç işi tek modelde yapan denetim aracı: zararlı niyet tespiti, zararlı yanıt tespiti VE modelin gerçekten reddedip reddetmediğini ölçme. Bu üçüncü "refusal detection" yeteneği sayesinde aşırı-red ölçümünü ayrı bir hakem kurmadan yapabilirsiniz; beraberinde 92 bin etiketli örneklik WildGuardMix veri seti geliyor.
- Llama Guard makalesi
Bugünkü "guard modeli" türünün başlangıç noktası: güvenlik taksonomisini prompt'a gömüp sınıflandırmayı talimat-takibi problemine çeviren tasarım burada anlatılıyor. Kendi Türkçe risk taksonomunuzu yeniden eğitim olmadan modele verme fikrinin nereden geldiğini anlamak için okunması gereken temel metin.
- any-guardrail (Mozilla.ai)
Llama Guard, ShieldGemma, Granite Guardian, Qwen3Guard gibi guardrail'leri tek ortak arayüz arkasında toplayan kütüphane; model değiştirmek tek satırlık parametre değişikliği oluyor. Kendi Türkçe test setinizle beş guard modelini yan yana koşturup karşılaştırmak isteyen ekipler için kurulum maliyetini sıfırlıyor.
- OpenGuardrails
İçerik güvenliği, model manipülasyonu (prompt injection, jailbreak) ve veri sızıntısını tek platformda birleştiren açık kaynak guardrail sistemi; politikayı yeniden eğitim olmadan istek başına ayarlayan "Configurable Policy Adaptation" mekanizması ve 14B taban modelin GPTQ ile 3.3B'ye sıkıştırılmış hali sayesinde tek GPU'da 275 ms P95 gecikme. 119 dil desteklendiği belirtiliyor, ancak yayımlanan hizalı değerlendirme verisi (OpenGuardrailsMixZh-97k) Çince odaklı; Türkçe performansı ölçülmemiş, denemeden önce kendi setinizle doğrulayın.
- Amazon Bedrock Guardrails (resmî dokümantasyon)
Bulut sağlayıcının guardrail'i nasıl parçaladığını gösteren referans doküman: içerik filtreleri, yasaklı konular, kelime filtreleri, PII maskeleme, RAG halüsinasyonu için "contextual grounding" ve mantıksal kurallarla doğrulama yapan "Automated Reasoning checks". ApplyGuardrail API'si modeli çağırmadan da kullanılabildiği için kendi mimarinize politika katmanı tasarlarken iyi bir kontrol listesi.
- turkish-toxic-language (Overfit-GM)
77.800 Türkçe metnin OTHER / PROFANITY / INSULT / RACIST / SEXIST olarak etiketlendiği, dağınık Türkçe saldırgan-dil veri setlerini birleştiren koleksiyon. İngilizce guard modellerinin Türkçe'de kaçırdığı vakaları ölçmek veya yerli bir moderasyon sınıflandırıcısını eğitmek için elde bulunan en kullanışlı hazır temel; SEXIST sınıfının yalnızca 945 örnek olması dengesizliği de baştan görünür kılıyor.
PII ve veri koruma5 kaynak
- Presidio
Metin, görsel ve yapılandırılmış veride kişisel veri tespiti ve maskeleme; NLP ve örüntü eşleştirmeyi birleştirir, kendi tanıyıcınızı eklemeye açıktır.
- turkish-pii-redactor
TCKN, IBAN, VKN, plaka gibi Türkiye'ye özgü kimlik verilerini checksum doğrulamasıyla yakalayan maskeleyici; Presidio'nun kutudan çıktığı hâliyle bu alanları %0 oranında yakaladığı ölçümüyle birlikte.
- KVKK + AI uyum kiti
LLM uygulamaları için KVKK kontrol listesi: veri minimizasyonu, maskeleme ve AB AI Act kesişimi. Hukuki tavsiye değildir.
- KVKK — Üretken Yapay Zekâ ve Kişisel Verilerin Korunması Rehberi (15 Soruda)
Türkiye'nin veri koruma otoritesinin üretken yapay zekâya özel resmî rehberi: sistemlerin yaşam döngüsü ve içerik üretim süreci 6698 sayılı Kanun çerçevesinde değerlendiriliyor, kullanıcılara ve ebeveynlere yönelik somut öneriler veriliyor. Türkiye'de LLM ürünü çıkaran ekip için PII maskeleme kararlarının hukuki dayanağı burada, blog yorumlarında değil.
- ai4privacy — pii-masking-400k
PII tespit/maskeleme modeli eğitmek veya mevcut redaksiyon hattınızı ölçmek için token seviyesinde etiketlenmiş veri seti (100K-1M satır). Kapsadığı diller yalnızca İngilizce, Fransızca, Almanca, İtalyanca, İspanyolca ve Felemenkçe — TÜRKÇE İÇERMİYOR, dolayısıyla Türkçe bir regresyon kümesi değil; değeri PII varlık şeması ve etiket taksonomisi için referans olmasında. Lisansı standart açık lisans değil, depoya özel license.md; kurumsal kullanımdan önce okuyun.
Guardrail'ler gerçekte ne kadar çalışıyor?6 kaynak
- guardrail-arena
İki eksenli, çok dilli (EN+TR) guardrail ölçütü: hem saldırı kaçırma oranını hem de zararsız metni aşırı reddetme oranını ölçer. Bulgu: test edilen guard'lar güvenlikle ilgili zararsız metnin %40–70'ini reddediyor.
- turkish-over-refusal-set
XSTest tarzı aşırı-red testi: ProtectAI guard'ı zararsız Türkçe isteklerin %59'unu reddederken aynı setin İngilizcesinde bu oran %0.8. Guardrail seçerken tek eksenli bakmanın maliyetini gösterir.
- XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours
Aşırı-red (over-refusal) problemini ölçülebilir hâle getiren çalışma; güvenlik ile kullanılabilirlik arasındaki dengeyi sayıya döker.
- OR-Bench: An Over-Refusal Benchmark for Large Language Models
Aşırı-red ölçümünü XSTest'in 450 promptluk ölçeğinden çıkarıp 80.000 zararsız-ama-reddedilebilir prompt'a taşıyan ölçüt; 10 red kategorisi, ~1000 zor örnek ve doğrulama için 600 gerçekten toksik prompt içeriyor. 32 modelin 8 aileden karşılaştırması, "güvenlik ayarı arttıkça faydalılık nerede kırılıyor" sorusuna ölçekli cevap veriyor.
- SORRY-Bench: Systematically Evaluating LLM Safety Refusal
Red davranışını 44 alt başlıklı ince taksonomi ve sınıf-dengeli 440 talimatla ölçen ölçüt; asıl değeri 20 dilsel dönüşüm (farklı diller, lehçeler, yazım biçimleri) uygulayarak "güvenlik İngilizce dışında da tutuyor mu" sorusunu sistematik test etmesi. Ayrıca 7K+ insan etiketiyle LLM-as-a-judge tasarımlarını meta-değerlendirip 7B hakem modelinin GPT-4 seviyesine çıkabildiğini gösteriyor — ucuz hakem kurmak isteyenlere doğrudan reçete.
- Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation
14 açık kaynak guard modelini 79.331 örnek üzerinde NIST AI Risk Management Framework'ün 8 güvenlik kategorisine göre yan yana koyan Nisan 2026 preprint'i; ana bulgu 4B'lik Qwen Guard'ın %83,97 recall ile çok daha büyük modelleri geçmesi, yani parametre sayısı = güvenlik değil. "Güvenlik uygulamalarında kritik metrik recall'dur, kaçırılan zararlı içerik yanlış pozitiften daha maliyetlidir" tezini savunarak F1 ortalamalarına bakıp model seçen ekipleri uyarıyor. NOT: hakem denetimli bir yayın değil, arXiv preprint'i.
Mimari savunma9 kaynak
- Constitutional AI: Harmlessness from AI Feedback
Modelin kendi çıktısını yazılı ilkelere göre eleştirip düzelttiği hizalama yöntemi; guardrail'in model içine gömülmüş hâli.
- StruQ: Defending Against Prompt Injection with Structured Queries
Talimat ile veriyi yapısal olarak ayırmayı öneren savunma; filtre yerine mimari çözüm arayanlar için.
- CaMeL: Defeating Prompt Injections by Design
Yetenek tabanlı (capability) bir kontrol katmanıyla ajanın injection sonrası ne yapabileceğini sınırlayan tasarım; "modeli düzelt" yerine "yetkiyi kıs" yaklaşımı.
- LlamaFirewall
Tek bir sınıflandırıcı yerine katmanlı ajan savunması öneren sistem makalesi: PromptGuard 2 (jailbreak tespiti), Agent Alignment Checks (ajanın hedefinden saptırılıp saptırılmadığını denetleyen muhakeme katmanı) ve CodeShield (üretilen kodun statik analizi). Ajan mimarilerinde "girdi filtresi yetmez, niyet takibi lazım" tezinin en somut açık kaynak uygulaması.
- Invariant Guardrails
Ajan akışlarına (tool çağrıları, MCP mesajları, ara adımlar) kural yazmanızı sağlayan guardrail motoru; tek prompt'u değil tüm ajan iz kaydını (trace) denetlediği için "araç A'dan gelen veriden sonra araç B çağrılamaz" tipi akış kısıtları kurulabiliyor. Prompt filtresinin yetmediği ajan senaryolarında yetenek kısıtlamayı koda dökmenin pratik yolu.
- Azure AI Content Safety — Prompt Shields
Doğrudan kullanıcı saldırısı ile belge/e-posta içine gömülü dolaylı saldırıyı (XPIA) ayrı ayrı ele alan Microsoft filtresinin kavram dokümanı; saldırı alt sınıflarını (sistem kuralını değiştirme, sahte konuşma gömme, rol-oyunu, kodlama saldırıları) örnekli tabloyla veriyor. Kendi tespit taksonominizi yazarken doğrudan kopyalanabilir bir iskelet, ayrıca dil sınırlamasını açıkça itiraf ediyor.
- Defending Against Indirect Prompt Injection Attacks With Spotlighting
Güvenilmeyen veriyi işaretleme (sınırlayıcı, veri işaretleme, kodlama) yoluyla modele "bu metin veridir, talimat değildir" sinyali veren savunmanın orijinal makalesi; GPT ailesinde saldırı başarısını %50+'den %2'nin altına indiriyor. Model değiştirmeden, sadece prompt katmanında uygulanabildiği için mimari savunmaya girişin en ucuz basamağı.
- The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions
Prompt injection'ın kök nedenini "model sistem prompt'u ile kullanıcı girdisini eşit ayrıcalıkta görüyor" diye teşhis edip çözümü eğitim aşamasına taşıyan OpenAI makalesi; ayrıcalık seviyeleri tanımlayıp düşük seviyeli talimatları seçici olarak yok saymayı öğretiyor. Bugün ticari modellerdeki system/developer/user rol ayrımının teorik temeli burada.
- Mitigating prompt injection attacks with a layered defense strategy (Google)
Google'ın Gemini üretim hattında fiilen koştuğu beş savunma katmanının resmî anlatımı: injection sınıflandırıcıları, güvenilmeyen veriye "security thought reinforcement" işaretleri, markdown sanitizasyonu + şüpheli URL redaksiyonu, riskli eylemlerde kullanıcı onayı ve engelleme bildirimleri. Akademik öneri değil, ölçekte çalışan bir savunma yığınının kamuya açık dökümü.