Bölüm 02 · 38 kaynak
Jailbreak ve Red Teaming
Modelin hizalama (alignment) sınırlarını aşmaya yönelik saldırılar ve bunları sistematik olarak arayan saldırgan-taraf metodolojisi.
Metodoloji10 kaynak
- Microsoft AI Red Team
Üretim ölçeğinde AI red-teaming yapan bir ekibin yayınladığı planlama rehberi; kapsam belirleme ve zarar kategorileri bölümleri kurumsal işte doğrudan kullanılabilir.
- Lessons from red teaming 100 generative AI products
Microsoft'un 100 ürünlük saha deneyiminden çıkan sekiz ders; "en etkili saldırılar en karmaşık olanlar değil" bulgusu metodolojiyi sadeleştirir.
- Red Teaming Language Models to Reduce Harms
Ölçekli insan red-teaming'in ilk büyük ampirik çalışması; model büyüdükçe saldırı yüzeyinin nasıl değiştiğini veriyle gösterir.
- NIST AI 100-2: Adversarial Machine Learning taksonomisi
Saldırı sınıflarının resmî terminolojisi; rapor yazarken ortak dil kurmak için referans alınır.
- LLM Red Team Playbook
Kapsam belirleme, tehdit modeli, OWASP LLM Top 10 test matrisi ve raporlama şablonlarını içeren pratik saha kılavuzu (EN+TR).
- OWASP GenAI Red Teaming Guide
OWASP Gen AI Security Project'in red team çalışmasını dört katmana (model değerlendirmesi, uygulama testi, altyapı, çalışma zamanı davranışı) ayıran resmî rehberi. Ad-hoc "prompt deneyelim" yaklaşımından kapsam-metodoloji-raporlama disiplinine geçmek isteyen ekipler için bu alandaki en yaygın kabul gören çerçeve.
- CSA — Agentic AI Red Teaming Guide
Cloud Security Alliance'ın tek-promptluk tarayıcıların kaçırdığı ajan katmanına odaklanan rehberi: yetki yükseltme, orkestrasyon hataları, hafıza manipülasyonu ve tedarik zinciri riskleri için senaryo bazlı test adımları ve örnek promptlar veriyor. Araç çağıran ajanları test edecekseniz LLM-merkezli rehberlerin bittiği yerden başlıyor.
- OpenAI's Approach to External Red Teaming for AI Models and Systems
OpenAI'ın dış red team kadrosunu nasıl kurduğunu anlatan beyaz kitap: ekip kompozisyonu seçimi, uzmanlara hangi erişim seviyesinin verileceği ve nasıl brifing yazılacağı gibi "insan tarafı" kararları açıkça tartışıyor. Red team ekibi kuracak veya dışarıdan hizmet alacak kurumlar için nadir bulunan operasyonel bir kaynak.
- Anthropic — Challenges in Red Teaming AI Systems
Anthropic'in kendi kullandığı red team yöntemlerini — alan uzmanı testi (politika zafiyet testi, sınır tehditleri, çok-dilli/çok-kültürlü), otomatik red teaming, çok-modlu test, kitle kaynaklı ve topluluk red teaming — tek tek anlatıp her birinin nerede tıkandığını gösteren yazı. Alanda ortak bir standart olmadığını açıkça itiraf etmesi ve nitel manuel testten nicel otomatik değerlendirmeye geçiş tezini savunması onu 'red teaming yapıyoruz' cümlesinin altını dolduran nadir kaynaklardan biri yapıyor.
- Anthropic Transparency Hub — model raporları ve system card'lar
Claude modellerinin system card'larını, RSP değerlendirmelerini ve dış red team ortaklarının (Trajectory Labs, 10a Labs, ALICE) bulgularını tek yerde toplayan resmî sayfa. Gerçek bir frontier lab'ın hangi saldırıları hangi bütçeyle denediğini ve neyi bulamadığını görmek, kendi test planınızı kalibre etmenin en hızlı yolu.
Saldırı yöntemleri ve literatür10 kaynak
- PAIR — Jailbreaking Black Box Large Language Models in Twenty Queries
Saldırgan bir LLM'in hedef modele karşı promptu yinelemeli olarak rafine ettiği kara kutu jailbreak algoritması; genellikle yirmiden az sorguda başarıya ulaşıyor. GCG gibi gradyan tabanlı yöntemlerin aksine model ağırlığı gerektirmediği için kapalı API'lere karşı çalışan otomatik red teaming'in fiili başlangıç noktası.
- TAP — Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
PAIR'in doğrusal rafinasyonunu ağaç aramaya çeviren ve umutsuz dalları hedefe hiç göndermeden budayan yöntem; GPT-4 Turbo ve GPT-4o'yu %80'in üzerinde oranda kırıyor, LlamaGuard'ı da aşıyor. Sorgu bütçesi kısıtlı gerçek testlerde PAIR'e göre neden daha verimli olduğunu görmek için okunması gereken devam makalesi.
- AutoDAN — Generating Stealthy Jailbreak Prompts on Aligned LLMs
Hiyerarşik genetik algoritma ile anlamsal olarak tutarlı, insan-okunur jailbreak promptları üreten yöntem; GCG'nin ürettiği anlamsız token yığınlarının aksine perplexity tabanlı savunmaları atlatıyor. "Girdi anlamsızsa engelle" filtresi kuran ekiplerin bu savunmanın neden yetersiz kaldığını anlaması için kritik.
- Crescendo — Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack
Zararsız bir soruyla başlayıp modelin kendi cevaplarına atıf yaparak konuşmayı adım adım tırmandıran çok-turlu jailbreak; her tur bir sonrakini bağlam içinde meşrulaştırdığı için tek-prompt filtreleri tamamen ıskalıyor. Otomatik hali Crescendomation, GPT-4'te %29-61 daha yüksek başarı bildiriyor.
- Many-shot Jailbreaking (Anthropic)
Uzun bağlam penceresine yüzlerce sahte zararlı soru-cevap çifti doldurarak modelin bağlam içi öğrenmesini silaha çeviren saldırı; başarı, örnek sayısına göre güç yasasıyla artıyor ve büyük modellerde daha etkili. Bağlam penceresini büyütmenin ücretsiz bir kazanım olmadığını gösteren temel bulgu.
- Best-of-N Jailbreaking
Aynı zararlı isteği rastgele büyük/küçük harf, karakter karıştırma gibi masum görünen bozmalarla binlerce kez yeniden örnekleyen, şaşırtıcı derecede basit kara kutu saldırısı; 10.000 örnekte GPT-4o'da %89, Claude 3.5 Sonnet'te %78 başarı. Metin, görüntü ve sesde birden çalışması, güvenliğin girdi yüzeyine ne kadar kırılgan bağlı olduğunu gösteriyor.
- Jailbroken: How Does LLM Safety Training Fail?
Jailbreak'lerin neden işe yaradığını iki kök nedene indirgeyen kavramsal çerçeve: rekabet eden hedefler ve uyumsuz genelleme. Tek tek saldırı isimleri ezberlemek yerine yeni saldırı sınıfları türetmek isteyen red team'ler için tüm alanın zihinsel haritası.
- Low-Resource Languages Jailbreak GPT-4
Zararlı promptları düşük kaynaklı dillere çevirmenin GPT-4 güvenlik eğitimini AdvBench üzerinde %79 oranında bypass ettiğini gösteren çalışma; güvenlik hizalamasının İngilizce'ye ne kadar bağımlı olduğunun kanıtı. Türkçe gibi İngilizce dışı dillerde test yapan herkesin çeviri-tabanlı saldırıyı temel senaryo olarak alması gerektiğini ortaya koyuyor.
- A StrongREJECT for Empty Jailbreaks
Mevcut jailbreak değerlendirme yöntemlerinin başarıyı insan yargısına göre ciddi biçimde şişirdiğini gösteren ölçüt ve otomatik değerlendirici; çünkü "başarılı" jailbreak'lerin çoğu modeli güvenliği aşmak yerine sadece aptallaştırıyor. Kendi red team raporunuzdaki başarı oranının gerçek olup olmadığını sorgulatan, alanın dürüstlük çıpası.
- Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming
3.000+ saatlik bug-bounty red teaming'e rağmen evrensel bir jailbreak bulunamayan sınıflandırıcı savunmasının teknik raporu; %0,38 ek reddetme ve %23,7 çıkarım maliyeti gibi üretim rakamlarını da açıkça veriyor. Saldırı-savunma yarışının savunma tarafında bugün elde olan en somut ampirik sonuç.
Araçlar8 kaynak
- garak
LLM'lere karşı otomatik zafiyet taraması yapan tarayıcı; probe/detector mimarisi sayesinde kendi saldırı sınıfınızı eklemek kolay, alanın fiili
nmap'i. - PyRIT
Microsoft'un red-teaming otomasyon çerçevesi; çok turlu saldırı akışları ve puanlayıcı (scorer) soyutlamasıyla tekrarlanabilir kampanyalar kurmaya uygun.
- promptfoo
Prompt/ajan/RAG değerlendirmesini CI'a bağlayan bildirimsel test aracı; red-team eklentileriyle regresyon testi gibi güvenlik testi koşturulabilir.
- HarmBench
Otomatik red-teaming yöntemlerini ve savunmaları aynı zeminde karşılaştıran standart değerlendirme çerçevesi.
- JailbreakBench
Jailbreak saldırılarının açık, sürümlenmiş ve tekrar üretilebilir kıyaslama seti; sonuçların karşılaştırılabilir olması için artefakt arşivi tutar.
- llm-attacks
GCG saldırısının referans uygulaması; otomatik adversarial sonek üretiminin nasıl çalıştığını kodda görmek için.
- DeepTeam
DeepEval ekibinin LLM ve ajan red teaming çerçevesi: 50+ zafiyet sınıfını 20+ saldırı vektörüyle (Crescendo, tree/sequential jailbreak, leetspeak, ROT13, Base64, çok-dilli) YAML config ve
deepteam runCLI'ı üzerinden çalıştırıyor, sonuçları OWASP LLM Top 10 2025, OWASP Agents Top 10 2026, MITRE ATLAS ve NIST AI RMF'e eşliyor. Goal theft, excessive agency ve tool orchestration abuse gibi ajan-katmanı zafiyetlerini hazır kural setleriyle kapsaması, tek-turlu model taramasının ötesine geçmek isteyen ekipler için ayırt edici yanı. - OpenRT
Çok-modlu LLM'ler için 42+ saldırı yöntemini tek arayüzde toplayan açık kaynak red team çerçevesi; GCG, AutoDAN, PAIR, GPTFuzzer, CipherChat, ActorAttack, Rainbow Teaming ve FigStep gibi görsel jailbreak'ler dahil. Literatürdeki yöntemleri tek tek repo repo kurmak yerine karşılaştırmalı çalıştırmak isteyen araştırmacılar için ciddi zaman kazandırıyor.
Veri setleri ve saldırı koleksiyonları4 kaynak
- "Do Anything Now" — jailbreak_llms
Vahşi ortamdan toplanmış 15.000'den fazla jailbreak prompt'unun ölçülüp sınıflandırıldığı veri seti; saldırı kalıplarının evrimini görmek için birincil kaynak.
- AdvBench / HarmBench davranış setleri
Standartlaşmış zararlı davranış istekleri; kendi guard'ınızı ölçerken karşılaştırılabilir taban sağlar.
- turkish-prompt-injection
107 Türkçe prompt injection ve jailbreak kalıbı; her satır OWASP ve MITRE ATLAS kimlikleriyle eşlenmiş ve karşı savunmasıyla birlikte veriliyor. Morfolojik bypass, çeviri bahanesi ve dil değiştirme (code-switch) teknikleri dahil.
- MHJ — Multi-Turn Human Jailbreaks (Scale AI)
Ticari bir red team çalışmasından çıkan, insan eliyle yürütülmüş 537 çok-turlu jailbreak konuşmasındaki 2.912 prompt ve red teamer'ların tasarım notları. Eşlik eden makale (arXiv 2408.15221), otomatik saldırılara karşı tek haneli başarı bildiren savunmaların insan çok-turlu saldırılarda %70'in üzerinde kırıldığını gösteriyor — otomasyona güvenen ekipler için ayıltıcı bir set. Not: erişim kapılı (HF hesabı ve iletişim bilgisi onayı gerekiyor) ve lisans CC-BY-NC-4.0 olduğu için ticari kullanıma kapalı.
Yarışma ve arena4 kaynak
- HackAPrompt
Dünyanın en büyük prompt injection yarışması; toplanan veri kamuya açık makaleye dönüştüğü için hem pratik hem literatür değeri var.
- Gray Swan Arena
Sınır modellere karşı ödüllü, sürekli açık jailbreak arenası; bulduğunuz kaçış gerçek bir laboratuvara raporlanır.
- Kalkan Arena
Türkçe "guard'ımızı kır" challenge platformu; rızaya dayalı, KVKK uyumlu maskelemeyle denemeleri eğitim verisine çeviriyor.
- Gandalf: Agent Breaker (Lakera)
Lakera'nın klasik şifre-çalma oyunu Gandalf'ın ajan çağına uyarlanmış hali: on gerçekçi GenAI/ajan uygulamasına karşı dört zorluk seviyesinde prompt injection, araç kötüye kullanımı ve veri sızdırma deniyorsunuz. Ücretsiz ve tarayıcıdan çalıştığı için ajan saldırı yüzeyini elle hissetmenin en hızlı yolu; ekip içi farkındalık eğitimi için ideal. Not: oyun aynı zamanda Lakera'nın ürünlerini besleyen bir saldırı veri motoru (yüz binlerce insan denemesi toplandı), yani girdileriniz kaydediliyor.
Eğitim2 kaynak
- Red Teaming LLM Applications
DeepLearning.AI'ın ücretsiz kısa kursu; ilk uçtan uca red-team akışını birkaç saatte kurdurur.
- HTB Academy — AI Red Teamer Job Role Path
Google ile ortak hazırlanan ve Google Secure AI Framework (SAIF) ile hizalı, 12 modül / 230 bölümlük uygulamalı yol: prompt injection, LLM çıktı saldırıları, veri zehirleme, evasion (foundations, first-order, sparsity), model gizliliği ve savunma. Lab ağırlıklı yapısı, makale okumaktan saldırı yapmaya geçmek isteyenler için iyi bir köprü. Not: freemium — giriş modülleri ücretsiz başlatılabiliyor, tam erişim ücretli HTB Academy aboneliği gerektiriyor.