Bölüm 07 · 27 kaynak
RAG ve Uygulama Güvenliği
Modeli bir uygulamaya bağladığınız anda klasik uygulama güvenliği geri geliyor — üstüne vektör veritabanı, belge alma ve aşırı yetki katmanlarıyla.
RAG'a özgü riskler8 kaynak
- RAG Security Nedir?
Belge alma mimarilerindeki güvenlik sorunlarının Türkçe girişi: bilgi tabanı zehirlenmesi, yetki sızıntısı ve alıntı manipülasyonu.
- OWASP LLM08: Vector and Embedding Weaknesses
Vektör veritabanı ve gömme katmanına özgü risklerin standart tanımı; çok kiracılı RAG kurulumlarındaki yetki karışmasını da kapsar.
- PoisonedRAG: Knowledge Corruption Attacks to RAG
Bilgi tabanına birkaç zehirli belge eklemenin cevabı hedeflenen şekilde değiştirmeye yettiğini gösteren çalışma.
- Follow My Instruction and Spill the Beans
Alınan bağlamın içine gömülü talimatların modeli ele geçirdiğini ve bağlam sızıntısına yol açtığını inceleyen çalışma.
- ConfusedPilot: Confused Deputy Risks in RAG-based LLMs
Kurumsal Copilot benzeri RAG sistemlerinde "karışık vekil" (confused deputy) sınıfını tanımlayan makale: ortama sıradan görünen tek bir doküman bırakan düşük yetkili bir kullanıcı, diğer kaynakları göz ardı ettirip yanıtı bozabiliyor ve önbellek mekanizmasıyla silinmiş gizli veriyi sızdırabiliyor. RAG'ın asıl riskinin model değil kurumsal yetki mimarisi olduğunu gösterdiği için burada.
- Phantom: General Backdoor Attacks on Retrieval Augmented Language Generation
Bilgi tabanına eklenen TEK bir zehirli dokümanın, yalnızca kullanıcı sorgusunda belirli bir tetikleyici kelime geçtiğinde aktifleşen bir arka kapıya dönüştüğünü gösteriyor; iki aşamalı optimizasyon önce retriever'ı kandırıyor sonra üreteci (cevap vermeyi reddetme, itibar zedeleme, gizlilik ihlali gibi hedeflerle). Açık ve kapalı modellerin yanı sıra NVIDIA'nın 'Chat with RTX' üretim sistemi üzerinde de doğrulandığı için hedefli/gizli zehirleme senaryosunun en somut örneği.
- Awesome-Trustworthy-RAG
Güvenilir RAG literatürünü sekiz eksende (gizlilik, güvenilirlik, dayanıklılık, güvenlik/zehirleme, adalet, açıklanabilirlik, hesap verebilirlik, ölçütler) tasnif eden küratörlü makale listesi ve arkasındaki survey. RAG güvenliğine yeni giren birinin hangi saldırı ailesinin nerede durduğunu bir oturuşta haritalaması için en hızlı yol.
- EchoLeak (CVE-2025-32711) — M365 Copilot'ta sıfır-tık veri sızıntısı
Aim Labs'in orijinal açıklaması: kurbana yalnızca bir e-posta göndererek, kullanıcı hiçbir şeye tıklamadan Copilot'un bağlamındaki kurumsal veriyi dışarı sızdıran zincir — XPIA sınıflandırıcısı, link redaksiyonu ve CSP savunmalarının üçünün de nasıl atlatıldığı adım adım. RAG bağlamının güven sınırı olarak çöktüğü ilk gerçek üretim vakası.
Vektör veritabanı ve çok-kiracılılık2 kaynak
- The AI Data You Forgot to Lock: Exposed Vector Databases
Orca araştırma ekibinin internete açık Weaviate/Milvus/ChromaDB örneklerini tarayıp içinde ne bulduğunun raporu: TC kimlik benzeri ulusal numaralar, hasta teşhisleri, biyometrik kayıtlar ve düz metin bulut anahtarları. "Vektör veritabanı sadece sayı tutar" yanılgısını somut kanıtla yıktığı için bu bölümde.
- ChromaToast: Unauthenticated RCE in AI Vector Databases (CVE-2026-45829)
ChromaDB'nin Python FastAPI sunucusunda, kullanıcı kontrollü embedding-function ayarının kimlik doğrulamasından ÖNCE işlenmesi sayesinde kötü niyetli bir HuggingFace modeli (trust_remote_code) indirilip çalıştırılıyor; sonuç kimlik doğrulamasız tam sunucu devralma (CVSS 10.0, sürüm 1.0.0-1.5.8, Mayıs 2026 itibarıyla yamasız — geçici çözüm Rust sunucusuna geçmek veya erişimi kısıtlamak). RAG yığınının en alt katmanının klasik bir tedarik-zinciri zafiyetiyle düştüğünü gösteren güncel referans vaka.
Uygulama katmanı10 kaynak
- OWASP Top 10 for LLM Applications
Uygulama düzeyindeki risklerin (aşırı yetki, güvensiz çıktı işleme, sınırsız tüketim) ortak referansı.
- OWASP API Security Top 10
LLM'i bir API'nin arkasına koyduğunuz anda geçerli olan klasik liste; yetkilendirme hatalarının çoğu hâlâ buradan geliyor.
- PortSwigger — Web LLM attacks
LLM'e verilen aşırı yetkinin klasik web zafiyetlerine (SSRF, komut çalıştırma) nasıl döndüğünü laboratuvarla gösteren modül.
- OWASP Cheat Sheet Series
Çıktı kodlama, yetkilendirme ve girdi doğrulama gibi temel konularda uygulanabilir kısa rehberler; LLM çıktısını HTML'e basmadan önce bakılacak yer.
- OpenFGA — RAG Authorization
RAG'da yetkilendirmeyi prompt'a "gösterme" demekle değil, retrieval ile model arasına ReBAC filtresi koyarak çözen resmî desen dokümanı: aday dokümanları çekip her biri için izin sorgulamak yerine list-objects ile kullanıcının görebildiği kümeyi alıp kesişim almak. Aynı promptun kullanıcıya göre farklı cevap vermesi gerektiğini kod seviyesinde tarif ediyor.
- Practical LLM Security Advice from the NVIDIA AI Red Team
NVIDIA kırmızı takımının onlarca üretim sistemini denetledikten sonra en sık gördüğü üç kusuru anlattığı yazı: LLM çıktısını izolasyonsuz exec/eval'e vermek, Markdown/görsel render'ı üzerinden veri sızdırmak ve RAG ingest'inde izinlerin kaynaktan kopması. Teorik risk listesi değil, sahada tekrar tekrar bulunan somut hatalar ve düzeltmeleri.
- OWASP LLM05:2025 Improper Output Handling
LLM çıktısını downstream bileşene doğrulamadan geçirmenin XSS, CSRF, SSRF, SQL injection, yetki yükseltme ve RCE'ye nasıl döndüğünü altı saldırı senaryosu ve yedi önlemle anlatan resmî OWASP maddesi. "Modelin çıktısı da kullanıcı girdisidir" kuralını kurumsal denetimlerde referans gösterebileceğiniz kanonik kaynak.
- OWASP LLM06:2025 Excessive Agency
Aşırı işlevsellik / aşırı izin / aşırı özerklik üçlüsünü ayırarak, halüsinasyon veya prompt injection tetiklendiğinde ajanın gerçek dünyada ne kadar zarar verebileceğini sınırlamanın sekiz yolunu veren OWASP maddesi. Araç çağıran her RAG asistanında "kaç yetki fazla verdik" sorusunu sistematikleştiriyor.
- When Prompts Go Rogue: Vanna.AI'de Prompt Injection ile Kod Çalıştırma (CVE-2024-5565)
Doğal dilden SQL üreten popüler bir kütüphanede, kullanıcı sorusunun LLM'e Plotly kodu ürettirip doğrudan Python exec()'e düşmesiyle oluşan RCE'nin tam zinciri. "İzole prompt injection" ile "entegre prompt injection" ayrımını netleştirdiği için LLM çıktısının nereye aktığını haritalamayı öğreten en iyi vaka analizlerinden.
- Yapay Zeka Uygulamalarının Güvenliğini Sağlama (Google Codelab, Türkçe)
Tamamen Türkçe, uçtan uca uygulamalı bir laboratuvar: üretken YZ uygulamasının önüne prompt injection/jailbreak tespiti ve KVKK'yı ilgilendiren PII maskeleme katmanı koyup şablonları gerçek prompt'larla test ediyorsunuz. Türkçe kaynak kıtlığı olan "savunma katmanını gerçekten kur ve dene" boşluğunu doldurduğu için burada.
Gizlilik ve veri sızıntısı7 kaynak
- Extracting Training Data from Large Language Models
Modelin eğitim verisini ezberleyip geri verebildiğini gösteren temel çalışma; veri gizliliği tartışmasının başlangıç noktası.
- Scalable Extraction of Training Data from (Production) Language Models
Üretimdeki kapalı modellerden bile eğitim verisi çıkarılabildiğini gösteren devam çalışması.
- Presidio
Uygulama sınırında kişisel veriyi tespit edip maskeleyen çerçeve; loglara ve model isteklerine PII kaçmasını engellemek için.
- Is My Data in Your Retrieval Database? MIA Against RAG
Bir metin parçasının RAG'ın vektör deposunda bulunup bulunmadığını yalnızca sistemin cevaplarına bakarak anlamayı gösteren üyelik çıkarımı çalışması; black-box ve gray-box senaryolarda çalışıyor ve prompt şablonuna eklenen talimatla kısmi bir savunma öneriyor. "Belge içeriği sızmadı" demenin neden yetmediğini — varlığın kendisinin gizli bilgi olabileceğini — kanıtlıyor.
- Text Embeddings Reveal (Almost) As Much As Text
Embedding inversion'ın temel makalesi: yinelemeli düzelt-ve-yeniden-göm yöntemiyle 32 token'lık girdilerin %92'sini birebir geri kurtarıyor, klinik notlardan tam isimleri çıkarıyor. Vektör veritabanını "anonim sayı yığını" sanan mimarileri çürüttüğü için RAG gizliliğinin başlangıç noktası.
- vec2text
Yukarıdaki embedding inversion makalesinin çalışan uygulaması — kendi vektör deponuzdaki gömüleri alıp metne geri çevirerek riskin sizde ne kadar gerçek olduğunu ölçmenizi sağlıyor. Slayt tartışması yerine kendi verinizle demo yapabildiğiniz için gizlilik gerekçelendirmesinde en ikna edici araç.
- The Good and The Bad: Exploring Privacy Issues in RAG
RAG'ın gizlilik açısından iki yüzünü ampirik olarak ölçen çalışma: bir yandan kurumsal retrieval veritabanını sızdırma riski yaratıyor, diğer yandan modelin kendi eğitim verisinin çıkarılmasını zorlaştırıyor. "RAG kullanınca gizlilik sorunu biter" ve "RAG her şeyi sızdırır" uçlarının ikisini de veriyle düzelttiği için dengeli okuma.