Bölüm 01 · 35 kaynak
Prompt Injection
Bir dil modeline verilen talimatla, ona ulaşan veriyi ayırt edememesinden doğan zafiyet sınıfı. LLM güvenliğinin en temel ve en çözümsüz problemi.
Temel okumalar6 kaynak
- Prompt injection: what's the worst that can happen?
Alanın adını koyan kişinin risk çerçevesi; "sadece chatbot kötü söz söyler" sanısını kıran, saldırının neden veri sızdırma ve eylem ele geçirme olduğunu anlatan giriş metni.
- Simon Willison — prompt injection etiketi
Konunun 2022'den beri kesintisiz takip edildiği tek arşiv; yeni bir saldırı çıktığında ilk buraya bakılır.
- The lethal trifecta for AI agents
Özel veri + güvenilmeyen girdi + dışarı iletişim üçlüsü bir arada olduğunda sömürünün kaçınılmaz olduğunu gösteren zihinsel model; ajan mimarisi tasarlarken kontrol listesi olarak kullanılır.
- OWASP LLM01: Prompt Injection
Riskin standart tanımı, örnek senaryolar ve önerilen azaltımlar; kurumsal raporlarda atıf verilebilecek referans.
- Prompt Injection Nedir?
Konunun Türkçe kapsamlı girişi: doğrudan/dolaylı ayrımı, saldırı örnekleri ve savunma yaklaşımları.
- Fooling AI Agents: Web-Based Indirect Prompt Injection Observed in the Wild (Unit 42)
Palo Alto Unit 42'nin gerçek web taramasıyla dolaylı prompt injection'ın vahşi doğada uygulandığını belgeleyen geniş ölçekli raporu; saldırganların payload kurmak için kullandığı 22 farklı tekniği ve teslim yöntemlerinin dağılımını (görünür düz metin %37,8, HTML özniteliğinde gizleme %19,8, CSS ile render'ı bastırma %16,9) tek tek kataloglar. Sıfır font, display:none ve SVG CDATA gibi somut örnekleriyle kendi tespit kurallarınızı yazarken gerçek payload deseni kaynağı olarak kullanılabilir.
Akademik kaynaklar12 kaynak
- Not what you've signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection
Dolaylı prompt injection kavramını literatüre sokan çalışma; saldırganın modele hiç dokunmadan, modelin okuduğu içerik üzerinden kontrol ele geçirmesini gösterir.
- Ignore Previous Prompt: Attack Techniques For Language Models
Talimat kaçırma ve hedef saptırma tekniklerinin ilk sistematik incelemesi; "ignore previous instructions" kalıbının kökeni.
- Tensor Trust: Interpretable Prompt Injection Attacks from an Online Game
Binlerce gerçek insanın ürettiği saldırı/savunma verisinden çıkarılan taksonomi; oyunlaştırılmış veri toplamanın red-team değeri için de iyi bir emsal.
- Universal and Transferable Adversarial Attacks on Aligned Language Models
Otomatik üretilen sonek (suffix) saldırılarının modeller arası taşınabildiğini gösteren GCG çalışması; "kapalı model güvenlidir" varsayımını kırar.
- Design Patterns for Securing LLM Agents against Prompt Injections
Savunma tarafına geçen ender çalışmalardan biri; ajan mimarisinde injection'ı yapısal olarak sınırlayan altı tasarım kalıbı önerir.
- Indirect Prompt Injection in the Wild: An Empirical Study of Prevalence, Techniques, and Objectives
1,2 milyar URL ve 24,8 milyon host taranarak 11,7 bin sayfada 15,3 bin doğrulanmış dolaylı injection örneği bulan, alanın ilk büyük ölçekli ampirik analizlerinden biri; enjekte edilen talimatların ~%70'i insana render edilmeyen HTML içinde, yani hedef doğrudan makine. 13 model üzerinde 5.200 kontrollü deneyle uyum oranları da ölçülüyor (küçük modellerde düz metin girdide %8'e kadar).
- How Vulnerable Are AI Agents to Indirect Prompt Injections? Insights from a Large-Scale Public Competition
464 katılımcının 13 sınır modele karşı 272.000 saldırı denemesi ürettiği açık yarışmanın analizi; saldırı başarı oranı Claude Opus 4.5'te %0,5, Gemini 2.5 Pro'da %8,5 — yani hiçbir model bağışık değil. En çarpıcı bulgu, model yeteneği ile injection dayanıklılığı arasında zayıf korelasyon olması: "daha güçlü model" savunma stratejisi çürüyor.
- Security Challenges in AI Agent Deployment (ART benchmark)
22 sınır ajana 44 gerçekçi senaryoda 1,8 milyon prompt injection atılan bugüne dek en büyük halka açık red-team yarışmasının raporu; 60.000'den fazla politika ihlali üretildi ve bunlardan Agent Red Teaming (ART) ölçütü damıtıldı. Neredeyse tüm ajanlar 10-100 sorgu içinde kırılıyor ve saldırılar modeller arası yüksek oranda transfer oluyor — kendi ajanınızı ölçmek için hazır bir çıta.
- Lessons from Defending Gemini Against Indirect Prompt Injections
Google DeepMind'ın Gemini'yi dolaylı injection'a karşı savunurken kurduğu uyarlanabilir saldırı değerlendirme çerçevesini anlatan nadir "savunan taraftan" belge; statik test setlerinin neden yanıltıcı olduğunu ve adaptif saldırganla sürekli döngü kurmanın neden şart olduğunu üretim deneyimiyle gösteriyor. Kendi guardrail'inizi değerlendirme metodolojisi kurarken şablon olarak kullanılabilir.
- SecAlign: Defending Against Prompt Injection with Preference Optimization
Injection'lı girdileri güvenli/güvensiz çıktı çiftleriyle eşleyip tercih optimizasyonuyla eğiterek saldırı başarı oranını %10'un altına indiren, eğitim-zamanı savunmanın en güçlü örneği. Eğitimde görülmemiş, çok daha sofistike saldırılara da genelleşmesi ve fayda kaybının ihmal edilebilir olması onu filtre tabanlı savunmalardan ayırıyor.
- AI Agents May Always Fall for Prompt Injections
Prompt injection'ı Bağlamsal Bütünlük (Contextual Integrity) teorisiyle yeniden çerçeveleyip bir imkânsızlık sonucu öne süren tez: saldırgan engellenen akışı meşru gösterecek bir bağlam her zaman kurabilir, savunan kısıtı sıkarsa meşru davranışı bloklar. Aşırı-red ile güvenlik arasındaki takası neden "daha iyi filtre" ile çözemeyeceğinizi anlatan, savunma iddialarına şüpheyle bakmayı öğreten kavramsal okuma.
- Agent Data Injection Attacks are Realistic Threats to AI Agents
Talimat enjekte etmek yerine güvenilir görünen veriyi (araç yanıtı formatı, kaynak kimliği, yazar metadatası) taklit eden yeni bir sınıf: örneğin GitHub issue yorumunda yazarı "maintainer" gibi göstererek Claude Code/Codex/Gemini CLI'ya komut çalıştırtmak. Kritik nokta, mevcut savunmaların klasik injection'ı %0-0,7'ye indirirken bu sınıfta %50 başarıya izin vermesi — savunma test setinizde muhtemelen eksik olan senaryo.
Gerçek dünya vakaları4 kaynak
- The Month of AI Bugs 2025 (Wrap Up)
Ağustos 2025 boyunca her gün bir agentic AI zafiyeti yayınlanan kampanyanın kapanış dizini: Claude Code, Cursor, Devin, GitHub Copilot, Amazon Q, Jules, OpenHands dahil 29 bulgu tek sayfada. Kodlama ajanlarında injection → veri sızdırma → RCE zincirinin tekrar eden desenini görmek için en yoğun vaka arşivi; finali AgentHopper adlı ajanlar arası yayılan PoC "AI virüsü".
- Breaking down EchoLeak (CVE-2025-32711) — M365 Copilot'ta sıfır tıkla veri sızdırma
Kurbanın hiçbir şey yapmadan sadece e-posta alması yeterli olan ilk sıfır-tık LLM zafiyetinin dört aşamalı zincir analizi: XPIA sınıflandırıcısını atlatma, markdown ile link/görsel redaksiyonunu delme ve Teams proxy'si üzerinden CSP bypass. "LLM Scope Violation" kavramını tanıtır — güvenilmeyen girdinin modeli ayrıcalıklı veriye eriştirmesi, RAG mimarilerinin yapısal açığı.
- CurXecute — Cursor'da MCP otomatik başlatma ile RCE (CVE-2025-54135)
Slack gibi harici bir kaynaktan gelen zehirli içeriğin Cursor ajanını ~/.cursor/mcp.json dosyasını yazmaya ikna edip kullanıcı onayı beklemeden komut çalıştırmasına yol açan zincir. Geliştirici araçlarında "öneri" ile "icra" arasındaki sınırın ne kadar ince olduğunu gösteren, kendi ajan mimarinizde onay kapısı tasarlarken okunması gereken vaka.
- GitHub MCP Exploited: Accessing private repositories via MCP (Invariant Labs)
Herkese açık bir GitHub issue'suna gömülen talimatın ajanı özel repolardan veri çekip bunu public bir PR olarak yayınlamaya ikna ettiği saldırı; 'toxic agent flow' kavramını yaygınlaştıran yazı. Kilit tespit: açık MCP sunucusunun kodunda değil sistem mimarisinde — Claude 4 Opus gibi hizalanmış bir model bile düştüğü için sunucu tarafı yamayla kapanmıyor, yani model hizalaması tek başına yetmiyor.
Araçlar6 kaynak
- promptmap
Kendi sistem prompt'unuza karşı otomatik injection testi koşan tarayıcı; Türkiye'den Utku Şen tarafından geliştirildi, kural setini kendi uygulamanıza göre genişletebilirsiniz.
- Rebuff
Çok katmanlı injection tespiti: sezgisel filtre, LLM tabanlı sınıflandırma, vektör benzerliği ve canary token sızıntı kontrolü bir arada.
- Vigil
Prompt ve yanıtları YARA kuralları, vektör veritabanı ve transformer sınıflandırıcıyla tarayan savunma katmanı.
- uncloak
Görünmez Unicode ile gizlenmiş talimat kaçakçılığını ve tool poisoning'i yakalayan tarayıcı; sıfır bağımlılık, SARIF çıktısı ve tarayıcıda çalışan demosu var.
- Open-Prompt-Injection
USENIX Security 2024'te yayımlanan "Formalizing and Benchmarking Prompt Injection Attacks and Defenses" makalesinin çalıştırılabilir kod tabanı: 5 saldırı ve 10 savunmayı 10 model ve 7 görev üzerinde aynı çerçevede kıyaslar. Yeni bir savunma iddiasını "gerçekten işe yarıyor mu" diye sınamak için elinizdeki en tarafsız ve tekrarlanabilir zemin.
- LLMail-Inject Challenge Dataset (Microsoft)
839 katılımcının gerçek bir e-posta asistanı simülasyonunda ürettiği ~462.000 satırlık uyarlanabilir injection denemesi; 4 senaryo, farklı savunma konfigürasyonları ve LLM'lerden oluşan 40 seviye, her denemenin savunmayı geçip geçmediği etiketiyle. Sentetik değil rekabet baskısı altında insan tarafından üretilmiş saldırı korpusu olduğu için tespit modeli eğitmek ve savunma değerlendirmek için nadir kalitede.
Türkçeye özgü bulgular4 kaynak
- turkish-casefold-evasion
"İGNORE".lower() != "ignore"— Türkçe noktalı İ'nin Unicode katlaması, naif kelime filtrelerini ölçülen %94.6 oranında atlatıyor; veri seti ve tek satırlık NFKC düzeltmesiyle birlikte. - guard-blindspots-tr
248 etiketli Türkçe injection yükü popüler açık guard modellerinden geçirildi; İngilizcede iyi olan bir guard'ın Türkçede otomatik olarak iyi olmadığını ölçüyor.
- Benchmarking Prompt Injection Attacks on LLMs: Turkish Vulnerability Assessment and English Comparative Analysis
790 Türkçe düşmanca prompt ile 55 açık ve kapalı kaynak modeli test edip aynı promptların İngilizce çevirileriyle karşılaştıran, Türkçe LLM güvenliği üzerine geniş ölçekli akademik ölçüt. Ana bulgu güvenlik mekanizmalarının dilden bağımsız olmadığı: modeller arası fark büyük, kapalı kaynaklılar genel olarak önde ve halüsinasyon Türkçede ayrı bir güvenlik riski olarak öne çıkıyor.
- An Empirical Evaluation of Prompt Injection Vulnerabilities in Large Language Models Across Multilingual and Obfuscated Attack Scenarios
Altı sınır modelin (DeepSeek, GPT, Gemini, Grok, Llama, Qwen) İngilizce, Türkçe, Rusça ve Çince injection'lara verdiği yanıtı karşılaştırıp Türkçenin en yüksek uyum oranına sahip dil çıktığı çalışma: Türkçe %80,18 tam uyum, İngilizce ise %71,31. Türkçe konuşan bir savunucu için listede olması gereken sayısal kanıt — güvenlik hizalamasının ağırlıklı olarak İngilizce üzerine kurulduğu ve Türkçenin bir kaçış yüzeyi olduğu tezini destekliyor.
Pratik3 kaynak
- PortSwigger — Web LLM attacks
Ücretsiz, çözülebilir laboratuvarlarla LLM entegrasyonlarındaki injection ve aşırı yetki zafiyetlerini öğreten modül; web güvenliği geçmişi olan için en hızlı giriş.
- Gandalf
Seviye seviye zorlaşan sistem prompt sızdırma oyunu; alana ilk temas için standart başlangıç noktası.
- OWASP LLM Prompt Injection Prevention Cheat Sheet
OWASP'ın LLM01'i "ne yapmalı" seviyesine indiren uygulama rehberi: 13 saldırı kategorisi (RAG zehirleme, typoglycemia, çok-modlu görsel injection dahil) ve her biri için OpenAI/LangChain kod örnekli savunma deseni. Kritik dürüstlüğü de var — mevcut savunmaların saldırıyı sadece yavaşlattığını açıkça söyleyip insan onayı ve dual-LLM desenini öne çıkarır.