Yapay Zeka Güvenliği Kaynakları

Bölüm 08 · 33 kaynak

Türkçe Kaynaklar ve Veri Setleri

Türkçe konuşan bir saldırı yüzeyi var ve İngilizce için ölçülmüş hiçbir sonuç buraya doğrudan taşınmıyor. Bu bölüm o boşluğu belgeliyor.

Neden ayrı bir bölüm?

Türkçe, güvenlik filtreleri açısından üç ayrı zorluk çıkarıyor: Unicode büyük/küçük harf katlaması (İ/ı), İngilizce ağırlıklı eğitilmiş guard modellerinin düşük kapsamı, ve KVKK'ya özgü kişisel veri biçimleri (TCKN, VKN, IBAN, plaka). Aşağıdaki ölçümler bu üç eksenin de gerçek ve ölçülebilir olduğunu gösteriyor.

Ölçülmüş bulgular9 kaynak

  • turkish-casefold-evasion

    Türkçe harf katlamasının naif kelime filtrelerini %94.6 oranında atlattığı ölçümü; veri seti ve NFKC düzeltmesiyle.

    araştırmaAltaySecgithub.com
  • turkish-over-refusal-set

    120 zararsız-ama-ürkütücü çift üzerinden aşırı-red ölçümü: ProtectAI guard'ı Türkçede %59, İngilizcede %0.8 reddediyor (71 kat fark).

    araştırmatürkçeAltaySecgithub.com
  • guard-blindspots-tr

    248 etiketli Türkçe injection yükü ve obfuskasyon stres testi; popüler bir açık guard Türkçe saldırıların %85'ini kaçırıyor, başkaları sağlam kalıyor.

    araştırmaAltaySecgithub.com
  • guardrail-arena

    EN+TR iki eksenli guardrail ölçütü; jailbreak-classifier bu sette Türkçe saldırıların %83'ünü kaçırdı.

    ölçütAltaySecgithub.com
  • Benchmarking Prompt Injection Attacks on LLMs: Turkish Vulnerability Assessment and English Comparative Analysis

    790 Türkçe düşmanca istem üretip 55 açık ve kapalı kaynak modelde Türkçe-İngilizce eşli olarak koşan hakemli çalışma (Applied Sciences, 6 Tem 2026, CC-BY). Güvenlik davranışının dile göre kaydığını ölçüyor: GPT-5.4 Türkçe testlerde %99.37 ile birinci, aynı istemlerin İngilizcesinde %96.71'e düşüyor, İngilizcede ise Qwen3.5:27B %97.47 ile önde; halüsinasyon Türkçe değerlendirmelerde ayrı bir güvenlik riski olarak öne çıkıyor.

    makaledoi.org
  • TurkBench

    21 alt görev ve 8.151 örnekle Türkçe büyük dil modellerini ölçen, altı ana kategorisinden biri doğrudan içerik denetimi (content moderation) olan akademik ölçüt. Türkçe bir modelin yetenek puanı ile zararlı içerik davranışını aynı çatı altında karşılaştırmak istediğinizde referans alınacak çalışma.

    ölçütarxiv.org
  • There Are No Silly Questions: Evaluation of Offline LLM Capabilities from a Turkish Perspective (Turkish Anomaly Suite)

    270M-32B aralığındaki 14 çevrimdışı modeli, Türkçe için özel yazılmış 10 uç-durum senaryosundan oluşan Turkish Anomaly Suite (TAS) ile sınayan ön baskı; anomaliye direncin yalnızca model boyutuna bağlı olmadığını ve yağcılık (sycophancy) eğiliminin büyük modellerde de sürdüğünü ölçüyor. Çalışmanın bağlamı Türkçe miras dili eğitimidir; genel bir güvenlik ölçütü değil, sycophancy ve sağlamlık tarafında Türkçe ölçüm sunan dar kapsamlı bir kaynaktır.

    makalearxiv.org
  • seneca-trbench

    553 soruluk (131 çoktan seçmeli + 422 kısa cevap) Türkçe LLM ölçütü; kısa cevap tarafındaki 12 kategoriden biri olan 'Güvenlik ve Dürüstlük' halüsinasyon tuzakları, zararlı içerik reddi, bilgi sınırları, manipülasyon, sosyal mühendislik, özel veri güvenliği ve çocuk güvenliği alt testlerini içeriyor. OpenAI/Anthropic/Gemini/Together ve yerel HuggingFace modellerini aynı sorularla koşturan hazır bir takım; puanlama GPT-4o hakem modeliyle yapıldığı için sonuçlar hakem modelin yanlılığını taşır.

    ölçütgithub.com
  • Cetvel

    Koç Üniversitesi KUIS AI'ın lm-evaluation-harness üzerine kurduğu, 22 Türkçe veri seti ve yedi kategoriye yayılmış 23 görevlik birleşik değerlendirme çatısı; 70B'ye kadar 33 açık ağırlıklı modeli ölçüp Türkçeye özel ayarlanmış modellerin çok dilli genel modellerin (Llama 3, Mistral) gerisinde kaldığını raporluyor. Bir güvenlik ölçütü değildir — güvenliğe en yakın görevi OffensEval-TR saldırgan dil sınıflandırmasıdır; değeri, kendi Türkçe güvenlik görevlerinizi ekleyebileceğiniz standart koşum altyapısı olmasıdır.

    ölçütgithub.com

Veri setleri (Hugging Face)10 kaynak

  • Hugging Face — AltaySec veri setleri

    Türkçe injection, aşırı-red, casefold kaçışı ve ajan eklenti denetimi veri setlerinin toplandığı profil.

    datasettürkçeAltaySechuggingface.co
  • turkish-prompt-injection

    107 Türkçe injection/jailbreak kalıbı, OWASP ve MITRE ATLAS eşlemeli, her biri savunmasıyla birlikte.

    datasettürkçeAltaySechuggingface.co
  • multilingual-jailbreak

    Aynı jailbreak niyetinin farklı dillerdeki karşılıklarını içeren set; guard'ların dil bazlı kör noktalarını ölçmek için.

    datasettürkçeAltaySechuggingface.co
  • turkish-pii-corpus

    Türkçe kişisel veri örüntülerinin (TCKN, IBAN, VKN, plaka) etiketli derlemi; maskeleme aracı geliştirirken taban set olarak kullanılır.

    datasettürkçeAltaySechuggingface.co
  • ai-security-glossary

    Yapay zeka güvenliği terimlerinin Türkçe karşılıklarını sabitleyen sözlük; çeviri tutarlılığı için başvuru kaynağı.

    datasettürkçeAltaySechuggingface.co
  • turkish-pii-redactor

    TCKN/IBAN/VKN/plaka için checksum doğrulamalı tespit ve maskeleme; kutudan çıkan Presidio'nun bu alanları %0 yakaladığı ölçümüyle.

    araçtürkçeAltaySecgithub.com
  • XL-SafetyBench

    10 ülke-dil çifti için ülkeye özgü jailbreak ve kültürel hassasiyet senaryoları içeren güvenlik ölçütü; Türkiye/Türkçe on ülkeden biri ve Türkçe için 450 jailbreak + 100 kültürel senaryo ayrı ayrı hazırlanmış. Türkçe güvenlik testini 'İngilizceden çeviri' değil kültürel zeminde kuran ender veri setlerinden.

    datasethuggingface.co
  • RTP-LX

    RealToxicityPrompts'un 38 dile anadili konuşurlarınca yeniden yaratılıp (transcreation) elle etiketlenmiş hali; Türkçe kapsanan dillerden biri ve set yalnızca çeviri değil, İngilizceye çevrilmesi zor, o dilin coğrafyasına özgü saldırgan ifadeleri de içeriyor (yerel başına 1000+ istem). Dikkat: bu bir GitHub deposudur, Hugging Face veri seti değil; veriler tek bir 21 MB'lık RTP-LX.zip içinde paketli olduğu için tarayıcıdan gözle incelenemez ve lisansı CC-BY-NC-4.0 olduğundan ticari kullanıma kapalıdır.

    datasetbakımsızgithub.com
  • Overfit-GM/turkish-toxic-language

    Çeşitli Türkçe saldırgan dil veri setlerinin birleştirilmesiyle oluşmuş, 77.800 metni OTHER/PROFANITY/INSULT/RACIST/SEXIST olarak etiketleyen Apache-2.0 lisanslı set. Önemli uyarı: etiketlerin bir bölümü insan eliyle değil, birden fazla transformer modeliyle üretilmiş sözde-etiketlerdir (pseudo-label); bu nedenle sınıflandırıcı eğitmek için pratik bir başlangıç sağlar ama altın standart ölçüt olarak kullanılmamalıdır. 4 Nis 2023'ten beri güncellenmiyor.

    datasethuggingface.co
  • Toygar/turkish-offensive-language-detection

    OffensEval 2020 Türkçe verisi ve Türkçe nefret söylemi setlerini birleştirip bağlamsal veri madenciliğiyle sınıf dengesizliğini düzelten 53.005 satırlık ikili saldırgan dil seti (train/test/val ayrık). Hazır bölünmüş yapısı sayesinde Türkçe moderasyon modelini eğitip tekrarlanabilir biçimde raporlamaya uygun.

    datasethuggingface.co

Türkçe rehber serisi4 kaynak

  • LLM Security Türkiye

    Türkçe yapay zeka güvenliği ekosisteminin giriş noktası: rehber serisi, akademi, araştırmalar, araçlar ve veri setleri.

    hubtürkçeAltaySecgithub.com
  • LLM Security Nedir?

    Alanın Türkçe tanımı ve klasik siber güvenlikten farkları; seriye buradan başlanır.

    rehbertürkçeAltaySecgithub.com
  • LLM Security Roadmap

    Sıfırdan uzmanlığa 7 aşamalı Türkçe öğrenme yol haritası; bu liste "ne var" sorusunu, roadmap "hangi sırayla" sorusunu cevaplar.

    rehbertürkçeAltaySecgithub.com
  • OWASP LLM Top 10 Türkçe

    Standardın Türkçe kapsamlı işlenişi, saldırı senaryoları ve savunmalarla.

    rehbertürkçeAltaySecgithub.com

Türkiye'den model, araç ve ekosistem3 kaynak

  • Trendyol Cybersecurity LLM v2 (70B)

    Trendyol güvenlik ekibinin Llama-3.3-70B üzerine 83.920 system/user/assistant üçlüsüyle eğittiği savunma odaklı siber güvenlik modeli; eğitim kapsamı OWASP Top 10, MITRE ATT&CK, NIST CSF, CIS ve AI güvenliğini içeriyor ve veri seti jailbreak/prompt injection'a karşı düşmanca ret testlerinden geçirilmiş, saldırgan örnekler ayıklanmış. Model ve veri seti İngilizcedir (Türkçe değil); CS-Eval'de İngilizce pistinde 3.'lük ve 91.03 ortalama model kartında beyan edilen, bağımsız doğrulanmamış sonuçlardır. Veri seti Apache-2.0, ağırlıklar Llama 3.3 lisansına tabidir.

    araçhuggingface.co
  • turkish-nlp-resources

    Türkçe NLP için model, araç, kütüphane, veri seti ve değerlendirme kaynaklarını toplayan, aktif bakımlı küratörlü liste; bölümleri Üretken YZ/LLM'ler, Retrieval ve RAG, Değerlendirme ve Ölçütler, Encoder modelleri ve veri setleri (Kumru-2B, TURNA, Cosmos Turkish Llama, Trendyol ve Turkcell modelleri vb.). Güvenlik listesi değildir; değeri, Türkçe bir güvenlik sınıflandırıcısı ya da PII/toksisite modeli kurarken hangi Türkçe temel modelin mevcut olduğunu tek yerden görmenizi sağlamasıdır.

    rehbergithub.com
  • awesome-turkish-language-models

    Türkçe modelleri, veri setlerini, ölçüt veri setlerini, canlı liderlik tablolarını ve makaleleri seçerek derleyen küratörlü liste (TURNA, Kanarya, ytu-ce-cosmos, Kumru-2B, Trendyol ve Turkcell aileleri); depo açıkça 'her modeli değil, ayırt edici yanı olanları' aldığını belirtiyor. Güvenlik açısından işe yarayan tarafı, hangi yerli modeli test edeceğinize karar vermek ve TURKCELL/bert-offensive-lang-detection-tr gibi saldırgan dil tespiti modellerine ulaşmaktır.

    rehbergithub.com

Türkiye'den genel siber güvenlik kaynakları7 kaynak

  • Siber Güvenlik SSS

    Türkiye'nin en çok başvurulan Türkçe siber güvenlik soru-cevap arşivi; kariyer ve temel konularda referans, yapay zeka güvenliğini ayrı bir disiplin olarak kapsamıyor.

    rehbertürkçegithub.com
  • USOM — Ulusal Siber Olaylara Müdahale Merkezi

    Resmî zafiyet duyuruları ve zararlı bağlantı listeleri; Türkiye'ye özgü tehdit istihbaratının birincil kamu kaynağı.

    kurumtürkçeusom.gov.tr
  • KVKK — Kişisel Verileri Koruma Kurumu

    Kişisel veri işlemenin yasal çerçevesi; LLM uygulamalarında veri minimizasyonu ve maskeleme kararlarının dayanağı.

    kurumtürkçekvkk.gov.tr
  • Türkçe Yapay Zeka Kaynakları

    Türkçe yapay zeka kaynaklarının en bilinen derlemesi; güvenlik kapsamı yok ve 2021'den beri güncellenmiyor.

    listetürkçebakımsızgithub.com
  • KVKK — Üretken Yapay Zekâ ve Kişisel Verilerin Korunması Rehberi (15 Soruda)

    KVKK'nın üretken yapay zeka sistemlerini yaşam döngüsü, riskler ve 6698 sayılı Kanun çerçevesinde ele alan resmi rehberi; veri sorumlularına ve son kullanıcılara ayrı ayrı öneri veriyor, çocukların kullanımı için ebeveyn tedbirlerini de kapsıyor. Türkiye'de bir LLM ürününü hukuka uygun konumlandırmak için düzenleyicinin kendi diliyle yazdığı tek referans.

    standarttürkçekvkk.gov.tr
  • 7545 Sayılı Siber Güvenlik Kanunu

    Türkiye'nin siber güvenlik alanındaki ilk çerçeve kanunu; Siber Güvenlik Başkanlığı'nı ve Siber Güvenlik Kurulu'nu kuruyor, kritik altyapı yükümlülüklerini, güvenlik ürünü belgelendirmesini ve cezai/idari yaptırımları tanımlıyor. Yapay zekayı adıyla anmıyor ama Türkiye'de bir AI güvenlik ürünü satan veya kritik altyapıya dokunan herkesin yükümlülük zeminini bu metin belirliyor.

    standarttürkçeresmigazete.gov.tr
  • AI Safety Türkiye

    2023'te kurulmuş, Türkiye'nin ilk ve en aktif yapay zeka güvenliği topluluğu; Türkçe aylık bülten, sistem kartı ve politika analizleri içeren blog, İstanbul-Ankara-Bilkent-Koç hattında düzenlenen etkinlikler ve Türkiye'nin uluslararası AI yönetişim masalarındaki temsili. Türkçe AI güvenliği tartışmasının insan tarafına — kim, nerede, ne yapıyor — bağlanmak için tek adres.

    platformtürkçeaisafetyturkiye.org