Yapay Zeka Güvenliği Kaynakları

Bölüm 04 · 34 kaynak

Değerlendirme, Ölçüt ve Standartlar

"Bu sistem güvenli mi?" sorusunu ölçülebilir hâle getiren çerçeveler, ölçütler ve resmî standartlar.

Standartlar ve çerçeveler13 kaynak

  • OWASP Top 10 for LLM Applications

    LLM uygulamalarındaki en kritik on risk; alanın ortak sözlüğü hâline geldiği için rapor ve teklif yazarken çıpa olarak kullanılır.

    standartgenai.owasp.org
  • OWASP LLM Top 10 — Türkçe kapsamlı rehber

    Aynı listenin Türkçe işlenmiş hâli: her risk için saldırı senaryosu ve savunma stratejisiyle.

    rehbertürkçeAltaySecgithub.com
  • MITRE ATLAS

    Yapay zeka sistemlerine yönelik gerçek dünya saldırı taktik ve tekniklerinin ATT&CK tarzı matrisi; tehdit modellemesini somut tekniklere bağlar.

    standartatlas.mitre.org
  • NIST AI Risk Management Framework

    Risk yönetimini yönetişim/haritalama/ölçme/yönetme döngüsüne oturtan çerçeve; kurumsal uyum tarafının referansı.

    standartnist.gov
  • OWASP AI Security Verification Standard (AISVS)

    AI sistemleri için maddeleştirilmiş doğrulama gereksinimleri; ASVS'in yapay zeka karşılığı, denetim listesi olarak kullanılabilir.

    standartgithub.com
  • OWASP Agentic AI — tehditler ve azaltımlar

    Otonom ajanlara özgü tehdit taksonomisi; klasik LLM Top 10'un kapsamadığı çok adımlı saldırıları ele alır.

    standartgenai.owasp.org
  • EU AI Act teknik uyum kontrol listesi

    Mevzuatı mühendislik görevlerine çeviren kontrol listesi: red-teaming, loglama, adversarial test yükümlülükleri (EN+TR).

    rehbertürkçeAltaySecgithub.com
  • EU AI Act Explorer (artificialintelligenceact.eu)

    AB Yapay Zekâ Tüzüğü'nün tam metnini madde madde gezilebilir hâle getiren, üstüne 10 dakikalık bir "Uyum Kontrolcüsü" ve uygulama takvimi koyan bağımsız portal; Future of Life Institute tarafından yürütülüyor. Tüzüğün hangi maddesinin sizin sisteminizi bağladığını Resmî Gazete metnini baştan sona okumadan çıkarmanın en hızlı yolu.

    platformartificialintelligenceact.eu
  • General-Purpose AI Code of Practice (AB Komisyonu)

    AB Komisyonu'nun genel amaçlı YZ sağlayıcıları için yayımladığı gönüllü uygulama kuralları; Güvenlik ve Emniyet bölümü sistemik riskli modellerde risk değerlendirme, model raporu ve on yıllık belgelendirme yükümlülüklerini somutlaştırıyor. Frontier model güvenliğinin "iyi uygulama" tanımının fiilen yazıldığı belge.

    standartdigital-strategy.ec.europa.eu
  • NIST IR 8596 — Cyber AI Profile (ön taslak)

    NIST'in Cybersecurity Framework 2.0'ı YZ'ye uyarlayan profili; "YZ sistemini güvene al", "YZ ile savun", "YZ destekli saldırıyı engelle" üç odağını mevcut CSF çıktılarının üzerine bindiriyor. Kurumsal siber güvenlik programınıza YZ'yi ayrı bir çerçeve icat etmeden bağlamak için doğru köprü.

    standartcsrc.nist.gov
  • CSA AI Controls Matrix (AICM) v1.1

    Bulut tabanlı YZ sistemleri için 18 güvenlik alanında 247 kontrol hedefi ve model sağlayıcı/uygulama sağlayıcı/müşteri gibi beş role ayrılmış denetim rehberi. ISO 42001, ISO 27001, AB YZ Tüzüğü ve NIST AI RMF eşlemeleri sayesinde tek bir kontrol setinden birden çok uyum çerçevesine cevap üretebiliyorsunuz.

    standartcloudsecurityalliance.org
  • OWASP AI Testing Guide (AITG)

    YZ sistemlerini uygulama, model, altyapı ve veri olmak üzere dört katmanda test etmek için AITG-APP-01 (prompt injection) gibi numaralandırılmış, tekrarlanabilir test prosedürleri sunan OWASP rehberi. Top 10 "neyin riskli olduğunu" söylerken bu rehber "nasıl test edilir"i veriyor — sızma testi metodolojisi yazanlar için doğrudan iskelet.

    rehberowasp.org
  • KVKK — Üretken Yapay Zekâ ve Kişisel Verilerin Korunması Rehberi (15 Soruda)

    Kişisel Verileri Koruma Kurumu'nun üretken yapay zekâyı 6698 sayılı Kanun çerçevesinde 15 soru-cevapla ele alan resmî rehberi (24 Kasım 2025); üretken YZ'nin içerik üretim süreci ve yaşam döngüsü, kişisel veri işleme riskleri ile bireysel ve ebeveyn düzeyinde alınacak önlemleri kapsıyor. Türkiye'de LLM devreye alan ekipler için düzenleyicinin konuya bakışını gösteren ilk resmî referans — bağlayıcı bir mevzuat değil, uyum ve farkındalık belgesi.

    rehbertürkçekvkk.gov.tr

Değerlendirme çerçeveleri11 kaynak

  • Inspect

    UK AI Security Institute'un değerlendirme çerçevesi; ajan davranışı ve güvenlik değerlendirmelerini tekrarlanabilir biçimde koşmak için tasarlandı.

    araçgithub.com
  • lm-evaluation-harness

    Dil modeli değerlendirmesinin fiili standardı; güvenlik ölçütlerini de aynı altyapıya bağlamak için taban olarak kullanılır.

    araçgithub.com
  • HELM

    Modelleri tek skorla değil çok boyutlu (doğruluk, sağlamlık, önyargı, toksisite) değerlendiren bütünsel çerçeve.

    ölçütcrfm.stanford.edu
  • CyberSecEval

    Modellerin güvensiz kod üretme eğilimini ve siber saldırıya yardım etme davranışını ölçen kıyaslama paketi.

    ölçütgithub.com
  • AgentDojo

    Ajanların prompt injection altında görevini sürdürüp sürdüremediğini ölçen dinamik ortam; savunma ile fayda arasındaki dengeyi aynı anda raporlar.

    ölçütgithub.com
  • Inspect Evals

    UK AI Security Institute'un Inspect üzerinde çalışan hazır değerlendirme koleksiyonu; siber, ajan zararlılığı, bilgi ve güvenlik ölçütlerini tek komutla çalıştırılabilir hâle getiriyor. Kendi harness'ınızı yazmak yerine literatürdeki ölçütü referans uygulamasıyla koşturmanın en kısa yolu.

    araçgithub.com
  • ControlArena

    AI control (kontrol) deneyleri için ortamlar, "model organizmaları" ve protokoller barındıran UK AISI kütüphanesi; kasıtlı olarak sabotaj yapan bir modele karşı izleme/denetim protokolünüzün gerçekten tuttuğunu ölçmenizi sağlıyor. Güvenilmeyen ajanı üretimde koşturma sorusuna deneysel yanıt üreten nadir çerçevelerden.

    araçgithub.com
  • MLCommons AILuminate

    12 tehlike kategorisinde 59.000'den fazla test istemiyle modelleri derecelendiren, jailbreak ve metin+görsel varyantları da olan endüstri standardı güvenlik ölçütü; sonuçlar kamuya açık liderlik tablosunda yayımlanıyor. Kendi guardrail'inizi mutlak bir ölçeğe göre konumlandırmak istediğinizde referans alınacak karne.

    ölçütmlcommons.org
  • Cybench

    Dört gerçek CTF yarışmasından seçilmiş 40 profesyonel seviye görevle (kripto, web, tersine mühendislik, adli bilişim, exploit) dil modellerinin saldırı yeteneğini ölçen ölçüt; görevler insanların ilk çözüm süresine göre zorluk sırasına konmuş. "Model gerçekten ne kadar iyi hacker?" sorusunun anket değil, çalıştırılabilir cevabı.

    ölçütcybench.github.io
  • AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents

    11 zarar kategorisinde 110 kötü niyetli ajan görevi (artırmalarla 440) içeren ölçüt; çarpıcı bulgusu, önde gelen modellerin jailbreak'e gerek kalmadan bile zararlı ajan isteklerine beklenmedik ölçüde uyum göstermesi ve basit şablonların çok adımlı kötü niyetli yürütmeyi bozmadan geçmesi. Ajan güvenliğini "tek istem" değil "görev zinciri" düzeyinde ölçen ilk ciddi işlerden.

    makalearxiv.org
  • Agent Security Bench (ASB)

    10 senaryoda doğrudan/gözlem prompt injection, hafıza zehirleme ve PoT arka kapı saldırılarını delimiter, sandwich, paraphrasing, PPL gibi savunmalara karşı çapraz koşturan saldırı-savunma matrisi. Tek bir savunmanın hangi saldırı sınıfında çöktüğünü tablo hâlinde görmek isteyenler için ideal.

    ölçütgithub.com

Ölçüm metodolojisi6 kaynak

  • guardrail-arena

    Guardrail'i tek eksenli ("kaç saldırı yakaladı") değil iki eksenli değerlendiren yaklaşım; herhangi bir guard'ı çağrılabilir bir fonksiyon olarak takar.

    ölçütAltaySecgithub.com
  • Evaluating the Robustness of LLM Guardrails

    Guardrail'lerin sistematik zayıflıklarını inceleyen çalışma; kendi değerlendirme setinizi kurarken hangi tuzaklara düşmemeniz gerektiğini gösterir.

    makalearxiv.org
  • Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations

    Değerlendirmeleri "deney" olarak ele alıp örnekleme hatası, model karşılaştırma testleri ve deney büyüklüğü planlaması için hazır formüller veren 14 sayfalık makale. Güvenlik ölçütlerinde %62 ile %58 arasındaki farkın anlamlı olup olmadığını söyleyemiyorsanız okunması zorunlu.

    makalearxiv.org
  • Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents

    2023-2026 arası 40 ajan güvenlik ölçütünü altı eksende sınıflandırıp aralarındaki sıralama tutarlılığını istatistiksel olarak test eden meta-analiz; sonuç, ölçüt seçiminin birbiriyle çelişen güvenlik sonuçları üretebildiği (W = 0.10, p = 0.94, sıralama uyumu yok). Hangi ölçüte güveneceğine karar vermeden önce okunacak eleştirel ara katman.

    makalearxiv.org
  • METR — Task-Completion Time Horizons

    Modellerin yeteneğini soyut skor yerine "insan uzmanın kaç saatlik işini %50/%80 başarıyla bitirebiliyor" olarak ölçen metodoloji ve canlı veri sayfası; görevler RE-Bench, HCAST ve yazılım/siber görevlerinden geliyor. Yetenek artışının güvenlik tehdit modelinize ne zaman çarpacağını tahmin etmek için en somut ölçek.

    araştırmametr.org
  • Model Cards for Model Reporting

    Bir modelin amaçlanan kullanımını, sınırlarını ve alt gruplara göre performansını standart bir belge hâlinde yayımlama önerisini ortaya atan kurucu makale; bugün Hugging Face model kartlarından AB Tüzüğü'nün model dokümantasyon formuna kadar her şeyin atası. Şeffaflık yükümlülüğünü "neyi yazacağız" düzeyinde çözmek isteyenlerin çıkış noktası.

    makalearxiv.org

Şeffaflık, karne ve olay kayıtları4 kaynak

  • Foundation Model Transparency Index (Aralık 2025)

    13 model geliştiricisini 100 şeffaflık göstergesi üzerinden puanlayan Stanford CRFM endeksinin Aralık 2025 sürümü; en çarpıcı bulgusu ortalamanın bir önceki yılın 58'inden 41'e düşmesi, yani şeffaflığın gerilemesi (en yüksek IBM 95, en düşük xAI ve Midjourney 14). Bir sağlayıcının eğitim verisi ve dağıtım sonrası izleme konusunda ne kadar cevap verdiğini kanıtla tartışmak için kullanılır.

    araştırmacrfm.stanford.edu
  • FLI AI Safety Index — Summer 2026

    Dokuz frontier laboratuvarı 6 alan ve 37 gösterge üzerinden bağımsız uzman paneliyle notlandıran karne; 2026 sürümünde en yüksek not C+ (Anthropic 2.66), Mistral/DeepSeek/xAI F aldı. Sağlayıcı seçerken pazarlama vaadi yerine belgelenmiş güvenlik pratiğine bakmak isteyen kurumlar için doğrudan kullanılabilir kanıt.

    araştırmafutureoflife.org
  • AI Incident Database (AIID)

    Gerçek dünyada YZ sistemlerinin yol açtığı zararları havacılıktaki olay kayıtları mantığıyla numaralandırıp arşivleyen, topluluk katkısına açık veritabanı. Tehdit modelinizi varsayımla değil olmuş vakayla beslemek ve "bu risk teorik mi" itirazına cevap vermek için birincil kaynak.

    datasetincidentdatabase.ai
  • UK AISI — Frontier AI Trends Report

    UK AI Security Institute'un Kasım 2023 - Ekim 2025 arasında 30'dan fazla frontier sistem üzerinde yaptığı devlet eliyle değerlendirmelerin toplu bulgu raporu; siber, kimya-biyoloji, otonomi, koruma önlemlerinin dayanıklılığı ve kontrol kaybı sinyallerini kapsıyor, bazı alanlarda yeteneğin sekiz ayda ikiye katlandığını raporluyor. Kapalı kapı ardında yapılan ön-dağıtım testlerinin kamuya açılan nadir toplu özetlerinden.

    araştırmaaisi.gov.uk