Yazılım güvenliği analizi araçlarıyla tanınan Semgrep ekibi, büyük dil modellerinin (LLM) kodlardaki güvenlik açıklarını tespit etme yeteneklerini ölçmek amacıyla gerçekleştirdiği en son kıyaslama testlerinin (benchmark) şaşırtıcı sonuçlarını paylaştı. Testlerde, Zhipu AI (Z.ai) tarafından geliştirilen ve açık ağırlıklı (open-weight) bir model olan GLM 5.2, herhangi bir ek sarmalayıcı yapı (harness) olmadan doğrudan bir sistem komutuyla (prompt) çalıştırıldığında, Anthropic'in popüler yazılım geliştirme ajanı Claude Code'u geride bırakarak büyük bir sürprize imza attı.
Deney kapsamında modeller, siber güvenlik dünyasında en sık karşılaşılan yetkilendirme hatalarından biri olan IDOR (Insecure Direct Object Reference - Güvensiz Doğrudan Nesne Referansı) zafiyetlerini bulma yeteneklerine göre test edildi. Karşılaştırma sonuçları, açık ağırlıklı modellerin ticari ve kapalı kaynaklı devlerle rekabet edebilecek seviyeye ulaştığını, hatta maliyet açısından çok daha avantajlı olduğunu gösteriyor.
IDOR Zafiyeti Nedir ve Tespit Etmesi Neden Zordur?
Kısaca hatırlatmak gerekirse, IDOR (Güvensiz Doğrudan Nesne Referansı), bir uygulamanın veri tabanındaki nesnelere (örneğin kullanıcı profilleri, faturalar veya dokümanlar) erişmek için kullanıcıdan aldığı doğrudan referansları (kullanıcı kimliği, dosya adı vb.) kullanırken gerekli yetki kontrollerini yapmaması durumudur. Örnek bir Flask rotası üzerinden inceleyelim:
@app.route('/user/') def get_user(user_id): user = User.query.get_or_404(user_id) return jsonify(user.to_dict())Yukarıdaki kod bloğunda, URL'den gelen user_id parametresiyle doğrudan veri tabanından kullanıcı bilgisi çekilmekte ve geri döndürülmektedir. Ancak, isteği atan kullanıcının bu veriyi görmeye yetkili olup olmadığı kontrol edilmemiştir. IDOR zafiyetleri, tehlikeli bir fonksiyonun çağrılması gibi belirgin izler bırakmadığı, sadece eksik bir yetki kontrolünden ibaret olduğu için geleneksel statik analiz araçları (SAST) ve yapay zeka modelleri tarafından tespit edilmesi en zor hata sınıflarından biridir.
Kıyaslama Sonuçları ve F1 Skorları
Semgrep, test edilen modellerin doğruluğunu ölçmek için hem hassasiyeti (precision) hem de duyarlılığı (recall) dengeleyen F1 Skoru (F1 Score) metriğini kullandı. İşte elde edilen başarı sıralaması:
| Sıra | Model / Yapılandırma | Sarmalayıcı Yapı (Harness) | F1 Skoru (%) |
|---|---|---|---|
| 1 | Semgrep Multimodal (GPT 5.5) | Semgrep Özel Harness | 61% |
| 2 | Semgrep Multimodal (Opus 4.8) | Semgrep Özel Harness | 53% |
| 3 | GLM 5.2 | Pydantic AI (Sadece Prompt) | 39% |
| 4 | Claude Code (Opus 4.6) | Claude Code SDK | 37% |
| 5 | Claude Code (Opus 4.8/4.7) | Claude Code SDK | 28% |
| 6 | MiniMax M3 | Pydantic AI (Sadece Prompt) | 23% |
| 7 | Kimi K2.7 Code | Pydantic AI (Sadece Prompt) | 22% |
| 8 | GPT-5.5 | Codex | 20% |
| 9 | Nemotron Super 3 120B | Pydantic AI (Sadece Prompt) | 18% |
| 10 | DeepSeek V4 | Pydantic AI (Sadece Prompt) | 17% |
Model Başarı Oranları (F1) Karşılaştırması
GLM 5.2 Modelinin Öne Çıkan Özellikleri
Zhipu AI'ın Haziran 2026'da duyurduğu GLM 5.2, güvenlik araştırmaları için son derece önemli üç ayırt edici niteliğe sahip:
- Açık Ağırlıklı (Open-Weight) Olması: Modelin parametreleri MIT lisansı altında yayınlandığı için güvenlik ekipleri bu modeli kendi yerel sunucularında, hiçbir dış sunucuya kod göndermeden çalıştırabilir. Bu durum, veri gizliliği konusunda katı kuralları olan organizasyonlar için kritik bir avantajdır.
- Uzun Bağlam Penceresi ve Yapısal Kodlama Yeteneği: GLM 5.2, 750 milyar toplam parametreye sahip bir MoE (Mixture-of-Experts - Uzmanların Karışımı) modelidir ve her jetonda (token) yalnızca 40 milyar parametre aktif olarak çalışır. 200K'dan 1M jetona kadar genişletilen bağlam penceresi (context window), karmaşık ve çok dosyalı kod tabanlarında zafiyet analizi yapılmasını kolaylaştırır.
- Mükemmel Fiyat/Performans Oranı (Tokenomics): Kıyaslama sonuçlarına göre GLM 5.2, sınır sınıftaki rakiplerinin yaklaşık altıda biri maliyetle çalışmaktadır. Semgrep testlerinde elde edilen zafiyet başına maliyet sadece 0.17 dolar olarak hesaplanmıştır.
Çıkarılan Önemli Dersler
- Sarmalayıcı Yapı (Harness) Hâlâ En Önemli Faktör: Testteki en büyük başarı farkı modellerin kendisinden ziyade yapılandırmadan kaynaklanmaktadır. Semgrep'in uygulama uç noktalarını (endpoints) haritalandıran ve modeli doğrudan buralara yönlendiren özel sarmalayıcısı (harness), F1 skorunu en üst seviyeye taşımaktadır (%61).
- Modellere Bağımlı Kalmamak Gerekir: Sadece tek bir LLM sağlayıcısına bağlı kalmak, açık kaynaklı veya alternatif modellerin sunduğu maliyet ve performans avantajlarından yararlanmayı engeller. GLM 5.2 gibi sürpriz çıkışlar, esnek altyapıların önemini kanıtlamaktadır.
- Açık Ağırlıklı Modeller Eşiği Aştı: Bir yıl öncesine kadar yerel modeller güvenlik testlerinde sadece "sembolik" bir yer tutarken, bugün GLM 5.2 gibi modellerin ek yapılandırma olmaksızın sınır ajanları geride bırakabilmesi, siber güvenlikte yeni bir dönemin habercisidir.
Kaynak: Hacker News (Öne Çıkanlar)
Bu habere henüz yorum yapılmadı.