Yapay Zeka

AI Kodlama Ajanlarının Yeni Savaşı: CursorBench 3.1 Sonuçları Yayınlandı!

Cursor, yapay zeka kodlama ajanlarının gerçek hayattaki karmaşık görevlerdeki performansını ölçen CursorBench 3.1 test sonuçlarını açıkladı. Fable 5, Opus 4.8 ve Composer 2.5 modellerinin performansları ve maliyetleri karşılaştırıldı.

Paylaş X'te paylaş

Yapay zeka destekli popüler kod editörü Cursor, AI kodlama ajanlarının gerçek dünya senaryolarındaki yeteneklerini test eden yeni benchmark çalışması CursorBench 3.1 sonuçlarını resmi olarak duyurdu. Gerçek Cursor oturumlarından alınan çok dosyalı karmaşık görevler, hata bulma, planlama ve kod inceleme testlerinde modellerin hem başarı oranları hem de görev başına maliyetleri kıyaslandı.

CursorBench 3.1 Sonuçları
CursorBench 3.1 AI model performans ve maliyet karşılaştırma grafiği.
Görsel Kaynağı: Cursor

Değerlendirme sonuçlarına göre, Fable 5 Max modeli en yüksek başarı skorunu elde ederken, özellikle Composer 2.5 modeli sunduğu inanılmaz fiyat/performans oranıyla geliştiricilerin dikkatini çekmeyi başardı.

CursorBench 3.1 Lider Tablosu

Benchmark testinde öne çıkan modellerin başarı yüzdeleri ve görev başına harcadıkları ortalama maliyetler şu şekilde listelendi:

Sıra Yapay Zeka Modeli Başarı Skoru (%) Görev Başına Ortalama Maliyet ($) Harcanan Adım (Step) Sayısı
1 Fable 5 Max 72.9 % $ 18.02 76
2 Fable 5 Extra High 72.0 % $ 13.74 63
5 Opus 4.7 Max 64.8 % $ 11.02 96
6 GPT-5.5 Extra High 64.3 % $ 4.37 46
9 Composer 2.5 (F/P Şampiyonu) 63.2 % $ 0.55 37
13 Sonnet 5 Max 61.2 % $ 6.87 93
24 Kimi K2.7 Code 52.7 % $ 1.92 70
27 Gemini 3.5 Flash 49.8 % $ 1.94 79

CursorBench 3.1 ile Neler Değişti?

CursorBench 3.1 sürümüyle birlikte test senaryolarında şu iyileştirmelere gidildi:

  • Kod Tabanı Anlama: Modellerin büyük kod projelerindeki bağımlılıkları kavrama ve analiz etme yetenekleri zorlaştırıldı.
  • Planlama ve Hata Arama: Çoklu dosyalarda gizlenen mantıksal hataları bulma ve çözüm planı hazırlama süreçleri eklendi.
  • Değerlendirme Kriterleri: Kod düzenleme (edit) görevleri için kullanılan puanlama algoritmaları daha adil ve hassas hale getirildi.

Sonuçlar, yapay zeka ajanlarının kod yazım kalitesinin hızla arttığını gösterirken; geliştiriciler için en doğru modeli seçerken bütçe (maliyet/performans) dengesinin de ne denli kritik olduğunu gözler önüne seriyor.

Kaynak: Hacker News (Öne Çıkanlar)

Mr.Nobody
Yazar

Mr.Nobody

Tüm yazılar Tüm yazılar
Haber Sayısı 275 haber
Görüntülenme Sayısı 9.322 görüntülenme
Okur katılımı

Yorumlar

Yorum İkonu Yorum Yazın

Bu habere henüz yorum yapılmadı.

Görünüm Okuma ayarları
Yazı boyutu