Modelleri kör karşılaştırmayla sıralayan arena: İnsan tercihine dayalı en yaygın liste
Yöntemin güçlü tarafı, gerçek kullanıcıların gerçek sorularla değerlendirme yapması. Sabit test setlerinin aksine, eğitim verisine sızmış soru sorunu yok.
Zayıf tarafı ise tercihin her zaman doğruluğu ölçmemesi. İnsanlar daha uzun, daha kendine güvenen ve daha düzenli biçimlendirilmiş cevapları beğenme eğiliminde. Yani üst sıralar kısmen üslup yarışı da olabiliyor.
Platformda kategori bazlı alt sıralamalar da var: kodlama, matematik, uzun bağlam, çok dilli kullanım. Kendi kullanım alanınıza uyan kategoriye bakmak genel sıralamaya bakmaktan daha anlamlı.
Türkçe kullananlar için not: genel sıralamada üstte olan bir model Türkçede aynı performansı göstermeyebiliyor. Çok dilli kategoriye bakmak ve mümkünse kendi metinlerinizle test etmek gerekiyor.

@fakazli