Türkiye'nin en büyük inovasyon ve girişimcilik bültenine katılın
Kanallar İlham Uygulamalar SSS Sözlük Giriş Üye Ol

Yapay Zeka (ai)

/yapayzeka · 8.YIL

Bu toplulukta yapay zekâ ile ilgili yeni araçlar, kullanım senaryoları, proje fikirleri, etik tartışmalar, iş dünyasındaki uygulamalar, eğitimde AI kullanımı ve Türkiye’de yapay zekânın gelişimine katkı sunabilecek çalışmalar paylaşılabilir.

94 içerik Katıl
#yapay zeka (ai) akışına dön
@fakazli · 4 gün önce lmarena.ai ↗

Modelleri kör karşılaştırmayla sıralayan arena: İnsan tercihine dayalı en yaygın liste

Model kıyaslamasının en zor tarafı, iyi cevabın çoğu zaman ölçülebilir olmaması. Bu platform farklı bir yol izliyor: kullanıcı bir soru soruyor, iki model cevap veriyor, hangi modelin cevap verdiği gizli tutuluyor ve kullanıcı hangisini beğendiğini seçiyor. Sonuçlar satranç sıralamasına benzer bir puanlama sistemiyle tabloya dönüşüyor.

Yöntemin güçlü tarafı, gerçek kullanıcıların gerçek sorularla değerlendirme yapması. Sabit test setlerinin aksine, eğitim verisine sızmış soru sorunu yok.

Zayıf tarafı ise tercihin her zaman doğruluğu ölçmemesi. İnsanlar daha uzun, daha kendine güvenen ve daha düzenli biçimlendirilmiş cevapları beğenme eğiliminde. Yani üst sıralar kısmen üslup yarışı da olabiliyor.

Platformda kategori bazlı alt sıralamalar da var: kodlama, matematik, uzun bağlam, çok dilli kullanım. Kendi kullanım alanınıza uyan kategoriye bakmak genel sıralamaya bakmaktan daha anlamlı.

Türkçe kullananlar için not: genel sıralamada üstte olan bir model Türkçede aynı performansı göstermeyebiliyor. Çok dilli kategoriye bakmak ve mümkünse kendi metinlerinizle test etmek gerekiyor.
0 2 yorum
Yorumlar (2)
@nikea · 3 gün önce 5
Üslup yarışı uyarısına katılıyorum, bu gerçekten ölçülebilir bir etki.

Aynı bilgiyi veren iki cevaptan başlıklara ayrılmış, maddelenmiş ve daha uzun olanı genelde tercih ediliyor. Oysa bazı sorular için kısa ve net cevap daha iyidir.

Bu yüzden arena sıralamasını tek karar kriteri yapmamak gerekiyor. Benim yaklaşımım şu: arenadan ilk beşi alıp kendi işime ait yirmi otuz gerçek örnekle test etmek. Sonuç çoğu zaman arena sıralamasından farklı çıkıyor.

Türkçe konusundaki not özellikle önemli. Bazı modeller Türkçeyi gramer olarak doğru kullanıyor ama deyim ve bağlam tarafında zayıf kalıyor. Bunu ancak deneyerek görüyorsunuz.
@sametay · 2 gün önce 6
Kendi değerlendirme setinizi kurma konusuna pratik bir yöntem ekleyeyim.

Geçmişte insanların yaptığı işlerden yirmi örnek seçin ve doğru cevabı zaten biliyorsunuz. Bunları modele verip cevapları karşılaştırın. Bu set bir kez hazırlandığında her yeni model çıktığında yarım saatte test edebiliyorsunuz.

Önemli olan setin gerçek işinizi temsil etmesi. Zor ama nadir görülen örneklerle dolu bir set, gerçek performansı yanlış gösteriyor.

Bir de tekrarlanabilirlik. Aynı soruyu birkaç kez sorup cevapların ne kadar tutarlı olduğuna bakmak gerekiyor. Bir seferde iyi cevap veren ama her seferinde farklı sonuç üreten model, üretim ortamı için uygun değil.