Turkce LLM'leri degerlendirmek icin hangi benchmark'lari kullaniyorsunuz?
ceylanergun
11 Haz 2026 19:23
düzenlendi
Selamlar herkese, kendi eğittiğimiz Türkçe dil modellerini objektif bir şekilde değerlendirmek istiyoruz. MMLU'nun Türkçe çevirilerini denedik ama çeviri kalitesinden dolayı sonuçlar çok sağlıklı gelmedi. Siz Türkçe modellerinizi test ederken hangi metrikleri veya hazır veri setlerini kullanıyorsunuz?
Cevaplar 5
tugbehan
11 Haz 2026 19:23
düzenlendi
Takipteyim, bize de Türkçe için kapsamlı ve standart bir değerlendirme kütüphanesi lazım.
ferhatarslan
11 Haz 2026 19:23
düzenlendi
LLM-as-a-judge yöntemiyle GPT-4'e puanlatmak şu an en pratik çözüm gibi duruyor.
melikecakmak
11 Haz 2026 19:23
düzenlendi
Hugging Face'teki Türkçe LLM liderlik tablolarına göz atabilirsiniz, orada kullanılan veri setleri işinize yarayabilir.
gulcerenpolat
11 Haz 2026 19:23
düzenlendi
Çeviri benchmarklar gerçekten çok yanıltıcı olabiliyor. Biz kendi içimizde manuel bir test seti hazırladık.
emredemir
11 Haz 2026 19:23
düzenlendi
Biz genelde MT-Bench'in Türkçe sürümünü kullanıyoruz, fena sonuç vermiyor.
Lütfen giriş yapın cevap yazmak için.