LLM modellerinde ROUGE ve BLEU skorları ne kadar güvenilir?
isildogan
11 Haz 2026 19:22
düzenlendi
Selamlar herkese, Türkçe dil modelleri eğitiyoruz ancak değerlendirme kısmında ROUGE ve BLEU skorları bazen çok yanıltıcı olabiliyor. Modelin ürettiği metin çok anlamlı olsa bile referans metne tam uymadığı için skor düşük çıkıyor. Siz model değerlendirmede hangi alternatif metrikleri kullanıyorsunuz? İnsan değerlendirmesi dışında pratik bir önerisi olan var mı?
Cevaplar 5
sevimsahin
11 Haz 2026 19:22
düzenlendi
Takipteyim, benzer bir sorunla biz de karşılaştık. Özellikle özetleme görevlerinde BLEU tamamen çöp oluyor.
furkanalkan
11 Haz 2026 19:22
düzenlendi
Klasik n-gram tabanlı metrikler artık geride kaldı diyebiliriz. Rouge yerine Sentence Transformers ile embedding benzerliğine bakmak daha mantıklı bence.
serhanbolat
11 Haz 2026 19:22
düzenlendi
Türkçe için semantik benzerlik ölçmek gerçekten zor. Biz de BERTScore ve LLM-as-a-judge yöntemlerini hibrit kullanıyoruz.
eylulpolat
11 Haz 2026 19:22
düzenlendi
G-Eval metodunu araştırabilirsiniz. Güçlü bir modeli (GPT-4 gibi) diğer modelleri değerlendirmek için hakem olarak kullanıyorsunuz. Oldukça popüler şu an.
kemalpolat
11 Haz 2026 19:22
düzenlendi
Kesinlikle katılıyorum, BLEU artık LLM'ler için çok yetersiz kalıyor. Biz BERTScore kullanmaya başladık, anlamsal benzerliği çok daha iyi ölçüyor.
Lütfen giriş yapın cevap yazmak için.