RAG Sistemlerini Değerlendirirken Hangi Metrikleri Kullanıyorsunuz?
ufukkaya
11 Haz 2026 19:28
düzenlendi
Selamlar herkese, geliştirdiğimiz RAG uygulaması için bir değerlendirme pipeline'ı kurmak istiyoruz. Ragas veya TruLens kullanan var mı? Hangi metrikler (faithfulness, answer relevance vs.) gerçek senaryolarda daha doğru sonuç veriyor?
Cevaplar 5
barisalkan
11 Haz 2026 19:28
düzenlendi
Ragas gayet başarılı ama Türkçe dökümanlarda bazen embedding ve LLM kalitesine göre metrikler sapıtabiliyor, test setini iyi hazırlamak lazım.
ferhandemır
11 Haz 2026 19:28
düzenlendi
Geliştirme aşamasında GPT-4'ü hakem olarak (LLM-as-a-judge) kullanmak hızlı prototip çıkarmak için çok pratik oluyor ama maliyetli tabi.
ismetpolat
11 Haz 2026 19:28
düzenlendi
Otomatik metrikler bir yere kadar hocam. En sonunda yine insan değerlendirmesi (human-in-the-loop) gerekiyor, altın standart hala o.
pinararslan
11 Haz 2026 19:28
düzenlendi
TruLens'in triad yapısı (context relevance, groundedness, answer relevance) oldukça mantıklı bir çerçeve sunuyor. Biz onu tercih ettik.
alikilic
11 Haz 2026 19:28
düzenlendi
Biz projemizde Ragas kullanıyoruz. Özellikle 'faithfulness' metriği halüsinasyonları yakalamak için çok işimize yarıyor, tavsiye ederim.
Lütfen giriş yapın cevap yazmak için.