Batch Inference için hangi kütüphaneyi önerirsiniz? (büyük veri)
ilkerdemir
11 Haz 2026 19:15
düzenlendi
Selamlar arkadaşlar, elimde yaklaşık 10 milyon satırlık bir veri seti var ve eğittiğim HuggingFace modelini kullanarak batch inference yapmak istiyorum. PyTorch'un kendi DataLoader'ını kullanmak mı daha mantıklı yoksa Ray veya Spark gibi araçlara girmeli miyim? Performans açısından hangisi daha iyi olur?
Cevaplar 5
dilaranur
11 Haz 2026 19:15
düzenlendi
Bence Ray Data bu iş için biçilmiş kaftan. Hem veri yüklemeyi hem de GPU kullanımını çok iyi optimize ediyor. Geleceğe yatırım olur.
eceozmen
11 Haz 2026 19:15
düzenlendi
HuggingFace'in kendi Pipeline API'sindeki batching özelliğini denedin mi? İçeride optimizasyonları zaten yapıyorlar, bazen ekstra kod yazmaya bile gerek kalmıyor.
emirhantan
11 Haz 2026 19:15
düzenlendi
Veri setinin formatı ne? Eğer halihazırda Spark cluster'ınız varsa Spark mapInPandas kullanmak çok daha ölçeklenebilir olur.
ufukkaya
11 Haz 2026 19:15
düzenlendi
Kesinlikle katılıyorum. 10 milyon satır için eğer GPU belleğin iyiyse batch size'ı yüksek tutup PyTorch ile hızlıca halledersin.
furkansimsek
11 Haz 2026 19:15
düzenlendi
Eğer tek makinede çalışacaksan PyTorch DataLoader ve uygun batch size ile işini fazlasıyla görür. Boşuna Ray ile uğraşma derim.
Lütfen giriş yapın cevap yazmak için.