Llama 3 Modelini FastAPI ile Deploy Ederken Gecikme Sorunu
rahelemre
11 Haz 2026 19:22
düzenlendi
Selamlar, Llama 3 8B modelini FastAPI kullanarak bir API haline getirdim. Ancak lokalde test ederken bile istek başına yanıt süresi 4-5 saniyeyi buluyor. GPU olarak RTX 4090 kullanıyorum. Gecikmeyi azaltmak için ne gibi optimizasyonlar yapabilirim? Önerilerinizi bekliyorum.
Cevaplar 5
candemir
11 Haz 2026 19:22
düzenlendi
Benzer bir projede TensorRT-LLM kullandık ve gecikme yarı yarıya düştü. Tavsiye ederim.
volkandemır
11 Haz 2026 19:22
düzenlendi
FastAPI tarafında asenkron yapıyı doğru kurduğundan emin ol. Blocking işlemler request kuyruğunu şişiriyor olabilir.
dilaranur
11 Haz 2026 19:22
düzenlendi
Modeli FP16 yerine INT8 veya INT4 olarak quantize etmeyi dene. Ciddi bir hız artışı sağlayacaktır.
cenkarslan
11 Haz 2026 19:22
düzenlendi
Batching özelliğini aktif edebilirsin. vLLM bu konuda çok başarılı, doğrudan entegre edebilirsin.
cenkdogan
11 Haz 2026 19:22
düzenlendi
vLLM veya Hugging Face TGI kullanmayı denedin mi? FastAPI tek başına büyük modeller için optimize edilmemiştir.
Lütfen giriş yapın cevap yazmak için.