My Bulletin Board

Llama 3 API'sini yerelde calistirirken gecikme (latency) sorunu

mirayilmaz
11 Haz 2026 19:24 düzenlendi
Arkadaslar merhaba, yerel sunucumda Llama 3 8B modelini Ollama ve FastAPI kullanarak API haline getirdim. Ancak istek attigimda yanit suresi 4-5 saniyeyi buluyor. GPU olarak RTX 4090 kullaniyorum. Bu gecikmeyi azaltmak icin ne gibi optimizasyonlar yapabilirim? Onerilerinizi bekliyorum.
Cevaplar 5
alikilic
11 Haz 2026 19:24 düzenlendi
Sicaklik degerlerini kontrol ettin mi? GPU thermal throttling yapiyor olabilir yuk altindayken.
nalanpala
11 Haz 2026 19:24 düzenlendi
RTX 4090 ile o sureler cok fazla. Kesinlikle kutuphane veya parametre kaynakli bir darbogaz var. vLLM +1.
buyukarslan
11 Haz 2026 19:24 düzenlendi
FastAPI tarafinda asenkron yapiyi dogru kurdugundan emin ol. Bazen eszamanli isteklerde tikanma olabiliyor.
mertdemir
11 Haz 2026 19:24 düzenlendi
Sistemde quantization (nicemleme) kullaniyor musun? FP16 yerine INT4 veya INT8 modelleri ciddi hizlandirir.
rumeysakara
11 Haz 2026 19:24 düzenlendi
Ollama yerine vLLM kullanmayi denedin mi? vLLM throughput ve latency konusunda cok daha basarili.
Lütfen giriş yapın cevap yazmak için.