Multimodal RAG (Görsel + Metin) için hangi kütüphaneleri kullanıyorsunuz?
sinemarslan
11 Haz 2026 19:26
düzenlendi
Selamlar herkese, şirket içinde bir proje için hem görselleri hem de metin dokümanlarını işleyebilecek bir RAG (Multimodal RAG) sistemi kurmamız gerekiyor. LlamaIndex ve LangChain arasında kaldık. Görsel gömme (image embedding) ve vektör tabanlı arama için şu an en stabil çalışan kütüphane/yol hangisidir? Tecrübelerinizi paylaşabilir misiniz?
Cevaplar 5
selimarslan
11 Haz 2026 19:26
düzenlendi
Takipteyim, bizim de yakın zamanda böyle bir ihtiyacımız olacak. Deneyimlerinizi paylaşırsanız sevinirim.
sevimsahin
11 Haz 2026 19:26
düzenlendi
Görseller çok detaylıysa CLIP yerine GPT-4o API'si ile görselleri önce metne çevirip sonra standart RAG yapmak daha mantıklı olabilir, bir düşünün derim.
emrehan
11 Haz 2026 19:26
düzenlendi
Vektör veri tabanı olarak ne kullanacaksınız? Qdrant bu konuda multimodal embedding'ler için oldukça iyi bir performans sunuyor.
pinararslan
11 Haz 2026 19:26
düzenlendi
LangChain'in multimodal desteği son güncellemelerle bayağı gelişti ama dökümantasyon bazen kafa karıştırıcı olabiliyor.
rahelanur
11 Haz 2026 19:26
düzenlendi
Biz benzer bir projede LlamaIndex ve CLIP modelini kullandık, oldukça başarılı sonuçlar verdi tavsiye ederim.
Lütfen giriş yapın cevap yazmak için.