Multimodal RAG Sistemlerinde Gorsel Isleme Icin Hangi Modeli Onerirsiniz?
cenknur
11 Haz 2026 19:24
düzenlendi
Selamlar herkese, uzerinde calistigim bir projede hem metin hem de gorsel iceren PDF dokumanlari uzerinde bir RAG sistemi kurmaya calisiyorum. Metin tarafinda sorun yok ama gorselleri (grafikler, tablolar vb.) vektor veri tabanina aktarirken ve sorgularken en iyi sonucu hangi multimodal modellerle alabilirim? CLIP, GPT-4o ya da LLaVA kullanan var mi? Deneyimlerinizi paylasabilirseniz cok sevinirim.
Cevaplar 5
tugcearsl
11 Haz 2026 19:24
düzenlendi
Qwen2-VL modelini de listene ekleyebilirsin, ozellikle Turkce karakter iceren gorsellerde ve tablolarda fena is cikarmiyor.
berkhantan
11 Haz 2026 19:24
düzenlendi
Tablo verileri varsa gorsele donusturmek yerine once markdown formatina cevirip oyle RAG'e beslemek daha tutarli sonuclar veriyor bence.
rozabas
11 Haz 2026 19:24
düzenlendi
ColPali diye yeni bir model cikti, multimodal RAG icin dogrudan dokuman sayfalarini gorsel olarak indeksliyor. Bir incelemeni oneririm, performansi gayet iyi.
alikilic
11 Haz 2026 19:24
düzenlendi
Grafik ve tablolar icin CLIP biraz yetersiz kalabiliyor, dogrudan gorsel uzerindeki metinleri okumak gerekiyorsa kesinlikle multimodal LLM'lere yonelmelisin.
sevimsahin
11 Haz 2026 19:24
düzenlendi
Biz benzer bir projede LLaVA kullandik, acik kaynak kodlu olmasi buyuk avantaj ama butce varsa GPT-4o gorsel anlamlandirmada cok daha basarili.
Lütfen giriş yapın cevap yazmak için.