My Bulletin Board

Büyük PDF'leri Parçalarken Hangi Yöntemi Kullanıyorsunuz?

candan
11 Haz 2026 19:18 düzenlendi
Arkadaşlar selam, elimde yaklaşık 1000 sayfalık teknik dokümanlar var. Bunları RAG sisteminde kullanmak için parçalamam (chunking) gerekiyor. Karakter sınırına göre mi bölmeliyim yoksa anlamlı paragraflara göre mi? Hangi kütüphaneleri önerirsiniz? LangChain'in RecursiveCharacterTextSplitter'ını denedim ama bazen tabloları ve anlam bütünlüğünü bozuyor.
Cevaplar 5
kemalpolat
11 Haz 2026 19:18 düzenlendi
Regex ile özel işaretleyiciler koyup bölmek de bir alternatif ama çok uğraştırır. Semantic chunking şu an en mantıklısı.
berrinkara2
11 Haz 2026 19:18 düzenlendi
Tablolar varsa işin içine PDF'i önce Markdown'a çevirip sonra başlık bazlı (Header-based) parçalamak en temiz çözüm bence.
aslialtun
11 Haz 2026 19:18 düzenlendi
Biz projede her paragrafı kendi içinde böldükten sonra 200 karakterlik bir overlap (üst üste binme) payı bıraktık. Bağlamı korumak için overlap çok önemli.
mertdemir
11 Haz 2026 19:18 düzenlendi
LangChain yerine LlamaIndex'in MarkdownElementNodeParser veya SentenceSplitter araçlarına göz atabilirsin, tablolar için daha başarılı.
simgekose
11 Haz 2026 19:18 düzenlendi
Kesinlikle semantik (semantic chunking) yapmanı öneririm. Sadece karakter sayısına göre bölünce cümleler ortadan bölünüyor, RAG başarısı çok düşüyor.
Lütfen giriş yapın cevap yazmak için.