RAG (Retrieval-Augmented Generation) Sistemlerinde Chunk Boyutu Seçimi Nasıl Olmalı?
emrehan
11 Haz 2026 19:28
düzenlendi
Selamlar herkese, kendi yerel belgelerim üzerinde bir RAG sistemi kurmaya çalışıyorum. LlamaIndex ve LangChain kütüphanelerini inceliyorum. Ancak dokümanları parçalara ayırırken (chunking) ideal chunk boyutu (chunk size) ve çakışma miktarını (overlap) nasıl belirleyeceğimi tam çözemedim. Çok büyük olunca gereksiz bilgi gidiyor, çok küçük olunca da bağlam kayboluyor. Siz projelerinizde hangi değerleri tercih ediyorsunuz? Deneyimlerinizi paylaşabilir misiniz?
Cevaplar 5
ecedemir
11 Haz 2026 19:28
düzenlendi
Bir de Parent Document Retriever yöntemini araştırmanı öneririm. Küçük parçalarla arama yapıp, LLM'e daha büyük olan ana paragrafı göndermek bağlam kaybını önlüyor.
selnurpala
11 Haz 2026 19:28
düzenlendi
Ben de benzer bir sorun yaşamıştım. Sadece chunk size değil, embedding modelinin sınırları da önemli. Modelin max token limitini aşmamaya dikkat et.
melikecakmak
11 Haz 2026 19:28
düzenlendi
Hocam LangChain'in RecursiveCharacterTextSplitter sınıfını kullanmanı öneririm. Paragrafları bölmeden düzgünce chunking yapıyor.
berkayarslan
11 Haz 2026 19:28
düzenlendi
Bence bu tamamen doküman tipine bağlı. Eğer teknik kılavuzlar veya hukuki metinler varsa cümle bazlı (sentence splitter) bölmek daha mantıklı olabiliyor.
sibelnur
11 Haz 2026 19:28
düzenlendi
Genelde başlangıç için 512 token chunk size ve 50 token overlap standart kabul ediliyor. Ben de projelerimde bu değerlerle başlayıp ihtiyaca göre optimize ediyorum.
Lütfen giriş yapın cevap yazmak için.