My Bulletin Board

Pandas ile Eksik Verileri Doldururken Hangi Yöntemi Seçmeliyim?

denizarslan
11 Haz 2026 19:30 düzenlendi
Arkadaşlar selam, elimde yaklaşık 50 bin satırlık bir müşteri veri seti var. Bazı sütunlarda (örneğin yaş ve gelir) eksik veriler (NaN) bulunuyor. Bu eksik değerleri silmek yerine doldurmak istiyorum ama ortalama (mean) ile mi yoksa medyan (median) ile mi doldurmak daha mantıklı olur? Veride bazı uç değerler (outliers) de var gibi duruyor. Deneyimlerinizi paylaşabilir misiniz?
Cevaplar 5
gonulkaya
11 Haz 2026 19:30 düzenlendi
Ben genelde benzer satırların ortalamasına göre gruplayıp dolduruyorum (groupby kullanarak). Daha tutarlı sonuçlar veriyor.
orhannur
11 Haz 2026 19:30 düzenlendi
Gelir sütunu için medyan çok daha güvenli bir liman. Yaş için de benzer şekilde medyanı öneririm.
alperengun
11 Haz 2026 19:30 düzenlendi
Veri setindeki eksiklik oranı ne kadar? %5'ten azsa sil gitsin bence, uğraştığına değmez.
sonercakmak
11 Haz 2026 19:30 düzenlendi
Bence KNN Imputer veya IterativeImputer gibi daha gelişmiş yöntemleri de dene, sadece sabit değerle doldurmak bazen veri yapısını bozuyor.
berkhantan
11 Haz 2026 19:30 düzenlendi
Uç değerler varsa kesinlikle medyan kullanmalısın, ortalama sapıtabilir.
Lütfen giriş yapın cevap yazmak için.