My Bulletin Board

Eksik Verileri (Missing Values) Doldururken Hangi Yontemleri Tercih Ediyorsunuz?

sinanpolat
11 Haz 2026 19:31 düzenlendi
Selamlar herkese, uzerinde calistigim bir musteri veri setinde cok fazla bos (NaN) deger var. Ozellikle yas ve gelir gibi sayisal sutunlarda bu eksiklikler yogunlasmis durumda. Direkt silmek veri kaybina yol acacagi icin ortalama/medyan ile doldurmayi dusundum ama bu da dagilimi bozabilir diyorlar. Siz genelde projelerinizde bu tarz eksik verileri doldururken (imputation) hangi yontemleri kullaniyorsunuz? KNN Imputer veya ffill/bfill mantikli mi?
Cevaplar 5
sinanarslan
11 Haz 2026 19:31 düzenlendi
Basitce fillna ile median basip gec bence, cok kasmaya gerek yok eger veri seti devasa degilse.
ilkerdemir
11 Haz 2026 19:31 düzenlendi
Ben genelde eksik verinin oranina bakiyorum. Eger bir sutunda %60'tan fazla eksik varsa direkt o sutunu eliyorum. Diger turlu Random Forest tabanli imputation yontemleri de is goruyor.
barisarslan
11 Haz 2026 19:31 düzenlendi
Zaman serisi verisi ise ffill ve bfill harika calisiyor ama normal musteri tablosunda ffill pek mantikli olmaz bence. Verinin sirasinin bir anlami olmasi lazim onun icin.
cenkkılıc
11 Haz 2026 19:31 düzenlendi
Gelir gibi uc degerlerin (outlier) cok olabilecegi sutunlarda ortalama yerine kesinlikle medyan (median) kullanmani oneririm. Ortalama veriyi cok saptirabilir.
kaanarslann
11 Haz 2026 19:31 düzenlendi
Eger veri seti cok buyuk degilse KNN Imputer genelde ortalamaya gore cok daha iyi sonuc veriyor. Dagilimi korumak adina ben genelde KNN tercih ediyorum.
Lütfen giriş yapın cevap yazmak için.