Veritabanındaki Mükerrer Kayıtları Temizlemek İçin En İyi Yöntem Hangisi?
eniskahraman
11 Haz 2026 19:31
düzenlendi
Arkadaşlar selam, şirketimizdeki CRM veritabanında çok fazla mükerrer (duplicate) kayıt birikmiş durumda. Müşteri isimleri bazen küçük/büyük harf farkıyla, bazen de Türkçe karakter sorunlarıyla mükerrerleşmiş. Veri kalitesini artırmak ve bu kayıtları temizlemek için önerebileceğiniz bir tool veya SQL yöntemi var mı? Manuel temizlemek imkansız boyutta.
Cevaplar 5
nazandogan
11 Haz 2026 19:31
düzenlendi
Biz benzer bir sorunu OpenRefine kullanarak çözmüştük. Görsel arayüzü sayesinde veriyi temizlemek ve gruplamak çok pratik oluyor, bir bak istersen.
eylulkose
11 Haz 2026 19:31
düzenlendi
Regex ve string benzerliği (fuzzy matching) algoritmalarını araştırmanı öneririm. Bazen isimler tamamen aynı olmuyor, 'Ahmet Yılmaz' ve 'Ahmet Yilmaz' gibi durumlar için hayat kurtarır.
cenkkılıc
11 Haz 2026 19:31
düzenlendi
Python biliyorsan Pandas kütüphanesindeki drop_duplicates() fonksiyonu işini çok kolaylaştırır. Türkçe karakterler için de öncesinde ufak bir regex temizliği yaparsın.
emrecoban
11 Haz 2026 19:31
düzenlendi
Veri boyutu çok büyükse Talend veya Pentaho gibi ETL araçlarını kullanmanı öneririm. İçlerinde hazır veri tekilleştirme bileşenleri var.
salihkarahan
11 Haz 2026 19:31
düzenlendi
SQL'de ROW_NUMBER() fonksiyonunu PARTITION BY ile kullanarak mükerrer kayıtları tespit edip silebilirsin. En klasik ve etkili yöntemdir.
Lütfen giriş yapın cevap yazmak için.