Betimsel
Eksik Veri Analizi
Veri kümesindeki her sütun için kaç değerin eksik olduğunu, bunun yüzdesini ve hangi sütunların hiç boşluk taşımadığını listeler.
Yöntem özeti
Eksik veri analizi, yanıt dosyanızdaki boşlukların nerede biriktiğini sayar. Çıktı üç parçadan oluşur: veri kümesindeki toplam satır sayısı, her sütunda eksik kalan değer sayısı ve bu sayının satır sayısına oranı; ayrıca en az bir boşluk taşıyan sütunların listesi verilir, böylece eksiksiz sütunları gözden geçirmeye gerek kalmaz. Bu yöntem eksikliği bir problem olarak tanımlar, çözmez: hiçbir değer atanmaz, hiçbir satır silinmez ve veri kümesi değiştirilmez. Sayımın değeri, sonraki analizlerde karşılaşacağınız gözlem kaybını önceden bilmenizdir. Bir ölçek maddesinde yüzde yirmiye varan boşluk, o maddeyi içeren toplam puanın hangi katılımcılar için hiç hesaplanamayacağını belirler; çoklu değişken kullanan bir modelde ise her biri ayrı ayrı ılımlı görünen eksiklikler birleşince örneklemin önemli bir bölümünü analiz dışına çıkarabilir.
Hangi araştırma sorularında kullanılır?
- Anketin hangi sorularında katılımcılar yanıt vermekten kaçınmış?
- Toplam puanı hesaplamayı planladığım maddelerde ne kadar boşluk var?
- Hangi sütunlar eksiksiz, yani analizde gözlem kaybı yaratmayacak?
- Bir sonraki analizin gözlem sayısı neden dosyanın satır sayısından düşük çıkıyor?
Ne zaman kullanılmalıdır?
- Veri dosyası panele açıldıktan sonra, herhangi bir sınama yürütmeden önce eksikliğin haritasını çıkarmak için.
- Ölçek toplam puanı gibi türetilmiş bir sütun oluşturmadan önce; maddelerdeki boşluklar türetilmiş sütuna doğrudan taşınır.
- Çok değişkenli bir model kurmadan önce, modele girecek sütunların boşluklarının toplamda ne kadar gözlem kaybına yol açacağını kestirmek amacıyla.
- Atlanabilir soruların bulunduğu ya da uzun anketlerde; yanıt bırakma eğiliminin anketin hangi bölümünde arttığını görmek için.
- Yöntem ve bulgular bölümünde eksik yanıt oranlarını bildirmeniz gerektiğinde.
Gerekli değişken türleri
- Yöntem her türde sütunu sayar: sayısal, metin ve kategori sütunları aynı biçimde ele alınır, çünkü sayım değerlerin içeriğine değil varlığına bakar.
- Bağımlı ya da bağımsız değişken ayrımı bulunmaz; yöntem bir ilişki ya da fark sınamadığı için değişken rolü atanmaz.
- Kayıp değer kodlarının Değişken sekmesinde bildirilmiş olması sayımın doğruluğunu belirler; bildirilmemiş bir kod geçerli bir değer olarak sayılır ve eksik görünmez.
- Yöntem sütun seçimi almaz, veri kümesinin bütünü üzerinden çalışır; bu yüzden teknik sütunlar da dökümde yer alır.
Temel varsayımlar
- Boşlukların gerçekten boş hücre olması
- Sayım, hücrenin boş olmasına dayanır. Yanıt vermemeyi belirtmek için 99, -1 ya da tire gibi bir işaret kullanılmışsa bu hücreler dolu sayılır ve dökümde hiç görünmez.
- Eksiklik nedeninin araştırmacı tarafından değerlendirilmesi
- Sayılar boşluğun nereden geldiğini söylemez. Atlanabilir bir soru, anketten çıkış, hassas bir konuda yanıt vermeme ve teknik bir kayıt hatası dökümde aynı görünür, oysa analiz açısından sonuçları çok farklıdır.
- Sütunların bağımsız okunmaması
- Döküm sütun sütun verildiği için iki sütunun aynı katılımcılarda mı boş kaldığı görünmez. Her biri yüzde on boşluk taşıyan iki sütun, aynı kişilerde eksikse birlikte yine yüzde on, farklı kişilerde eksikse yüzde yirmi gözlem kaybı yaratır.
- Toplam satır sayısının doğru okunmuş olması
- Yüzdeler toplam satır sayısına bölünerek üretildiği için dosyanın beklenenden az ya da fazla satırla açılması bütün oranları kaydırır. Sonunda boş satırlar bulunan bir dosya, her sütunda yapay bir eksiklik üretir.
YouReply bu varsayımları nasıl kontrol eder?
- Boşlukların gerçekten boş hücre olması: Kayıp değer kodları Değişken sekmesinde tanımlanır ve tanımlandıktan sonra sayıma girer. Yöntemin kendisi bir değerin kayıp kodu olabileceğini sezmez ve bu konuda uyarı üretmez.
- Eksiklik nedeninin araştırmacı tarafından değerlendirilmesi: Panel eksikliğin mekanizmasını sınamaz. Verinin tümüyle rastgele eksik olup olmadığına dair hiçbir test yürütülmez; bu değerlendirme anket akışını bilen araştırmacıya kalır.
- Sütunların bağımsız okunmaması: Birlikte eksiklik matrisi çıkarılmaz ve satır düzeyinde bir eksiklik sayımı döndürülmez. İki sütunun kesişimini görmek için veriyi Veri sekmesinde incelemek ya da dışarıda hesaplamak gerekir.
- Toplam satır sayısının doğru okunmuş olması: Toplam satır sayısı sonucun başında yazar ve Veri sekmesindeki ızgarayla karşılaştırılabilir; bu karşılaştırmayı yöntem sizin yerinize yapmaz.
Analiz nasıl yürütülür?
- 1Yanıt dosyanızı yükleme alanına bırakın; dosya Veri sekmesindeki ızgaraya açıldığında satır sayısını not edin.
- 2Değişken sekmesinde kayıp değer kodlarını tanımlayın; bu adım atlanırsa kod olarak girilen yanıtsızlıklar dökümde eksik sayılmaz.
- 3Analiz sekmesinde betimsel kategoriden eksik veri analizini seçin; arama kutusu ya da 'Yalnız verime uyanlar' anahtarı seçiciyi daraltır.
- 4Bu yöntemde doldurulacak parametre bulunmaz; döküm veri kümesinin tamamı üzerinden alınır, doğrudan çalıştırın.
- 5Sonuçta toplam satır sayısını, sütun başına eksik sayılarını ve yüzdeleri okuyun; boşluk taşıyan sütunların listesi dikkatinizi nereye vermeniz gerektiğini söyler.
- 6Dökümü Excel olarak indirin; bu yöntem için grafik çizilmez, hesaplama künyesi kartı kullanılan kütüphane çağrısını yazar.
- 7Gerekiyorsa Değişken sekmesine dönüp türetilmiş sütunları ya da kayıp kodlarını düzeltin ve dökümü yeniden alın.
Üretilen istatistikler ve tablolar
- Toplam satır sayısı
- Yüzdelerin dayandığı bölen. Bu sayıyı Veri sekmesindeki ızgarayla karşılaştırmak, dosyanın eksiksiz açıldığını doğrulamanın ilk adımıdır.
- Sütun başına eksik sayısı
- Her sütunda boş kalan hücrelerin adedi. Ham sayı, yüzdeyle birlikte okunmalıdır, çünkü küçük bir yüzde büyük bir dosyada yine de yüzlerce kayıp yanıt anlamına gelebilir.
- Sütun başına eksik yüzdesi
- Eksik sayısının toplam satır sayısına oranı. Sütunları birbiriyle karşılaştırmanın ve raporda bildirilecek oranı almanın yolu budur.
- Boşluk taşıyan sütunların listesi
- En az bir eksiği bulunan sütunların adları. Listede olmayan bir sütun eksiksizdir ve ileride gözlem kaybına yol açmaz.
Etki büyüklüğü ve güven aralığı
- Eksiklik oranı
- Bu yöntemin ürettiği tek büyüklük ölçüsü, sütun başına eksiklik yüzdesidir ve bir etki büyüklüğü değildir. Alan yazında yüzde beşin altındaki oranlar genellikle ılımlı sayılır, yüzde onun üzerine çıkan bir sütunun eksikliğinin nedeni tartışılmayı gerektirir, yüzde kırkı aşan bir sütun ise çoğu zaman analizden çıkarılır. Bu eşikler sabit kurallar değildir; sütunun modeldeki ağırlığına göre değişir. Hiçbir sınama yürütülmediği için bu oranlar için anlamlılık değeri üretilmez.
- Beklenen gözlem kaybı
- Birlikte kullanılacak sütunların eksikliklerini birleştirdiğinizde sonraki analizde kaybedeceğiniz gözlem sayısını kestirebilirsiniz; bu sayı en iyi durumda en yüksek tek sütun oranına, en kötü durumda oranların toplamına yaklaşır. Panel bu kesişimi hesaplamaz, döküm sütun başına verildiği için kestirimi kendiniz yapmanız gerekir.
Bu yöntem güven aralığı döndürmez. Eksiklik oranları için oran güven aralığı hesaplanmaz, hiçbir hipotez sınanmaz ve p değeri üretilmez; dönen bütün sayılar eldeki dosyanın tam sayımıdır. Eksikliğin bir gruplama değişkenine göre farklılaşıp farklılaşmadığını sınamak isterseniz eksikliği ikili bir sütun olarak kodlayıp kategorik bir sınama yöntemine geçmeniz gerekir.
Örnek araştırma sorusu ve örnek sonuç
Aşağıdaki sayılar temsili bir örnektir; gerçek bir araştırmanın ya da gerçek bir kullanıcının verisi değildir.
- Araştırma sorusu
- Temsili bir çalışan anketinde boşluklar hangi sorularda birikmiş ve bu, ölçek toplam puanını nasıl etkiler?
- Değişkenler
- Dosyada 520 satır ve 14 sütun · Altı maddelik bağlılık ölçeğinin maddeleri · Aylık gelir aralığı sorusu · Doğum yılı sorusu
- Örnek sonuç
- Toplam 520 satır sayıldı. Boşluk taşıyan beş sütun listelendi: aylık gelir aralığında 94 eksik (yüzde 18,1), doğum yılında 31 eksik (yüzde 6,0), bağlılık ölçeğinin dördüncü maddesinde 22 eksik (yüzde 4,2), beşinci maddesinde 19 eksik (yüzde 3,7) ve altıncı maddesinde 17 eksik (yüzde 3,3). Ölçeğin ilk üç maddesi ile geri kalan sütunlar eksiksiz.
- Yorum
- Eksikliğin açık ara en yoğun olduğu sütun gelir sorusu; yüzde 18,1 oranı bu sütunu doğrudan bir modele koymayı sorunlu kılıyor ve gelirin kategorik bir aralık sorusu olduğu düşünülürse yanıt vermeme eğiliminin hassasiyetle ilişkili olması beklenir. Ölçek maddelerindeki boşlukların son üç maddede toplanması, katılımcıların bir bölümünün anketi sonuna doğru hızla geçtiğini düşündürüyor. Bu üç maddenin yüzdeleri tek tek küçük olsa da aynı katılımcılarda mı biriktiklerini bu döküm söylemez: boşluklar tamamen farklı kişilerde ise altı maddelik toplam puan 58 katılımcı için hesaplanamaz, aynı kişilerde ise kayıp 22 ile sınırlı kalır. Dökümün örüntü hakkında konuşmaması, bu iki senaryo arasındaki ayrımı kendinizin yapması gerektiği anlamına gelir. Sayılar temsilidir.
Örnek veri setiyle gerçek çıktı
Aşağıdaki sonuçları analiz motoru bu veri dosyasını çözümleyerek üretti. Değişkeni değiştirdiğinizde araştırma sorusu da değişiyor; sonuçların tamamı önceden hesaplandı, sayfa motora istek göndermiyor.
Genel müşteri anketi (sentetik)
Üç yüz yanıtlayıcılı geniş bir anket: iki ve üç kategorili gruplayıcılar, sürekli ölçümler, beşli sıralı ölçek, iki kategorili satın alma sonucu, dört kategorili marka tercihi, üç tekrarlı ölçüm, eşleştirilmiş ikili sorular, üç kodlayıcı, dört fiyat sorusu ve kasıtlı olarak boş bırakılmış hücreler.
- Satır sayısı
- 300
- Sütunlar
- katilimci_no, cinsiyet, egitim_duzeyi, bolge, yas, gelir, memnuniyet, hizmet_puani, fiyat_puani, kalite_puani, baglilik, tavsiye_skoru, satin_aldi, marka_tercihi, memnuniyet_duzeyi, on_puan, son_puan, olcum_1, olcum_2, olcum_3, kullanim_once, kullanim_sonra, kullanim_izleme, kodlayici_1, kodlayici_2, kodlayici_3, fiyat_cok_ucuz, fiyat_ucuz, fiyat_pahali, fiyat_cok_pahali, geri_bildirim_puani, izleme_puani
Veri sentetiktir: gerçek bir araştırmadan değil, sabit bir tohumla üretildi. Aşağıdaki değerleri analiz motoru bu dosyayı çözümleyerek üretti; aynı dosyayı panele yükleyince aynı sonuçları görürsünüz.
Araştırma sorusu: Hangi sorular boş bırakılmış ve kayıp oranı ne kadar? Bu dosyada iki sütun kasıtlı olarak eksik bırakıldı.
- Toplam satır sayısı
- 300
Sütun başına boş hücre sayısı
- katilimci_no
- 0
- cinsiyet
- 0
- egitim_duzeyi
- 0
- bolge
- 0
- yas
- 0
- gelir
- 0
- memnuniyet
- 0
- hizmet_puani
- 0
- fiyat_puani
- 0
- kalite_puani
- 0
- baglilik
- 0
- tavsiye_skoru
- 0
- satin_aldi
- 0
- marka_tercihi
- 0
- memnuniyet_duzeyi
- 0
- on_puan
- 0
- son_puan
- 0
- olcum_1
- 0
- olcum_2
- 0
- olcum_3
- 0
- kullanim_once
- 0
- kullanim_sonra
- 0
- kullanim_izleme
- 0
- kodlayici_1
- 0
- kodlayici_2
- 0
- kodlayici_3
- 0
- fiyat_cok_ucuz
- 0
- fiyat_ucuz
- 0
- fiyat_pahali
- 0
- fiyat_cok_pahali
- 0
- geri_bildirim_puani
- 45
- izleme_puani
- 80
Sütun başına boş hücre yüzdesi
- katilimci_no
- 0
- cinsiyet
- 0
- egitim_duzeyi
- 0
- bolge
- 0
- yas
- 0
- gelir
- 0
- memnuniyet
- 0
- hizmet_puani
- 0
- fiyat_puani
- 0
- kalite_puani
- 0
- baglilik
- 0
- tavsiye_skoru
- 0
- satin_aldi
- 0
- marka_tercihi
- 0
- memnuniyet_duzeyi
- 0
- on_puan
- 0
- son_puan
- 0
- olcum_1
- 0
- olcum_2
- 0
- olcum_3
- 0
- kullanim_once
- 0
- kullanim_sonra
- 0
- kullanim_izleme
- 0
- kodlayici_1
- 0
- kodlayici_2
- 0
- kodlayici_3
- 0
- fiyat_cok_ucuz
- 0
- fiyat_ucuz
- 0
- fiyat_pahali
- 0
- fiyat_cok_pahali
- 0
- geri_bildirim_puani
- 15
- izleme_puani
- 26,67
Hesaplama künyesi: scipy 1.18.0 · statsmodels 0.14.6 · scikit-learn 1.9.0 · numpy 2.5.1 · pandas 3.0.5 · semopy 2.3.11 · 89fc29a · Veri tohumu: 20260914
Sonuç nasıl raporlanır?
Eksik yanıt oranı aylık gelir sorusunda yüzde 18,1, doğum yılında yüzde 6,0 ve bağlılık ölçeğinin son üç maddesinde yüzde 3,3 ile 4,2 arasında bulundu (N = 520).
APA düzenine yakın örnek cümle; sayılar temsilidir.
Ne zaman kullanılmamalıdır?
- Boşlukların neden oluştuğunu göstermez; soruyu atlamak, anketi yarıda bırakmak ve teknik bir kayıt hatası dökümde aynı biçimde görünür.
- Eksikliğin tümüyle rastgele olup olmadığına dair bir sınama yürütülmez, dolayısıyla atama yöntemi seçiminin dayanacağı kanıt bu çıktıdan elde edilemez.
- Sütunların birlikte eksik olup olmadığı görünmez; birlikte eksiklik matrisi çıkarılmadığı için çok değişkenli bir analizdeki gerçek gözlem kaybı dökümden okunamaz.
- Satır düzeyinde bir özet verilmez, yani kaç katılımcının en az bir sorusu boş kaldığı ya da kimin neredeyse hiç yanıt vermediği bu tabloda yer almaz.
- Bildirilmemiş kayıp değer kodları eksik sayılmaz; dökümün eksiksiz görünmesi verinin eksiksiz olduğunu garanti etmez.
- Yöntem hiçbir boşluğu doldurmaz ve hiçbir satırı çıkarmaz; atama ya da satır silme kararı ve uygulaması panelin dışında kalır.
Varsayımlar karşılanmazsa kullanılabilecek yöntemler
- Betimsel İstatistiklerNeden: Sütun başına gözlem sayısını merkez ve yayılım ölçüleriyle birlikte görmek, eksikliğin özet istatistikleri nasıl etkilediğini göstermek istediğinizde.
- Frekans DağılımıNeden: Bir kategori sütununda yanıtsızlığın ayrı bir kategori olarak kodlanmış olabileceğinden kuşkulanıyorsanız; bütün kategorileri sayıyla listeler.
Sık sorulan sorular
- Panel eksik değerleri dolduruyor mu?
- Doldurmuyor. Bu yöntem yalnız sayar; ortalamayla ya da herhangi bir modelle atama yapılmaz ve veri kümesi değiştirilmez. Eksikliği doldurmaya karar verdiyseniz bunu yüklemeden önce kendi dosyanızda yapmanız, yaptığınız atamanın yöntemini de raporda belirtmeniz gerekir. Atama yapmadan çalıştırdığınız analizler, o analizde kullanılan sütunlarda değeri bulunan satırlarla yürür.
- Kayıp değer kodu kullandım, neden dökümde görünmüyor?
- Sayım boş hücreleri esas alır. 99 ya da -1 gibi bir kodu yalnız Değişken sekmesinde kayıp olarak bildirdiğinizde bu hücreler eksik sayılır; aksi hâlde geçerli birer sayı olarak kalırlar ve hem bu dökümde hem de betimsel istatistiklerde ortalamayı bozacak biçimde hesaba girerler. Kodları bildirdikten sonra dökümü yeniden çalıştırın.
- Hangi eksiklik oranından sonra sütunu analizden çıkarmalıyım?
- Tek bir eşik yoktur ve karar oranla birlikte sütunun araştırmadaki rolüne bağlıdır. Birkaç yüzde düzeyindeki boşluk çoğu tasarımda sorun yaratmaz. Oran onda birin üzerine çıktığında eksikliğin nedenini raporda tartışmanız beklenir. Çok yüksek oranlı bir sütunu modelden çıkarmak yaygın bir yoldur, ancak bazı durumlarda yanıt vermemenin kendisi bilgi taşır ve sütunu yanıt verdi ya da vermedi biçiminde ikili kodlamak daha bilgilendirici olur.
- İki sütunun aynı kişilerde mi boş kaldığını nasıl öğrenirim?
- Bu döküm sütun başına sayar ve böyle bir kesişim bilgisi vermez; birlikte eksiklik matrisi çıkarılmaz. Kaba bir yol olarak Veri sekmesindeki ızgarada ilgili sütunları yan yana getirip boşlukların hizalanıp hizalanmadığına bakabilirsiniz. Kesin bir sayı gerekiyorsa her sütun için eksikliği ikili bir sütun olarak kodlayıp ikisi arasında çapraz tablo kurmak, ya da hesabı panel dışında yapmak gerekir.
Kaynaklar
- Little, R. J. A., & Rubin, D. B. (2019). Statistical Analysis with Missing Data
- Rubin, D. B. (1976). Inference and Missing Data
- Rubin, D. B. (1987). Multiple Imputation for Nonresponse in Surveys
- pandas.DataFrame.isnull belgeleri
Kendi verinizle deneyin
Ücretsiz planda ayda 50 analiz koşusu vardır; kart istenmez.