Kategorik
Ki-Kare Uyum İyiliği Testi
Tek bir kategorik değişkende kategori sıklıklarının, kuramdan ya da bir evren dağılımından gelen beklenen sıklıklarla ne ölçüde örtüştüğünü sınar.
Yöntem özeti
Uyum iyiliği sürümündeki ki-kare testi yalnız bir sütunla çalışır: o sütundaki her kategoride kaç kişi bulunduğunu sayar ve bu sayımları araştırmacının ileri sürdüğü beklenen dağılımla karşılaştırır. Beklenen dağılım dışarıdan bir kaynaktan gelebilir, örneğin resmi bir nüfus bileşimi ya da önceki dalgada ölçülmüş bir oran kümesi; verilmediğinde tüm kategorilerin eşit paya sahip olduğu varsayılır. İstatistik, her kategoride gözlenen ile beklenen arasındaki farkın karesini o kategorinin beklenen değerine bölerek toplar, bu yüzden küçük beklenen sıklıklı kategoriler toplama beklenenden daha ağır katkı verir. Sıfır hipotezi sıklık örüntüsünün belirtilen dağılımla uyumlu olduğudur; reddedilmesi yalnız bir uyumsuzluk bildirir, hangi kategorinin fazla ya da eksik temsil edildiğini söylemez. Bu ayrımı gözlenen ve beklenen sıklık tablolarını karşılaştırarak kurmanız gerekir. YouReply Nicel Analiz beklenen değerleri yazım biçiminden bağımsız olarak gözlenen toplama ölçekler, böylece yüzde yazmakla kişi sayısı yazmak aynı sonucu verir.
Hangi araştırma sorularında kullanılır?
- Örneklemimizin yaş grubu bileşimi, adres temelli nüfus kayıtlarındaki bileşimle uyuşuyor mu?
- Anket davetine yanıt verenler dört bölgeye beklenen paylarla mı dağıldı?
- Ürün paketi seçiminde dört seçenek eşit sıklıkta mı tercih ediliyor, yoksa belirli bir paket öne çıkıyor mu?
- Şikayet kayıtlarının haftanın günlerine dağılımı düzgün mü, belirli günlerde yığılma var mı?
Ne zaman kullanılmalıdır?
- Tek bir kategorik değişkenin dağılımı ilgilendiğinizde ve karşılaştırma ikinci bir değişkenle değil, dışarıdan gelen bir beklentiyle yapılacaksa.
- Örneklemin evrene benzerliğini kategorik bir kota değişkeni üzerinden denetlemek, temsiliyet tartışmasını sayısal bir dayanakla yürütmek istediğinizde.
- Bir seçim setindeki seçeneklerin eşit ilgi görüp görmediğini sınamak gerektiğinde; bu durumda beklenen dağılım alanını boş bırakmak yeterlidir.
- Kategoriler arasında sıralama olsa bile yalnız sıklık örüntüsü sorgulanıyorsa, eğilim sınaması aranmıyorsa.
- Her katılımcı tek bir kategoriye düşüyorsa; çoklu işaretlemeye izin veren sorularda sıklıklar toplamı katılımcı sayısını aşar ve test dayanağını yitirir.
Gerekli değişken türleri
- Tek bir kategorik sütun: metin etiketler ya da kategori kodu olarak saklanmış tam sayılar.
- En az iki kategori bulunmalıdır; tek kategoriye inen bir sütunda serbestlik derecesi sıfır olur ve motor analizi reddeder.
- Beklenen dağılım seçimli bir metin alanıdır: virgül ya da noktalı virgülle ayrılmış oranlar veya sayımlar yazılır ve madde sayısı gözlenen kategori sayısına eşit olmalıdır.
- Her satır bir katılımcıyı temsil etmelidir; önceden toplanmış sıklık tablolarında gözler kişi olarak okunmaz.
- Sürekli bir ölçümü bu teste sokmak için önce aralıklara bölmek gerekir, bu da Değişken sekmesindeki türetilmiş sütun özelliğiyle yapılır.
Temel varsayımlar
- Gözlemlerin bağımsızlığı
- Sayımların her biri ayrı bir katılımcıdan gelmelidir ve hiçbir katılımcı iki kategoriye birlikte katkı vermemelidir. Aynı kişinin birden çok yanıtının toplandığı tasarımlarda sıklıklar şişer ve istatistik olduğundan büyük çıkar.
- Kategorilerin tüketici ve ayrık olması
- Kategori kümesi tüm katılımcıları kapsamalı ve kategoriler birbirinin üzerine binmemelidir. Yazım farklılıkları yüzünden ikiye ayrılmış bir kategori, beklenen dağılımın madde sayısını da bozar.
- En az iki kategori
- Karşılaştırmanın anlamlı olabilmesi için gözlenen kategori sayısı ikiden az olmamalıdır.
- Beklenen dağılımın kategori sayısıyla uyumu
- Beklenen dağılımı elle yazarsanız listedeki değer sayısı, temizlenmiş veride gerçekten görünen kategori sayısına eşit olmalıdır. Veride hiç gözlenmemiş bir kategori için beklenen değer yazmak sayıları kaydırır.
- Beklenen sıklıkların yeterliliği
- Ki-kare dağılımına yapılan yaklaşım, beklenen sıklıkların aşırı küçük olmadığı durumlarda geçerlidir. Yaygın ölçüt her kategoride beklenen değerin en az 5 olmasıdır.
YouReply bu varsayımları nasıl kontrol eder?
- Gözlemlerin bağımsızlığı: Panel bu varsayımı otomatik denetlemez; değerlendirme araştırmacıya aittir.
- Kategorilerin tüketici ve ayrık olması: Panel kategori listesini temizlenmiş veriden kendisi çıkarır; yazım farklarını birleştirmez, bu yüzden kategori adlarını Veri sekmesindeki ızgarada gözle denetlemek gerekir.
- En az iki kategori: Bu koşul koşu sırasında denetlenir; tek kategoriye inen bir sütunda analiz hata vererek durur.
- Beklenen dağılımın kategori sayısıyla uyumu: Uyuşmazlık denetlenir ve analiz, kaç değer beklendiğini ve kaç değer bulunduğunu bildiren bir hatayla durur. Kayıp değerler önce atıldığı için kategori sayısı ham dosyadakinden az olabilir; listeyi bu yüzden sonuçtaki gözlenen sıklık tablosuna bakarak hazırlamak güvenlidir.
- Beklenen sıklıkların yeterliliği: Bu yöntem en küçük beklenen sıklığı ayrı bir alan olarak raporlar ve ölçütün sağlanıp sağlanmadığını bildiren bir bayrak döndürür. Ancak bayrak yalnız bilgilendiricidir: koşul sağlanmadığında analiz durmaz, istatistik yine hesaplanır ve kesin bir teste geçilmez. Bayrağı okuyup seyrek kategorileri birleştirme ya da sonucu ihtiyatla raporlama kararını araştırmacı verir.
Analiz nasıl yürütülür?
- 1CSV ya da XLSX dosyanızı yükleme alanına sürükleyip bırakın ve sütunların doğru ayrıştığını Veri sekmesindeki ızgarada görün.
- 2Izgarada kategori yazımlarını gözden geçirin; aynı kategorinin iki ayrı yazımı serbestlik derecesini ve beklenen dağılımın madde sayısını değiştirir.
- 3Değişken sekmesinde sütunu sınıflayıcı olarak işaretleyin, kayıp değer kodlarını tanımlayın, gerekiyorsa seyrek kategorileri birleştiren bir türetilmiş sütun kurun.
- 4Analiz sekmesinde arama kutusuna yöntem adını yazın; verinize uymayan yöntemler listeden kaldırılmaz, soluk görünür ve nedeni düz bir cümleyle yazılır.
- 5Parametre formunda sınanacak sütunu seçin; beklenen dağılımı boş bırakarak düzgün dağılımı sınayabilir ya da oranları virgülle ayırarak kendi dağılımınızı yazabilirsiniz.
- 6Analizi çalıştırın; sonuçlar açılır bölümler hâlinde gelir ve bu yöntem için yönteme özgü bir grafik çizilmez.
- 7Önce en küçük beklenen sıklık ile varsayım bayrağını okuyun, ardından gözlenen ve beklenen tabloları karşılaştırın.
- 8Hesaplama künyesi kartında kullanılan kütüphane çağrısını ve sürümünü görün, sonucu Excel olarak indirin; koşu geçmiş sekmesine de yazılır.
Üretilen istatistikler ve tablolar
- Ki-kare istatistiği
- Gözlenen ile beklenen sıklıklar arasındaki ölçeklenmiş farkların toplamı. Değer büyüdükçe dağılımın belirtilen beklentiden uzaklaştığı okunur.
- Serbestlik derecesi
- Temizlenmiş veride gözlenen kategori sayısının bir eksiği. Beklenen dağılımın kestirilen bir parametreden gelmesi durumunda bu değer düzeltilmez.
- Anlamlılık değeri ve anlamlılık bayrağı
- Ki-kare dağılımına dayanan p değeri ile bu değerin 0,05 eşiğinin altında kalıp kalmadığını bildiren mantıksal bayrak birlikte döner.
- Gözlenen sıklık tablosu
- Kategori başına kişi sayısı. Beklenen dağılımı elle yazacaksanız kategori sırasını bu tablodan almak en güvenli yoldur.
- Beklenen sıklık tablosu
- Her kategori için beklenen değerler. Oran olarak mı sayım olarak mı yazdığınızdan bağımsız biçimde gözlenen toplama ölçeklendiği için tablonun toplamı gözlem sayısına eşittir.
- En küçük beklenen sıklık ve varsayım bayrağı
- Beklenen sıklıkların en küçüğü ile tüm beklenen değerlerin 5 ölçütünü karşılayıp karşılamadığını söyleyen bayrak. Bayrak sonucu engellemez, yalnız bildirir.
- Toplam gözlem sayısı
- Kayıp değerler atıldıktan sonra analize giren geçerli gözlem sayısı; etki büyüklüğünün ölçeklenmesinde de bu sayı kullanılır.
- Cohen's w
- Etki büyüklüğü, ki-kare değerinin toplam gözlem sayısına bölünmesinin karekökü olarak verilir. Motor bu değerin yanına sözel bir güç etiketi eklemez.
Etki büyüklüğü ve güven aralığı
- Cohen's w
- Dağılımın beklenenden ne kadar ayrıştığını örneklem büyüklüğünden arındırarak özetler ve sıfırdan büyük değerler alır. Alan yazındaki alışılmış okuma 0,1 civarını küçük, 0,3 civarını orta, 0,5 ve üzerini büyük sayar; bu eşikler motor tarafından uygulanmaz ve sonuçta hiçbir yorum etiketi basılmaz, değerlendirmeyi yorumlarken siz yaparsınız. Örneklem büyüdükçe ki-kare ile p değeri tek başına keskinleşirken Cohen's w aynı kalır, bu yüzden bulgunun pratik ağırlığını w üzerinden tartışmak gerekir.
Bu yöntemde hiçbir güven aralığı döndürülmez. Ki-kare istatistiği, p değeri ve Cohen's w nokta tahmini olarak raporlanır; kategori oranları için ya da gözlenen oran ile beklenen oran arasındaki fark için aralıklı tahmin hesaplanmaz. Tek bir kategorinin oranı çevresinde aralık gerekiyorsa oran testini ayrıca çalıştırmanız ya da hesabı panel dışında yapmanız gerekir.
Örnek araştırma sorusu ve örnek sonuç
Aşağıdaki sayılar temsili bir örnektir; gerçek bir araştırmanın ya da gerçek bir kullanıcının verisi değildir.
- Araştırma sorusu
- Temsili bir müşteri araştırmasında, destek talebinin iletildiği kanal dört seçenek arasında eşit sıklıkta mı dağılıyor?
- Değişkenler
- Sınanan değişken: destek kanalı (uygulama içi sohbet, telefon, elektronik posta, sosyal medya) · Beklenen dağılım: alan boş bırakıldı, yani dört kategoride düzgün dağılım
- Örnek sonuç
- 420 geçerli kayıt sınandı. Gözlenen sıklıklar uygulama içi sohbette 132, telefonda 118, elektronik postada 96, sosyal medyada 74. Düzgün dağılım varsayıldığı için her kategoride beklenen değer 105 ve en küçük beklenen sıklık da 105 olduğundan varsayım bayrağı koşulun sağlandığını bildiriyor. Ki-kare = 18,48, serbestlik derecesi = 3, p = 0,0004, Cohen's w = 0,21.
- Yorum
- Dört kanalın eşit pay aldığı varsayımı reddediliyor: yüzdeler sırasıyla 31,4, 28,1, 22,9 ve 17,6 olarak gerçekleşmiş ve 420 kişilik bir kayıt kümesinde bu sapma düzgün dağılım altında seyrek görülecek bir örüntü. Cohen's w 0,21 ile küçük ve orta arasında bir ayrışmaya işaret ediyor, yani kanal kullanımı eşit olmasa da bir kanal ötekileri ezmiş değil. Test hangi kategorinin uyumsuzluğu yarattığını söylemediği için okumayı gözlenen ve beklenen tabloları karşılaştırarak yapmak gerekti: toplama en çok katkı veren kategori, beklenenin 31 altında kalan sosyal medya. Kayıtların kanal altyapısındaki erişilebilirlik farkından etkilenmiş olabileceği de ayrıca tartışılmalıdır. Sayılar temsilidir.
Örnek veri setiyle gerçek çıktı
Aşağıdaki sonuçları analiz motoru bu veri dosyasını çözümleyerek üretti. Değişkeni değiştirdiğinizde araştırma sorusu da değişiyor; sonuçların tamamı önceden hesaplandı, sayfa motora istek göndermiyor.
Genel müşteri anketi (sentetik)
Üç yüz yanıtlayıcılı geniş bir anket: iki ve üç kategorili gruplayıcılar, sürekli ölçümler, beşli sıralı ölçek, iki kategorili satın alma sonucu, dört kategorili marka tercihi, üç tekrarlı ölçüm, eşleştirilmiş ikili sorular, üç kodlayıcı, dört fiyat sorusu ve kasıtlı olarak boş bırakılmış hücreler.
- Satır sayısı
- 300
- Sütunlar
- katilimci_no, cinsiyet, egitim_duzeyi, bolge, yas, gelir, memnuniyet, hizmet_puani, fiyat_puani, kalite_puani, baglilik, tavsiye_skoru, satin_aldi, marka_tercihi, memnuniyet_duzeyi, on_puan, son_puan, olcum_1, olcum_2, olcum_3, kullanim_once, kullanim_sonra, kullanim_izleme, kodlayici_1, kodlayici_2, kodlayici_3, fiyat_cok_ucuz, fiyat_ucuz, fiyat_pahali, fiyat_cok_pahali, geri_bildirim_puani, izleme_puani
Veri sentetiktir: gerçek bir araştırmadan değil, sabit bir tohumla üretildi. Aşağıdaki değerleri analiz motoru bu dosyayı çözümleyerek üretti; aynı dosyayı panele yükleyince aynı sonuçları görürsünüz.
Araştırma sorusu: Katılımcılar dört bölgeye eşit mi dağılmış?
- Çözümlenen sütun
- bolge
- column
- bolge
- Ki-kare değeri
- 0,667
- Serbestlik derecesi
- 3
- p değeri
- 0,881
- Geçerli gözlem
- 300
- Etki büyüklüğü w (Cohen)
- 0,047
- En küçük beklenen sıklık
- 75
- Beklenen sıklık varsayımı karşılandı
- Evet
- Anlamlı
- Hayır
Gözlenen sıklık
- Akdeniz
- 78
- Ege
- 76
- Marmara
- 77
- İç Anadolu
- 69
Beklenen sıklık
- Akdeniz
- 75
- Ege
- 75
- Marmara
- 75
- İç Anadolu
- 75
Hesaplama künyesi: scipy 1.18.0 · statsmodels 0.14.6 · scikit-learn 1.9.0 · numpy 2.5.1 · pandas 3.0.5 · semopy 2.3.11 · 89fc29a · Veri tohumu: 20260914
Sonuç nasıl raporlanır?
Destek kanalı dağılımı düzgün dağılımdan anlamlı biçimde ayrıldı, ki-kare(3, N = 420) = 18,48, p = 0,0004, Cohen's w = 0,21; en küçük beklenen sıklık 105 olduğu için beklenen sıklık ölçütü karşılanmıştır.
APA düzenine yakın örnek cümle; sayılar temsilidir.
Ne zaman kullanılmamalıdır?
- İki değişken arasındaki ilişkiyi sınamaz; bir sınıflamanın başka bir sınıflamaya göre değişip değişmediği sorulduğunda bağımsızlık testine geçmek gerekir.
- Beklenen sıklık ölçütünü raporlamasına karşın uygulamaz; bayrak olumsuz olduğunda da sonuç üretilir, bu yüzden bayrağı okumak araştırmacının sorumluluğundadır.
- Beklenen dağılım aynı veriden kestirildiğinde serbestlik derecesi düşürülmez; dışarıdan gelen bir dağılım kullanmak yorumu daha sağlam kılar.
- Kategoriler sıralı olduğunda bile sıra bilgisini kullanmaz, dolayısıyla artan ya da azalan bir eğilimi yakalamakta duyarsızdır.
- Hangi kategorinin uyumsuzluktan sorumlu olduğunu gösteren artık değerler döndürülmediği için kategori düzeyindeki okuma elle yapılır.
- Çok sayıda kategorinin bulunduğu ve her birinde az gözlemin toplandığı dağılımlarda istatistik kararsızlaşır; kavramsal gerekçeyle birleştirme yapılmadan sonuç raporlanmamalıdır.
Varsayımlar karşılanmazsa kullanılabilecek yöntemler
- Ki-Kare Bağımsızlık TestiNeden: Soru tek bir dağılımın beklentiye uyumu değil, iki kategorik değişkenin birbirinden bağımsız olup olmadığıysa.
- Oran TestiNeden: İlgi tek bir kategorinin oranında yoğunlaşıyorsa ve bu oranın belirli bir değerden ayrıştığını sınamak yetiyorsa.
- Frekans DağılımıNeden: Sınama gerekmiyor, dağılımın kendisini yüzdeler ve birikimli yüzdelerle betimlemek yeterliyse.
- AğırlıklandırmaNeden: Uyumsuzluk saptandıktan sonra amaç örneklemi evren bileşimine yaklaştırmaksa; sınamadan düzeltmeye geçilir.
Sık sorulan sorular
- Beklenen dağılımı yüzde olarak mı, kişi sayısı olarak mı yazmalıyım?
- İkisi de kabul edilir ve sonucu değiştirmez, çünkü girdiğiniz değerler her durumda gözlenen toplama yeniden ölçeklenir. Yüzde yazarsanız toplamın tam olarak yüze gelmesi de şart değildir, oranlar göreli olarak okunur. Önemli olan tek şey değerlerin sırasının gözlenen sıklık tablosundaki kategori sırasıyla örtüşmesi ve madde sayısının kategori sayısına eşit olmasıdır.
- Beklenen dağılımı boş bırakırsam ne sınanmış olur?
- Alan boşken tüm kategorilerin eşit paya sahip olduğu varsayılır, yani düzgün dağılıma uyum sınanır. Bu birçok durumda anlamlı bir başlangıç sorusudur, örneğin bir seçim setindeki seçeneklerin eşit ilgi görüp görmediği. Evrene benzerlik sorgulanıyorsa düzgün dağılım çoğu zaman yanlış bir temeldir ve dış kaynaktan gelen oranları elle yazmak gerekir.
- Beklenen değeri 5'in altında kalan kategoriler var, analiz durur mu?
- Durmaz. Bu yöntem en küçük beklenen sıklığı ve ölçütün karşılandığını bildiren bir bayrağı raporlar, fakat bayrak olumsuz olsa bile istatistik hesaplanır ve sonuç basılır. Kesin bir olasılık hesabına kendiliğinden geçilmez. Bayrak olumsuzsa kavramsal olarak savunulabilen kategorileri birleştirip yeniden çalıştırmak ya da sonucu bu sınırı açıkça yazarak raporlamak üzerinde düşünülmelidir.
- Hangi kategorinin uyumsuzluğu yarattığını nasıl belirlerim?
- Kategori düzeyinde bir izleme hesabı ya da artık değer tablosu döndürülmez. Pratik yol, gözlenen ve beklenen tabloları yan yana okuyup her kategori için farkın karesini beklenen değere bölmek ve hangi kategorinin toplama en çok katkı verdiğini görmektir. Raporda yüzdeleri de vermek, okuyucunun aynı karşılaştırmayı yapabilmesini sağlar.
Kaynaklar
- Agresti, A. (2018). An Introduction to Categorical Data Analysis
- Field, A. (2018). Discovering Statistics Using IBM SPSS Statistics
- Cohen, J. (1988). Statistical Power Analysis for the Behavioral Sciences
- scipy.stats.chisquare belgeleri
Kendi verinizle deneyin
Ücretsiz planda ayda 50 analiz koşusu vardır; kart istenmez.