Regresyon
Çok Sınıflı Lojistik Regresyon
Sırasız ve ikiden çok kategorili bir sonucu sayısal yordayıcılarla modeller; her kategoriyi bir ölçüt kategoriye karşı ayrı ayrı karşılaştırır.
Yöntem özeti
Çok sınıflı lojistik regresyon, yanıtlayıcının birbirine üstünlük sırası konulamayan seçenekler arasından birini işaretlediği durumlar için kurulur: hangi markanın tercih edildiği, hangi ulaşım aracının kullanıldığı, hangi kanaldan satın alındığı. Böyle bir sonucu tek bir ikili karşılaştırmaya indirmek seçenekler arasındaki ayrımı yok eder; kategorileri sıralı saymak ise olmayan bir düzen uydurmak olur. Model bunun yerine bir kategoriyi ölçüt seçer ve geri kalan her kategoriyi bu ölçüte karşı ayrı bir denklemle karşılaştırır. Böylece tek bir koşudan, kategori sayısından bir eksik sayıda katsayı kümesi çıkar ve her küme kendi karşılaştırmasını anlatır. YouReply Nicel Analiz kestirimi statsmodels kütüphanesinin MNLogit sınıfıyla yapar. Sonuç değişkeninin üç ile on arası kategori taşıması beklenir; ölçüt kategori parametre formunda seçilebilir, bırakıldığında ilk kategori ölçüt sayılır. Çıktıda ölçüt dışı her kategori için katsayı, standart hata, z değeri, p değeri, göreli risk oranı ve anlamlılık bayrağı bulunur; bunlara log olabilirlik, sözde R kare, AIC, BIC ve gözlem sayısı eşlik eder. Bir yordayıcı sonucu kusursuz biçimde ayrıştırıyorsa motor kestirimi sürdürmek yerine durur ve o yordayıcıyı çıkarmanızı ya da kategorileri birleştirmenizi ister.
Hangi araştırma sorularında kullanılır?
- Yaş ve aylık harcama, üç market zinciri arasından hangisinin birincil tercih edildiğini yorduyor mu?
- Fiyat duyarlılığı puanı değiştikçe abonelik kademelerinden hangisinin seçilme olasılığı yükseliyor?
- Yolculuk süresi ve gelir, işe gidiş aracının özel araç, toplu taşıma ya da yürüyüş olmasını açıklıyor mu?
- Hangi sayısal özellikler, yanıtlayıcının dört bilgi kanalı arasından birini seçmesiyle ilişkili?
Ne zaman kullanılmalıdır?
- Sonuç üç ile on arası kategoriden oluştuğunda ve kategoriler arasında kuramsal bir sıra bulunmadığında.
- Her kategorinin ölçüte karşı ayrı ayrı nasıl ayrıldığını görmek, tek bir özet karşılaştırmadan daha bilgilendirici olduğunda.
- Ölçüt olarak kullanılabilecek doğal bir karşılaştırma kategorisi bulunduğunda: en yaygın seçenek, kontrol seçeneği ya da mevcut durum.
- Her kategoride kestirimi taşıyacak kadar yanıtlayıcı bulunduğunda; birkaç kişinin işaretlediği bir seçenek kendi denklemini kararsızlaştırır.
Gerekli değişken türleri
- Bağımlı değişken: sırasız kategorilerden oluşan sütun; en az üç, en çok on ayrı değer taşımalıdır.
- Yordayıcılar: sayısal sütunlar. Birkaçı aynı koşuda işaretlenebilir ve katsayıları her karşılaştırma için ayrı ayrı döner.
- Ölçüt kategori bir parametredir; kategorilerden hangisinin karşılaştırma tabanı olacağını araştırma sorusu belirler.
- Kategorik bir yordayıcı kullanılacaksa Değişken sekmesindeki türetilmiş sütunlarla kukla kodlamaya çevrilmelidir.
Temel varsayımlar
- Kategorilerin birbirini dışlaması
- Her yanıtlayıcı tam olarak bir kategoriye düşmelidir. Birden çok seçenek işaretlenebilen sorularda bu koşul sağlanmaz ve sonucun tek sütuna sıkıştırılması yanıtlayıcının gerçek davranışını temsil etmez.
- İlgisiz seçeneklerin bağımsızlığı
- Model, iki kategori arasındaki göreli tercihin üçüncü bir kategorinin varlığından etkilenmediğini varsayar. Birbirine çok benzeyen iki seçenek listede birlikte yer aldığında bu koşul bozulur ve karşılaştırmalar bozuk çıkar.
- Yordayıcının sonucu kusursuz ayırmaması
- Bir yordayıcı belirli bir kategoriyi hatasız biçimde belirliyorsa katsayı sonsuza doğru kaçar ve kestirim anlam taşımaz. Bu genellikle yordayıcının sonucun tanımıyla örtüştüğünün belirtisidir.
- Gözlemlerin bağımsızlığı
- Her satır ayrı bir yanıtlayıcıdan gelmelidir. Aynı kişinin farklı durumlarda yaptığı birden çok seçim bu modele tek tek satır olarak girdiğinde standart hatalar olduğundan küçük görünür.
- Karşılaştırma başına yeterli gözlem
- Model her kategori için ayrı bir denklem kestirir; dolayısıyla gözlem gereksinimi kategori sayısıyla birlikte büyür. Seyrek işaretlenmiş bir kategori kendi katsayılarını abartır.
YouReply bu varsayımları nasıl kontrol eder?
- Kategorilerin birbirini dışlaması: Motor sonuç sütununda üç ile on arası ayrı değer arar ve bu aralığın dışında analizi durdurur. Kategorilerin birbirini gerçekten dışlayıp dışlamadığı denetlenmez; bu veri tasarımına ilişkin bir karardır.
- İlgisiz seçeneklerin bağımsızlığı: Bu varsayım için sınama döndürülmez: Hausman-McFadden türü bir karşılaştırma yapılmaz ve seçenek kümesini daraltarak kestirimi yineleyen bir denetim bulunmaz. Kuşkunuz varsa birbirine yakın kategorileri birleştirip analizi yeniden çalıştırmak ve katsayıların kararlılığını karşılaştırmak elinizdeki yoldur.
- Yordayıcının sonucu kusursuz ayırmaması: Motorda bunun için açık bir koruma vardır: tam ayrışma saptandığında analiz durur ve sorunlu yordayıcıyı modelden çıkarmanızı ya da kategorileri birleştirmenizi söyleyen bir ileti görünür. Hangi değişkenin soruna yol açtığını anlamak için yordayıcı kümesini daraltarak yeniden denemeniz gerekir.
- Gözlemlerin bağımsızlığı: Panel bu varsayımı otomatik denetlemez; değerlendirme araştırmacıya aittir.
- Karşılaştırma başına yeterli gözlem: Panel bu yöntemde hiçbir tanı hesabı yapmaz: kategori başına gözlem yeterliliği değerlendirilmez, çoklu bağlantı ölçüsü üretilmez ve artıklar incelenmez. Kategori dağılımını Veri sekmesinde görüp seyrek seçenekleri birleştirme kararını kendiniz vermeniz gerekir.
Analiz nasıl yürütülür?
- 1Dosyanızı yükleme alanına bırakın ve Veri sekmesindeki tabloda sonuç sütununun kategorilerini gözden geçirin.
- 2Değişken sekmesinde sonuç sütununun ölçüm düzeyini adsal olarak işaretleyin ve kodlara değer etiketi verin; etiketler sonuç tablosundaki karşılaştırma adlarını okunur kılar.
- 3Çok seyrek işaretlenen kategorileri belirleyin. Onları kuramsal olarak yakın bir kategoriyle birleştirmek, on kategorili bir modeli kestirmeye çalışmaktan genellikle daha sağlıklıdır.
- 4Analiz sekmesinde yöntemi arama kutusundan seçin ve veri gereksinimleri kutusunu okuyun; 'Yalnız verime uyanlar' anahtarı açıkken uygun kategorik sütunu olmayan veri kümelerinde yöntem soluk görünür.
- 5Parametre formunda sonuç değişkenini, yordayıcıları ve ölçüt kategoriyi seçin. Ölçütü boş bırakırsanız ilk kategori taban alınır, bu da yorumu beklemediğiniz bir yöne çevirebilir.
- 6Analizi çalıştırın. Sonuç, her karşılaştırma için ayrı bir tablo ile uyum ölçülerinden oluşur. Bu yöntemde grafik üretilmez; tabloları Excel olarak indirebilir ve koşuyu Geçmiş sekmesinden yeniden açabilirsiniz.
Üretilen istatistikler ve tablolar
- Karşılaştırma başına katsayılar
- Ölçüt dışı her kategori için ayrı bir katsayı kümesi. Bir katsayı, yordayıcı büyüdükçe yanıtlayıcının ölçüt yerine o kategoriyi seçme eğiliminin nasıl değiştiğini verir.
- Standart hatalar
- Her katsayının kestirim kesinliği. Seyrek işaretlenmiş kategorilerin denklemlerinde bu değerler belirgin biçimde büyür ve katsayıya güveni azaltır.
- z değeri ve p değeri
- Katsayının standart hatasına oranı ile buna karşılık gelen anlamlılık değeri. Her karşılaştırma için ayrı okunur; bir yordayıcı bir kategoride anlamlı çıkıp başka bir kategoride çıkmayabilir.
- Göreli risk oranı
- Katsayının üstel hâli. Yordayıcıda bir birimlik artışın, ölçüt kategoriye göre ilgili kategorinin seçilme oranını kaç katına çıkardığını verir.
- Anlamlılık bayrağı
- Her katsayı için 0,05 düzeyine göre konulan işaret. Çok sayıda karşılaştırma birlikte okunduğunda bu bayrakların birikimli yanlış bulgu riskini düzeltmediğini unutmamak gerekir.
- Log olabilirlik ve sözde R kare
- Kestirimin ulaştığı olabilirlik ile boş modele göre iyileşmeyi özetleyen uyum göstergesi. Sözde R kare doğrusal regresyonun R karesiyle aynı ölçekte değildir.
- AIC ve BIC
- Aynı veri üzerinde farklı yordayıcı kümeleriyle kurulmuş modelleri karşılaştırmaya yarayan iki bilgi ölçütü. Kategori sayısı arttıkça kestirilen katsayı sayısı da arttığı için bu ölçütler ekonomiyi değerlendirmede işe yarar.
- Gözlem sayısı
- Modele giren satır sayısı. Kategori başına kaç gözlem düştüğünü bu sayıyı sonuç değişkeninin dağılımıyla birlikte okuyarak değerlendirebilirsiniz.
Etki büyüklüğü ve güven aralığı
- Göreli risk oranı
- Bir birimlik artışın, ölçüt kategoriye kıyasla ilgili kategorinin seçilme oranını kaçla çarptığını söyler. 1,80 yanıtlayıcının ölçüt yerine o kategoriyi seçme eğiliminin yaklaşık iki katına yaklaştığı, 0,55 ise kabaca yarıya indiği anlamına gelir. Değer her zaman bir çifte ilişkindir: ölçüt değiştiğinde aynı veri üzerinde başka sayılar çıkar, bu yüzden ölçüt kategorinin adı rapor cümlesinde mutlaka yer almalıdır.
- Sözde R kare
- Modelin olabilirliği yordayıcısız modele göre ne kadar iyileştirdiğini özetler. Çok kategorili sonuçlarda düşük değerler olağandır ve 0,10 ile 0,20 arası bir değer bile kullanışlı bir model ile uyumlu olabilir; doğru sınıflama yüzdesi gibi aktarılması yanlıştır.
Bu yöntem ne katsayılar ne de göreli risk oranları için aralık döndürür; tablolarda nokta tahminler, standart hatalar, z ve p değerleri yer alır. Sözde R kare de aralıksızdır. Yayın için aralık gerekiyorsa katsayı ile standart hatayı kullanarak logit ölçeğinde aralık kurup sonra üstel hâle getirmeniz gerekir. Aralık yokluğu burada özellikle yakıcıdır, çünkü aynı yordayıcının farklı kategorilerdeki etkileri karşılaştırılmak istenir ve iki göreli risk oranının birbirinden gerçekten ayrıştığı yalnız nokta tahminlere bakılarak söylenemez.
Örnek araştırma sorusu ve örnek sonuç
Aşağıdaki sayılar temsili bir örnektir; gerçek bir araştırmanın ya da gerçek bir kullanıcının verisi değildir.
- Araştırma sorusu
- Temsili bir perakende araştırmasında, yaş ve aylık market harcaması yanıtlayıcının üç zincir arasından hangisini birincil olarak tercih ettiğini yorduyor mu?
- Değişkenler
- Bağımlı değişken: birincil tercih edilen zincir (A zinciri, B zinciri, C zinciri) · Ölçüt kategori: A zinciri · Yordayıcı 1: yaş (yıl) · Yordayıcı 2: aylık market harcaması (bin lira)
- Örnek sonuç
- n = 540 yanıtlayıcı. B zinciri ile A zinciri karşılaştırmasında yaş için katsayı -0,04 (standart hata 0,01, z = -4,00, p < 0,001, göreli risk oranı 0,96) ve harcama için 0,31 (standart hata 0,09, z = 3,44, p = 0,001, göreli risk oranı 1,36). C zinciri ile A zinciri karşılaştırmasında yaş için 0,02 (standart hata 0,01, z = 2,00, p = 0,046, göreli risk oranı 1,02) ve harcama için -0,12 (standart hata 0,10, z = -1,20, p = 0,230, göreli risk oranı 0,89). Sözde R kare 0,09, log olabilirlik -524,7, AIC 1061,4, BIC 1087,2.
- Yorum
- Harcama arttıkça yanıtlayıcıların A zinciri yerine B zincirini tercih etme eğilimi belirgin biçimde yükseliyor: bin liralık her artış bu oranı 1,36 katına çıkarıyor. Yaş ise ters yönde çalışıyor, yaş yükseldikçe B zinciri A zincirine göre geriliyor. C zinciri tarafında tablo başka: harcamanın etkisi anlamlı değil ve yaşın etkisi sınırda duruyor, yani C zincirini seçenler A zincirini seçenlerden bu iki değişkenle belirgin biçimde ayrışmıyor. Bu örnek, tek bir özet karşılaştırmanın neden yetmediğini gösteriyor: aynı yordayıcı bir karşılaştırmada güçlü, ötekinde etkisiz çıkabiliyor. Bütün sayılar A zincirine göre okunur; ölçüt B zinciri seçilse katsayılar da değişir. Panel ilgisiz seçeneklerin bağımsızlığını sınamadığı için üç zincirin birbirinin yerine geçebilirliği hakkında bu çıktıdan bir şey öğrenilemez.
Örnek veri setiyle gerçek çıktı
Aşağıdaki sonuçları analiz motoru bu veri dosyasını çözümleyerek üretti. Değişkeni değiştirdiğinizde araştırma sorusu da değişiyor; sonuçların tamamı önceden hesaplandı, sayfa motora istek göndermiyor.
Genel müşteri anketi (sentetik)
Üç yüz yanıtlayıcılı geniş bir anket: iki ve üç kategorili gruplayıcılar, sürekli ölçümler, beşli sıralı ölçek, iki kategorili satın alma sonucu, dört kategorili marka tercihi, üç tekrarlı ölçüm, eşleştirilmiş ikili sorular, üç kodlayıcı, dört fiyat sorusu ve kasıtlı olarak boş bırakılmış hücreler.
- Satır sayısı
- 300
- Sütunlar
- katilimci_no, cinsiyet, egitim_duzeyi, bolge, yas, gelir, memnuniyet, hizmet_puani, fiyat_puani, kalite_puani, baglilik, tavsiye_skoru, satin_aldi, marka_tercihi, memnuniyet_duzeyi, on_puan, son_puan, olcum_1, olcum_2, olcum_3, kullanim_once, kullanim_sonra, kullanim_izleme, kodlayici_1, kodlayici_2, kodlayici_3, fiyat_cok_ucuz, fiyat_ucuz, fiyat_pahali, fiyat_cok_pahali, geri_bildirim_puani, izleme_puani
Veri sentetiktir: gerçek bir araştırmadan değil, sabit bir tohumla üretildi. Aşağıdaki değerleri analiz motoru bu dosyayı çözümleyerek üretti; aynı dosyayı panele yükleyince aynı sonuçları görürsünüz.
Araştırma sorusu: Fiyat ve kalite algısı, Marka A yerine diğer markaların seçilmesini yorduyor mu?
- Bağımlı değişken
- marka_tercihi
- Bağımsız değişkenler
- fiyat_puani,kalite_puani
- Referans kategori
- Marka A
- dependent_var
- marka_tercihi
- Referans kategori
- Marka A
- Log olabilirlik
- -377,70
- Sözde R kare (McFadden)
- 0,039
- Akaike bilgi ölçütü (AIC)
- 773,40
- Bayes bilgi ölçütü (BIC)
- 806,73
- Geçerli gözlem
- 300
Referansa göre karşılaştırmalar
| Satır | Sabit terim | fiyat_puani | kalite_puani |
|---|---|---|---|
| Marka B / Marka A | - | - | - |
| Marka C / Marka A | - | - | - |
| Marka D / Marka A | - | - | - |
Hesaplama künyesi: scipy 1.18.0 · statsmodels 0.14.6 · scikit-learn 1.9.0 · numpy 2.5.1 · pandas 3.0.5 · semopy 2.3.11 · 89fc29a · Veri tohumu: 20260914
Sonuç nasıl raporlanır?
Çok sınıflı lojistik regresyonda A zinciri ölçüt alındığında aylık harcama B zinciri tercihini yordadı (RRR = 1,36, p = 0,001), C zinciri tercihinde ise etkisi anlamlı değildi (RRR = 0,89, p = 0,230); sözde R kare = 0,09 (n = 540).
APA düzenine yakın örnek cümle; sayılar temsilidir.
Ne zaman kullanılmamalıdır?
- İlgisiz seçeneklerin bağımsızlığı için sınama bulunmaz; birbirinin yerine geçebilen iki seçenek listede yer aldığında bunun izi sonuç ekranında görünmez.
- Katsayılar ve göreli risk oranları aralıksız raporlanır, bu yüzden iki karşılaştırmadaki etkilerin birbirinden ayrıştığı çıktıdan gösterilemez.
- Regresyon tanıları hesaplanmaz: çoklu bağlantı ölçüsü, artık incelemesi ve etkili gözlem ölçütü döndürülmez.
- Kategori sayısı büyüdükçe kestirilen katsayı sayısı hızla artar ve ondan çok kategorili sonuçlar hiç kabul edilmez.
- Tam ayrışma durumunda analiz sonuç vermek yerine durur; hangi yordayıcının soruna yol açtığı ileti içinde adlandırılmadığı için eleme deneme yoluyla yapılır.
- Sonuç kategorileri sıralıysa bu model sıralama bilgisini kullanmaz ve gereğinden çok parametre kestirerek gücü düşürür.
Varsayımlar karşılanmazsa kullanılabilecek yöntemler
- Lojistik RegresyonNeden: Araştırma sorusu gerçekte tek bir kategoriyi geri kalanın tümünden ayırmaya indiriyorsa; tek denklemle daha az parametre kestirilir.
- Sıralı Lojistik RegresyonNeden: Kategoriler arasında kuramsal bir sıra varsa; sıralama bilgisi kullanıldığında daha az katsayıyla daha güçlü bir kestirim elde edilir.
- Ki-Kare Bağımsızlık TestiNeden: Yordayıcılar da kategorikse ve soru yalnız seçim ile bir özellik arasında ilişki olup olmadığıysa; çapraz tablo doğrudan yanıt verir.
- K-Ortalamalar Küme AnaliziNeden: Amaç hazır bir seçimi yordamak değil yanıtlayıcıları özelliklerine göre öbeklere ayırmaksa.
Sık sorulan sorular
- Göreli risk oranı ile bahis oranı aynı şey mi?
- Aynı şey değildir, ama hesabı benzer olduğu için kolayca karıştırılır. Çok sınıflı modelde her katsayı, bir kategorinin ölçüt kategoriye göre seçilme oranı üzerine kuruludur; üstel hâli bu oranın kaçla çarpıldığını verir ve buna göreli risk oranı denir. İkili lojistik regresyondaki bahis oranı ise olayın olma ile olmama bahsi üzerinedir. Pratik ayrım şudur: buradaki her sayı bir çifte aittir ve ölçüt kategoriyi değiştirdiğinizde bütün sayılar yeniden hesaplanır. Bu yüzden rapor cümlenizde hem karşılaştırılan kategoriyi hem ölçütü adlandırmanız gerekir, yoksa okur sayıyı hangi karşılaştırmaya bağlayacağını bilemez.
- Ölçüt kategoriyi nasıl seçmeliyim?
- Ölçüt seçimi modelin uyumunu değiştirmez, yalnız hangi karşılaştırmaların okunaklı olacağını belirler. Üç ölçüt işinizi görür. En sık işaretlenen kategoriyi ölçüt almak standart hataları küçük tutar ve bu genellikle en güvenli başlangıçtır. Kuramsal bir taban varsa onu seçmek yorumu doğallaştırır: mevcut durumu, kontrol seçeneğini ya da pazar lideri markayı ölçüt almak gibi. Üçüncüsü okurun beklentisi, yani alan yazında hangi kategoriye göre rapor edildiğidir. Parametreyi boş bırakırsanız ilk kategori taban olur ve bu sıralama veri dosyanızdan gelir, yani bilinçli bir seçim olmaz.
- Analiz tam ayrışma iletisiyle durdu, ne yapmalıyım?
- Bu ileti, yordayıcılardan birinin bir sonuç kategorisini hatasız belirlediği anlamına gelir; böyle bir durumda katsayı sınırsız büyür ve kestirim anlamını yitirir. Neredeyse her zaman arkasında veri kurgusuna ilişkin bir durum vardır: yordayıcı sonucun tanımının bir parçasıdır, yalnız belirli bir kategoride doldurulmuş bir alandır ya da çok seyrek bir kategori tek bir yordayıcı değeriyle çakışmıştır. Çözüm yolu ikiye ayrılır. Yordayıcıyı modelden çıkarmak, ayrışmaya o değişken yol açıyorsa doğru adımdır. Seyrek bir kategori sorunun kaynağıysa o kategoriyi kuramsal olarak yakın bir komşusuyla birleştirmek daha iyidir. Hangi değişkenin sorumlu olduğunu bulmak için yordayıcıları birer birer çıkarıp denemeniz gerekir.
- Kaç yanıtlayıcıya ihtiyacım var?
- Belirleyici olan toplam satır sayısı değil, en az işaretlenen kategoriye düşen gözlem sayısıdır; çünkü model her kategori için ölçüte karşı ayrı bir denklem kestirir. Kaba bir ölçüt olarak her karşılaştırmada yordayıcı başına en az on gözlem istenir ve bu gözlemler küçük kategoride bulunmalıdır. Dört kategorili ve üç yordayıcılı bir modelde en küçük kategorinin otuz kişinin altına düşmesi katsayıları abartır, standart hataları şişirir. Panel bu oranı hesaplamadığı ve uyarı vermediği için değerlendirmeyi kategori dağılımına bakarak kendiniz yapmanız, gerekirse kategori sayısını azaltmanız gerekir.
Kaynaklar
- Agresti, A. (2013). Categorical Data Analysis
- Hosmer, D. W., Lemeshow, S., & Sturdivant, R. X. (2013). Applied Logistic Regression
- Field, A. (2018). Discovering Statistics Using IBM SPSS Statistics
- statsmodels MNLogit belgeleri
Kendi verinizle deneyin
Ücretsiz planda ayda 50 analiz koşusu vardır; kart istenmez.