Regresyon
Lojistik Regresyon
İki sonuçlu bir olayın gerçekleşme olasılığını sayısal yordayıcılarla modeller ve her yordayıcının katkısını bahis oranı olarak bildirir.
Yöntem özeti
Lojistik regresyon, sonucu iki değerli olan durumları yordamak için kurulur: bir katılımcı aboneliğini yeniler ya da yenilemez, anketi tamamlar ya da bırakır. Doğrusal bir model bu tür bir sonuçta sıfırın altına ya da birin üstüne düşen olasılıklar öngörebileceği için burada olasılık yerine bahis oranının doğal logaritması modellenir; böylece öngörüler her zaman sıfır ile bir arasında kalır. Katsayıların üstel hâli bahis oranı (odds ratio) adını alır ve yordayıcıdaki bir birimlik artışın olayın bahsini kaç kat değiştirdiğini söyler. YouReply Nicel Analiz modeli statsmodels kütüphanesinin Logit sınıfıyla kestirir, sabit terimi varsayılan olarak ekler ve yineleme sayısını 100 ile sınırlar. Sonuçta katsayılar, bahis oranları, p değerleri, McFadden sözde R kare, log olabilirlik ile AIC ve BIC yer alır; sonuç değişkeninin hangi değerinin 1 olarak kodlandığı da ayrıca bildirilir. Model uyumuna ilişkin bir sınıflama tablosu ya da ROC ölçümü üretilmez.
Hangi araştırma sorularında kullanılır?
- Memnuniyet düzeyi ve destek talebi sayısı, abonelik yenileme olasılığını nasıl değiştiriyor?
- Katılımcının yaşı ve ankette geçirdiği süre, anketi yarıda bırakma olasılığını yorduyor mu?
- Marka güveni puanı arttıkça yeni ürünü deneme olasılığı kaç kat yükseliyor?
- Eğitim programını tamamlayanlar ile tamamlamayanlar arasındaki ayrımı hangi sayısal değişkenler açıklıyor?
Ne zaman kullanılmalıdır?
- Sonuç değişkeni iki ayrı değerden oluştuğunda: oldu/olmadı, kaldı/ayrıldı, seçti/seçmedi.
- Olayın gerçekleşme olasılığı bir ya da birkaç sayısal değişkenin işlevi olarak betimlenecekse.
- Bir etkinin büyüklüğü kat cinsinden, yani bahis oranı olarak raporlanmak istendiğinde.
- Olayın gerçekleştiği ve gerçekleşmediği durumların her ikisi de örneklemde yeterli sayıda gözlendiğinde.
Gerekli değişken türleri
- Bağımlı değişken: tam olarak iki ayrı değer taşıyan sütun. Değerler 0/1 olmak zorunda değildir; motor iki değeri kendisi kodlar ve hangi değerin 1 sayıldığını sonuçta yazar.
- Yordayıcılar: sayısal sütunlar; parametre formunda birden çoğu birlikte seçilebilir.
- Kategorik yordayıcılar için kukla sütunlar oluşturulmalıdır; Değişken sekmesindeki türetilmiş sütun aracı bu amaçla kullanılır.
- Üç ve daha çok kategorili sonuçlar bu yöntemle çözülmez; sonucun ikiye indirgenmesi bilgi kaybına yol açacaksa başka bir model gerekir.
Temel varsayımlar
- Sonucun iki değerli olması
- Model yalnız iki sonuçlu bir olay için tanımlıdır. Üç kategorili bir değişkeni iki kategoriye indirmek mümkündür, ancak bu birleştirme kuramsal olarak savunulabilir olmalıdır.
- Logit ile yordayıcılar arasında doğrusallık
- Varsayım sonuç değişkeninin kendisinde değil, bahis oranının logaritmasındadır: yordayıcıdaki her birim artışın logit üzerindeki etkisi ölçeğin her yerinde aynı kabul edilir.
- Gözlemlerin bağımsızlığı
- Her satır ayrı bir katılımcıdan gelmelidir. Aynı kişiden alınmış birden çok sonuç ya da kümelenmiş örneklem, standart hataları olduğundan küçük gösterir.
- Yordayıcılar arasında aşırı örtüşme bulunmaması
- Birbirini yineleyen yordayıcılar katsayıları kararsızlaştırır; bahis oranları beklenmedik yönde çıkabilir ve standart hatalar büyür.
- Olay başına yeterli gözlem
- Seyrek gözlenen bir sonuçta katsayılar abartılı büyüklükte çıkar. Yaygın bir ölçüt, az görülen sonuç kategorisinde yordayıcı başına en az 10 gözlem bulunmasıdır.
- Model uyumunun ayrıca değerlendirilmesi
- Katsayıların anlamlı olması modelin veriye uyduğunu göstermez. Uyum, öngörülerin gerçek sonuçlarla ne ölçüde örtüştüğüne bakılarak değerlendirilir.
YouReply bu varsayımları nasıl kontrol eder?
- Sonucun iki değerli olması: Motor sonuç sütununda tam olarak iki ayrı değer arar; daha fazlası varsa analiz hatayla durur. Hangi değerin olayın gerçekleşmesi sayıldığı sonuçta kodlama bilgisi olarak görünür.
- Logit ile yordayıcılar arasında doğrusallık: Panel bu doğrusallığı sınamaz ve eğrisel bir örüntü olduğunda uyarı vermez. Kuşkunuz varsa yordayıcıyı dilimlere ayırıp her dilimdeki olay oranını kendiniz karşılaştırmanız gerekir.
- Gözlemlerin bağımsızlığı: Panel bu varsayımı otomatik denetlemez; değerlendirme araştırmacıya aittir.
- Yordayıcılar arasında aşırı örtüşme bulunmaması: Çoklu bağlantı için hiçbir ölçüt hesaplanmaz: VIF, tolerans ya da koşul indeksi döndürülmez ve panel yordayıcılarınızın örtüştüğünü bildirmez. Yordayıcılar arasındaki bağıntıyı korelasyon yöntemleriyle ayrıca inceleyip kararı kendiniz vermeniz gerekir.
- Olay başına yeterli gözlem: Panel olay sayısını yordayıcı sayısıyla karşılaştırıp bir yeterlilik değerlendirmesi yapmaz. Sonuçtaki gözlem sayısı ile sonuç değişkeninin dağılımına bakarak bu oranı kendiniz hesaplayabilirsiniz.
- Model uyumunun ayrıca değerlendirilmesi: Hosmer-Lemeshow uyum sınaması, sınıflama tablosu, ROC eğrisi ve AUC bu yöntemde hesaplanmaz. Uyuma ilişkin elinizdeki tek sayı McFadden sözde R kare ile bilgi ölçütleridir; sınıflama başarımını görmek istiyorsanız öngörüleri başka bir araçla üretmeniz gerekir.
Analiz nasıl yürütülür?
- 1Veri dosyanızı yükleme alanına bırakın; CSV ve XLSX biçimleri kabul edilir.
- 2Sonuç sütununun yalnız iki ayrı değer taşıdığını Veri sekmesinde görün. Üçüncü bir değer olarak görünen boş hücreler ya da 'Yanıt yok' gibi kodlar varsa bunları Değişken sekmesinde eksik değer olarak tanımlayın.
- 3Analiz sekmesinde yöntemi arama kutusundan ya da Regresyon başlığından seçin. 'Yalnız verime uyanlar' anahtarını açtığınızda iki değerli sütunu bulunmayan veri kümelerinde yöntem soluk görünür ve gerekçesi yazar.
- 4Parametre formunda sonuç değişkenini ve yordayıcıları işaretleyin; sabit terim ile yineleme üst sınırı varsayılan değerleriyle bırakılabilir.
- 5Analizi başlatın. Sonuçta katsayı ve bahis oranı tablosu, sözde R kare ile olabilirlik ölçüleri ve kodlama bilgisi ayrı bölümler hâlinde açılır; üstte katsayıların çubuk grafiği yer alır.
- 6Yakınsama satırını okumadan yorumu bitirmeyin: model olağan yolla yakınsamadıysa motor düzenlileştirilmiş kestirime geçer. Tabloları Excel, grafiği PNG olarak indirebilir, koşuyu Geçmiş sekmesinden yeniden açabilirsiniz.
Üretilen istatistikler ve tablolar
- Katsayılar
- Logit ölçeğindeki ham katsayılar. İşareti olumlu olan bir katsayı, yordayıcı büyüdükçe olayın olasılığının arttığını gösterir.
- Bahis oranları
- Katsayıların üstel hâli. Birin üzerindeki değer bahsi artıran, altındaki değer azaltan bir yordayıcıya işaret eder; bir değeri etkisizlik çizgisidir.
- Katsayı başına p değeri
- Her yordayıcının katkısının sıfırdan ayrıştığına ilişkin anlamlılık değeri. Düzenlileştirilmiş kestirime düşen koşularda bu hücreler sayı olmayan değer taşıyabilir.
- McFadden sözde R kare
- Log olabilirlikteki iyileşmeye dayanan uyum göstergesi. Doğrusal regresyonun R karesiyle aynı ölçekte okunmaz; anket verisinde 0,20 dolayındaki değerler iyi uyum sayılır.
- Log olabilirlik, AIC ve BIC
- Kestirimin ulaştığı olabilirlik değeri ve aynı veri üzerinde kurulan alternatif modelleri karşılaştırmaya yarayan iki bilgi ölçütü.
- Yakınsama bayrağı
- Kestirimin olağan yolla sonuçlanıp sonuçlanmadığını bildiren alan. Bayrak olumsuzsa model düzenlileştirilmiş kestirimle kurulmuştur ve p değerleri okunamayabilir.
- Sonuç kodlaması
- Sonuç değişkeninde bulunan iki değer ve hangisinin 1 olarak alındığı. Bahis oranlarının yönünü doğru okumak bu satıra bağlıdır.
- Gözlem ve yordayıcı sayısı
- Modele giren satır sayısı ile yordayıcı sayısı; seyrek olaylarda bu iki sayının oranı katsayıların güvenilirliği hakkında ilk fikri verir.
- Katsayı grafiği
- Sonuç panelinde katsayılar çubuk grafikle gösterilir ve PNG olarak indirilebilir. Grafikte bahis oranları değil logit ölçeğindeki katsayılar yer alır.
Etki büyüklüğü ve güven aralığı
- Bahis oranı
- Yordayıcıda bir birimlik artışın olayın bahsini kaç katına çıkardığı. 1,50 bahsin yarı yarıya arttığı, 0,67 üçte bir dolayında azaldığı anlamına gelir. Bahis oranı olasılık oranı değildir: olay çok sık ya da çok seyrek gözlendiğinde aynı bahis oranı olasılıkta çok farklı büyüklüklere karşılık gelir.
- McFadden sözde R kare
- Modelin açıkladığı olabilirlik payı. Doğrusal regresyonun R karesine göre belirgin biçimde küçük değerler alır; 0,20 ile 0,40 arasındaki değerler alan yazında iyi uyum olarak değerlendirilir ve 0,05 dolayındaki bir değer zayıf ama anlamlı bir model ile uyumlu olabilir.
Ne katsayılar ne de bahis oranları için güven aralığı döndürülür; tabloda yalnız nokta tahminler ve p değerleri bulunur. Sözde R kare de aralıksız verilir. Bahis oranı için aralık yayında zorunluysa bu değeri katsayı ve standart hatadan yararlanarak panel dışında hesaplamanız gerekir. Düzenlileştirilmiş kestirime düşen koşularda p değerlerinin sayı olarak dönmeyebileceğini de hesaba katın: böyle bir durumda anlamlılık yorumu yapılamaz ve modelin yordayıcı listesini sadeleştirmek genellikle daha sağlıklı bir sonuç verir.
Örnek araştırma sorusu ve örnek sonuç
Aşağıdaki sayılar temsili bir örnektir; gerçek bir araştırmanın ya da gerçek bir kullanıcının verisi değildir.
- Araştırma sorusu
- Temsili bir abone araştırmasında, memnuniyet düzeyi ve yıl içinde açılan destek talebi sayısı aboneliğin yenilenme olasılığını nasıl değiştiriyor?
- Değişkenler
- Bağımlı değişken: abonelik yenilendi mi (yenilendi / yenilenmedi) · Yordayıcı 1: memnuniyet düzeyi (1-10 arası sürekli puan) · Yordayıcı 2: yıl içinde açılan destek talebi sayısı
- Örnek sonuç
- n = 480 abone ile kurulan modelde 'yenilendi' değeri 1 olarak kodlandı. Memnuniyet için bahis oranı 1,12 (b = 0,11, p < 0,001), destek talebi sayısı için 0,78 (b = -0,25, p = 0,010). McFadden sözde R kare = 0,18, log olabilirlik = -241,6, AIC = 489,2, BIC = 501,7. Kestirim olağan yolla yakınsadı.
- Yorum
- Memnuniyet puanındaki her bir birimlik artış, destek talebi sayısı sabit tutulduğunda yenileme bahsini yaklaşık yüzde 12 yükseltiyor; açılan her ek destek talebi ise bahsi 0,78 katına, yani kabaca beşte bir oranında düşürüyor. Sözde R kare 0,18 ile bu tür modellerde iyi sayılan aralıkta. Bahis oranı ile olasılık farklı şeylerdir: yenileme olasılığı zaten yüksek olan bir abone için 1,12'lik bahis artışı olasılıkta çok küçük bir yükselmeye karşılık gelirken, sınırda duran bir abone için belirgin olabilir. Panel sınıflama tablosu ya da AUC üretmediği için modelin kimi doğru sınıflandırdığı bu çıktıdan bilinemez.
Örnek veri setiyle gerçek çıktı
Aşağıdaki sonuçları analiz motoru bu veri dosyasını çözümleyerek üretti. Değişkeni değiştirdiğinizde araştırma sorusu da değişiyor; sonuçların tamamı önceden hesaplandı, sayfa motora istek göndermiyor.
Genel müşteri anketi (sentetik)
Üç yüz yanıtlayıcılı geniş bir anket: iki ve üç kategorili gruplayıcılar, sürekli ölçümler, beşli sıralı ölçek, iki kategorili satın alma sonucu, dört kategorili marka tercihi, üç tekrarlı ölçüm, eşleştirilmiş ikili sorular, üç kodlayıcı, dört fiyat sorusu ve kasıtlı olarak boş bırakılmış hücreler.
- Satır sayısı
- 300
- Sütunlar
- katilimci_no, cinsiyet, egitim_duzeyi, bolge, yas, gelir, memnuniyet, hizmet_puani, fiyat_puani, kalite_puani, baglilik, tavsiye_skoru, satin_aldi, marka_tercihi, memnuniyet_duzeyi, on_puan, son_puan, olcum_1, olcum_2, olcum_3, kullanim_once, kullanim_sonra, kullanim_izleme, kodlayici_1, kodlayici_2, kodlayici_3, fiyat_cok_ucuz, fiyat_ucuz, fiyat_pahali, fiyat_cok_pahali, geri_bildirim_puani, izleme_puani
Veri sentetiktir: gerçek bir araştırmadan değil, sabit bir tohumla üretildi. Aşağıdaki değerleri analiz motoru bu dosyayı çözümleyerek üretti; aynı dosyayı panele yükleyince aynı sonuçları görürsünüz.
Araştırma sorusu: Satın alma olasılığını memnuniyet ve gelir yorduyor mu?
- Bağımlı değişken
- satin_aldi
- Bağımsız değişkenler
- memnuniyet,gelir
- Sözde R kare (McFadden)
- 0,103
- Log olabilirlik
- -186,44
- Geçerli gözlem sayısı
- 300
- Yordayıcı sayısı
- 2
- Akaike bilgi ölçütü (AIC)
- 378,89
- Bayes bilgi ölçütü (BIC)
- 390,00
- Kestirim yakınsadı
- Evet
- Serbestlik derecesi
- 297
- dependent_var
- satin_aldi
Katsayılar
- Sabit terim
- -4,72
- memnuniyet
- 0,730
- gelir
- 0,021
Odds oranları
- Sabit terim
- 0,009
- memnuniyet
- 2,08
- gelir
- 1,02
p değerleri
- Sabit terim
- < 0,001
- memnuniyet
- < 0,001
- gelir
- 0,005
Bağımlı değişkenin 0/1 kodlaması
- 0
- 0
- 1
- 1
Hesaplama künyesi: scipy 1.18.0 · statsmodels 0.14.6 · scikit-learn 1.9.0 · numpy 2.5.1 · pandas 3.0.5 · semopy 2.3.11 · 89fc29a · Veri tohumu: 20260914
Sonuç nasıl raporlanır?
Lojistik regresyonda yenileme olasılığını memnuniyet (OR = 1,12, p < 0,001) ve destek talebi sayısı (OR = 0,78, p = 0,010) yordadı; model McFadden sözde R kare = 0,18 ile uyum gösterdi (n = 480).
APA düzenine yakın örnek cümle; sayılar temsilidir.
Ne zaman kullanılmamalıdır?
- Sınıflama tablosu, ROC eğrisi ve AUC hesaplanmadığı için modelin yordama başarımı panelde değerlendirilemez; elde yalnız olabilirliğe dayanan uyum göstergeleri kalır.
- Hosmer-Lemeshow gibi bir uyum iyiliği sınaması bulunmaz, dolayısıyla öngörülen ve gözlenen oranların dilimler düzeyinde örtüşüp örtüşmediği görülemez.
- Çoklu bağlantı için hiçbir ölçüt döndürülmez; örtüşen yordayıcıların yol açtığı kararsızlık sonuç ekranında belirti vermez.
- Katsayılar ve bahis oranları aralıksız raporlanır; yayınların çoğunun istediği yüzde 95 bahis oranı aralığı panel dışında hesaplanmak zorundadır.
- Olağan kestirim başarısız olduğunda devreye giren düzenlileştirilmiş yol p değerlerini sayı olmayan değerlere düşürebilir; bu koşularda anlamlılık yorumu yapılmamalıdır.
- Sonuç üç ya da daha çok kategoriliyse ya da kategoriler sıralıysa bu model uygun değildir; kategorileri zorla ikiye indirmek bilgi kaybı yaratır.
Varsayımlar karşılanmazsa kullanılabilecek yöntemler
- Ki-Kare Bağımsızlık TestiNeden: Yordayıcı da kategorikse ve soru iki kategorik değişkenin ilişkili olup olmadığıysa; çapraz tablo üzerinden daha sade bir yanıt verir.
- Doğrusal Regresyon (OLS)Neden: Sonuç değişkeni iki değerli değil sürekliyse; katsayılar doğrudan ölçek biriminde yorumlanır.
- Sıralı Lojistik RegresyonNeden: Sonuç kategorileri sıralıysa (hiç memnun değil, az, orta, çok); sıralama bilgisi ikiye indirgemeyle harcanmaz.
- Çok Sınıflı Lojistik RegresyonNeden: Sonuç ikiden çok ve sırasız kategoriden oluşuyorsa (A, B, C markalarından hangisinin seçildiği).
Sık sorulan sorular
- Bahis oranını nasıl okurum?
- Bahis oranı, yordayıcıda bir birimlik artışın olayın bahsini kaç katına çıkardığını söyler. 1,25 bahsin yüzde 25 arttığı, 0,80 yüzde 20 azaldığı anlamına gelir; tam olarak 1 etkisizlik demektir. İki noktaya dikkat edin: değer bahis hakkındadır, olasılık hakkında değil, ve yönü sonuç değişkeninin hangi değerinin 1 kodlandığına bağlıdır. Kodlamayı sonuçtaki kodlama bölümünden doğrulamadan yönü yorumlamayın.
- p değerleri boş ya da sayı olmayan değer olarak geldi, ne oldu?
- Bu, olağan kestirimin yakınsamadığı ve motorun düzenlileştirilmiş kestirime geçtiği anlamına gelir. Genellikle arkasında şu nedenlerden biri vardır: bir yordayıcı sonucu neredeyse kusursuz ayırıyordur, yordayıcılar birbirini yineliyordur ya da az görülen sonuç kategorisindeki gözlem sayısı yordayıcı sayısına göre çok azdır. Çözüm p değerini zorlamak değil modeli sadeleştirmektir: yordayıcı sayısını azaltın, örtüşen sütunları birleştirin ve sonuç değişkeninin dağılımına bakın.
- Modelin doğru sınıflama oranını nereden görebilirim?
- Bu yöntemde sınıflama tablosu, duyarlılık, seçicilik ve AUC hesaplanmaz; panel yalnız olabilirliğe dayanan uyum ölçülerini döndürür. Sınıflama başarımı araştırma sorunuzun merkezindeyse katsayıları kullanarak öngörüleri kendiniz üretmeniz ya da bu işi başka bir araçta yapmanız gerekir. Sözde R kare değerini doğru sınıflama yüzdesi gibi yorumlamak yaygın bir yanlıştır.
- Kaç gözleme ihtiyacım var?
- Belirleyici olan toplam satır sayısı değil, az görülen sonuç kategorisindeki gözlem sayısıdır. Yordayıcı başına en az 10 olay yaygın bir alt sınır olarak anılır; 500 kişilik bir örneklemde olay yalnız 30 kez gerçekleşmişse iki ya da üç yordayıcıdan fazlasını modele koymak katsayıları abartır. Panel bu oranı denetlemediği için hesabı kendiniz yapmanız gerekir.
Kaynaklar
- Hosmer, D. W., Lemeshow, S., & Sturdivant, R. X. (2013). Applied Logistic Regression
- Field, A. (2018). Discovering Statistics Using IBM SPSS Statistics
- Tabachnick, B. G., & Fidell, L. S. (2019). Using Multivariate Statistics
- statsmodels Logit belgeleri
Kendi verinizle deneyin
Ücretsiz planda ayda 50 analiz koşusu vardır; kart istenmez.