Grup karşılaştırma

Eşleştirilmiş Örneklem t-Testi

Aynı kişilerden ya da eşleştirilmiş çiftlerden alınan iki ölçümün ortalamasını karşılaştırır; testin üzerinde çalıştığı birim her çiftin fark puanıdır.

Yöntem özeti

Eşleştirilmiş örneklem t-testi iki ayrı grubu değil, iki ölçümü karşılaştırır. Her satırda aynı kişiye (ya da eşleştirilmiş bir çifte) ait iki değer bulunur; test önce her çift için farkı alır, sonra bu fark puanlarının ortalamasının sıfırdan ayrılıp ayrılmadığını sınar. Kişiler arası değişkenlik fark alınırken sadeleştiği için aynı örneklem büyüklüğünde bağımsız örneklem t-testinden daha duyarlıdır: ölçümler birbiriyle yüksek ilişkili olduğunda küçük ortalama değişimler bile ayırt edilebilir hâle gelir. YouReply Nicel Analiz bu yöntemde iki sütun ister, gruplama sütunu sormaz; sonuçta t değeri, n - 1 serbestlik derecesi, ortalama fark, fark puanlarının standart sapması, çift sayısı ve her iki sütunun betimleyicileri yer alır. Varsayım denetimi yapılmaz: varyans homojenliği bu tasarımda anlamsızdır, fark dağılımının normalliği ise otomatik sınanmaz.

Hangi araştırma sorularında kullanılır?

  • Altı haftalık bir programın öncesinde ve sonrasında ölçülen bilgi puanı ortalaması değişti mi?
  • Aynı katılımcılara gösterilen iki ambalaj tasarımından biri daha yüksek beğeni puanı aldı mı?
  • Reklam filmi gösterilmeden önce ve gösterildikten sonra ölçülen marka güveni farklılaştı mı?
  • Katılımcılar kendi kurumlarına verdikleri puanla sektörün geneline verdikleri puan arasında sistematik bir fark bırakıyor mu?

Ne zaman kullanılmalıdır?

  • Her katılımcıdan aynı ölçeğe ait iki ölçüm alındığında (önce-sonra, iki zaman noktası, iki uyarıcı).
  • Katılımcılar bağımsız değil eşleştirilmiş olduğunda: evli çiftler, kardeşler, eşleştirilmiş deney-kontrol ikilileri.
  • İlgilenilen nicelik grup ortalamaları arasındaki fark değil, kişi içindeki ortalama değişim olduğunda.
  • İki ölçüm aynı birimde ve aynı ölçekle alındığında; fark puanının yorumlanabilir olması buna bağlıdır.

Gerekli değişken türleri

  • İki sürekli sütun: her ikisi de sayısal ve Değişken sekmesinde ölçek düzeyi 'scale' olarak işaretli olmalı.
  • Veri geniş biçimde durmalı: bir satır bir katılımcı, iki ölçüm iki ayrı sütun. Ölçümlerin alt alta yazıldığı uzun biçim bu yöntemde kullanılamaz.
  • Gruplama sütunu gerekmez; yöntemin bağımsız değişkeni yoktur, karşılaştırma iki sütun arasında yapılır.

Temel varsayımlar

Çiftlerin doğru eşleşmesi
Bir satırdaki iki değer gerçekten aynı kişiye ya da aynı eşleştirilmiş çifte ait olmalıdır. Satırlar kayarsa test hâlâ bir sayı üretir ama ürettiği sayının araştırma sorusuyla ilgisi kalmaz.
Fark puanlarının normalliği
Normallik beklentisi iki ölçümün kendi dağılımlarında değil, çiftlerin fark puanlarının dağılımındadır. Çift sayısı büyüdükçe (kabaca 30 ve üzeri) ihlale tolerans artar; asıl sorun güçlü çarpıklık ve birkaç uç fark puanıdır.
Çiftlerin birbirinden bağımsızlığı
Bir çiftin içindeki iki ölçüm bağımlıdır, zaten test bunun için kullanılır; ancak çiftler birbirinden bağımsız olmalıdır. Aynı sınıftan, aynı hanehalkından gelen çiftler bu koşulu zedeler.
Ölçümlerin sürekli ve aynı ölçekte olması
Fark puanının ortalaması ancak iki ölçüm aynı aralık düzeyinde ölçekte alındığında yorumlanabilir. Farklı ölçeklerden alınmış iki puanın farkı anlamlı bir nicelik vermez.

YouReply bu varsayımları nasıl kontrol eder?

  • Çiftlerin doğru eşleşmesi: Panel iki sütunu satır sırasına göre eşler ve satırların aynı kişiye ait olup olmadığını denetlemez. Eşleşmeyi Veri sekmesindeki tabloda, tercihen bir kimlik sütunu görünür bırakarak kendiniz doğrulayın.
  • Fark puanlarının normalliği: Bu yöntem hiçbir varsayım testi çalıştırmaz; fark dağılımı otomatik sınanmaz. Normallik testleri ayrı bir yöntem olarak sunulduğu için, önce iki sütunun farkını Değişken sekmesindeki türetilmiş sütun kuralıyla oluşturup o sütun üzerinde normallik testini çalıştırabilirsiniz.
  • Çiftlerin birbirinden bağımsızlığı: Panel bu varsayımı otomatik denetlemez; değerlendirme araştırmacıya aittir.
  • Ölçümlerin sürekli ve aynı ölçekte olması: Yöntem seçici bu iki alan için sayısal sütun arar; uymayan sütun seçildiğinde yöntem soluk görünür, gerekçesi düz bir cümleyle yazılır ve seçme düğmesi kapalı kalır. 'Veri koşulları' kutusu hangi sütunlarınızın koşulu karşıladığını listeler.

Analiz nasıl yürütülür?

  1. 1Verinizi CSV ya da Excel olarak sürükleyip panele bırakın; iki ölçüm yan yana iki sütun olarak durmalıdır.
  2. 2Veri sekmesindeki tabloda satırları gözden geçirin: her satırın iki değeri aynı katılımcıya ait olmalı, çiftlerden biri eksikse o satırın analize ne şekilde gireceğine karar verin.
  3. 3Değişken sekmesinde iki sütunun da sayısal olduğunu ve ölçek düzeylerinin doğru işaretlendiğini doğrulayın; eksik veri kodlarını burada tanımlayın.
  4. 4Analiz sekmesinde yöntem seçiciyi açın; arama kutusuna yöntemin adını yazın ya da 'Yalnız verime uyanlar' anahtarını açıp listeyi süzün.
  5. 5Parametre formunda birinci ve ikinci sütunu seçin, gerekiyorsa iki yönlü yerine tek yönlü sınamayı işaretleyin; ortalama farkın işareti hangi sütunun yüksek olduğunu gösterir.
  6. 6Analizi çalıştırın ve sonuçları katlanabilir bölümlerden okuyun; grup ortalamaları grafiğini PNG, tabloların tümünü Excel olarak indirin, hesaplama künyesi kartından kullanılan kütüphane çağrısını ve sürümünü not edin.

Üretilen istatistikler ve tablolar

t istatistiği ve serbestlik derecesi
Serbestlik derecesi çift sayısının bir eksiğidir (n - 1); katılımcı sayısı değil, tam ölçüm çifti sayısı esas alınır.
Anlamlılık (p) değeri
Sonuç satırının başlığı sınamanın iki yönlü mü tek yönlü mü yapıldığını belirtir; yönü parametre formunda değiştirirseniz başlık da değişir.
Ortalama fark ve fark puanlarının standart sapması
Çiftlerin fark puanlarının ortalaması ile standart sapması ayrı satırlarda verilir; etki büyüklüğü de bu ikisinden türetilir.
Çift sayısı
Analize giren tam ölçüm çifti sayısı. Bu sayı beklediğinizden küçükse bir sütunda eksik değer var demektir.
İki sütunun betimleyicileri
Her ölçüm için ortalama, ortanca, mod ve standart sapma; iki ölçümün düzeyini fark puanından bağımsız olarak okumanızı sağlar.
Grup ortalamaları grafiği
İki ölçümün ortalamasını karşılaştıran çubuk grafik sonuç tablolarının üstünde çizilir ve PNG olarak indirilebilir.

Etki büyüklüğü ve güven aralığı

Cohen's d (dz)
Panel bu değeri Cohen's d adıyla raporlar, ancak hesabı ortalama farkın fark puanlarının standart sapmasına bölünmesine dayanır; yani literatürde dz denen içsel etki büyüklüğüdür. 0,20 küçük, 0,50 orta, 0,80 büyük biçimindeki alışılmış eşikler yol gösterir, ama dz iki ölçüm arasındaki ilişki güçlendikçe büyür; bu yüzden gruplar arası d ile doğrudan karşılaştırılamaz ve raporda hangi sürümün kullanıldığı belirtilmelidir.

Bu yöntem ortalama fark için güven aralığı döndürmez. Panelde güven aralığı hesaplanan tek yöntem tek örneklem t-testidir; orada da aralık ortalama fark için ve sabit %95 düzeyinde verilir. Etki büyüklüğü burada tek bir nokta tahmini olarak raporlanır. Dergi güven aralığı istiyorsa sonuç tablosundaki ortalama fark, fark puanlarının standart sapması ve çift sayısı bu hesabı elle yapmanıza yeter; panel sizin yerinize yapmaz.

Örnek araştırma sorusu ve örnek sonuç

Aşağıdaki sayılar temsili bir örnektir; gerçek bir araştırmanın ya da gerçek bir kullanıcının verisi değildir.

Araştırma sorusu
Temsili örnek: Bir reklam testi araştırmasında aynı katılımcılara film gösterilmeden önce ve gösterildikten sonra marka güveni (0-100) sorulmuştur. Güven düzeyi değişti mi?
Değişkenler
Birinci ölçüm: film öncesi marka güveni puanı (sürekli) · İkinci ölçüm: film sonrası marka güveni puanı (sürekli) · Eşleştirme birimi: katılımcı; bir satır bir kişinin iki ölçümü
Örnek sonuç
96 tam çift analize girdi. Film öncesi ortalama 62,5 (SS = 11,2); film sonrası ortalama 66,3 (SS = 10,8). Fark puanlarının ortalaması 3,8 ve standart sapması 8,6: t(95) = 4,33, p < 0,001, dz = 0,44.
Yorum
Ortalama güven puanı film sonrasında 3,8 puan yüksek ve bu fark sıfır hipotezi altında kolayca açıklanabilecek büyüklükte değil. Fark puanlarının standart sapması (8,6) ortalama farkın iki katından fazla olduğu için değişim herkes için aynı yönde değildir: grup ortalaması artarken bir kısım katılımcının puanı düşmüş olabilir. dz = 0,44 orta düzeye yakın bir içsel etkiye işaret eder; tek ölçümlük bir reklam testinde bu farkın satın alma davranışına yansıyıp yansımadığı bu testten okunamaz.

Örnek veri setiyle gerçek çıktı

Aşağıdaki sonuçları analiz motoru bu veri dosyasını çözümleyerek üretti. Değişkeni değiştirdiğinizde araştırma sorusu da değişiyor; sonuçların tamamı önceden hesaplandı, sayfa motora istek göndermiyor.

Eğitim yöntemi denemesi (sentetik)

Yüz elli katılımcının üç eğitim koluna atandığı varsayılan bir deneme. Ön test ve son test yüz puan üzerinden, çalışma saati sürekli ölçüm. Aynı kişinin iki ölçümü olduğu için eşleştirilmiş karşılaştırma da yapılabiliyor.

Satır sayısı
150
Sütunlar
katilimci_no, egitim_kolu, on_test, son_test, calisma_saati
Veri setini CSV olarak indir

Veri sentetiktir: gerçek bir araştırmadan değil, sabit bir tohumla üretildi. Aşağıdaki değerleri analiz motoru bu dosyayı çözümleyerek üretti; aynı dosyayı panele yükleyince aynı sonuçları görürsünüz.

Araştırma sorusu: Aynı katılımcıların puanı eğitimden sonra yükseldi mi?

Birinci değişken
on_test
İkinci değişken
son_test
t değeri
-10,59
p değeri (iki yönlü)
< 0,001
Serbestlik derecesi
149
Cohen d
-0,865
Ortalama fark
-6,66
Fark puanlarının standart sapması
7,70
Eşleşen gözlem
150

Birinci ölçüm

Ortalama
52,48
Ortanca
52,05
Standart sapma
8,40

İkinci ölçüm

Ortalama
59,14
Ortanca
59,80
Standart sapma
10,88

Hesaplama künyesi: scipy 1.18.0 · statsmodels 0.14.6 · scikit-learn 1.9.0 · numpy 2.5.1 · pandas 3.0.5 · semopy 2.3.11 · 89fc29a · Veri tohumu: 20260913

Sonuç nasıl raporlanır?

Marka güveni film gösterildikten sonra (M = 66,3, SS = 10,8) gösterilmeden önceki düzeyinden (M = 62,5, SS = 11,2) anlamlı biçimde yüksekti, t(95) = 4,33, p < 0,001, dz = 0,44.

APA düzenine yakın örnek cümle; sayılar temsilidir.

Ne zaman kullanılmamalıdır?

  • Üç ve daha fazla tekrarlı ölçüm varsa kullanılmaz; ölçümleri ikili ikili sınamak birinci tip hatayı büyütür, bu tasarımda tekrarlı ölçümler ANOVA gerekir.
  • Farklı kişilerden oluşan iki grubu karşılaştırmak için kullanılmaz; eşleştirme yokken fark puanı tanımlanamaz.
  • Çift sayısı küçükken fark dağılımı belirgin çarpıksa ya da birkaç uç fark puanı varsa sonuç yanıltıcı olur; bu durumda sıralamaya dayanan bir test daha güvenlidir.
  • Katılımcıların bir kısmı ikinci ölçümü bırakmışsa geriye kalan tam çiftler seçkisiz olmayan bir alt örneklemdir; kayıp tesadüfi değilse ortalama fark yanlıdır.
  • İki ölçüm tek bir Likert maddesiyle alınmışsa fark puanının ortalaması tartışmalı bir niceliktir.
  • Test ortalama değişimi ölçer, değişimin nedenini göstermez; araya giren zaman, öğrenme ve sıra etkileri tasarımla denetlenmelidir.

Varsayımlar karşılanmazsa kullanılabilecek yöntemler

  • Wilcoxon İşaretli Sıralar TestiNeden: Fark puanlarının dağılımı normallikten belirgin biçimde ayrılıyorsa ya da ölçümler sıralıysa; işaretli sıralar üzerinden çalışır.
  • Tekrarlı Ölçümler ANOVANeden: Aynı kişilerden üç ya da daha fazla ölçüm alınmışsa; bütün ölçümleri tek bir sınamada değerlendirir.
  • Bağımsız Örneklem t-TestiNeden: Karşılaştırılan iki ölçüm farklı kişilerden geliyorsa; eşleştirme olmayan tasarımın testi budur.
  • Tek Örneklem t-TestiNeden: Elinizde tek bir sütun varsa ve onu kuramsal bir ölçütle karşılaştıracaksanız; ortalama farkın %95 güven aralığını da verir.

Sık sorulan sorular

Verim eşleştirilmiş mi bağımsız mı, nasıl karar vereceğim?
Ölçüt satırın ne anlama geldiğidir. Bir satırda aynı kişinin iki değeri varsa tasarım eşleştirilmiştir ve bu testi kullanırsınız. Bir satır bir kişiyi temsil ediyor, hangi gruba ait olduğu ayrı bir sütunda yazıyorsa tasarım bağımsızdır ve bağımsız örneklem t-testine geçmeniz gerekir. İki ölçüm farklı kişilerden geliyor ama kuramsal olarak eşleştirilmişse (kardeşler, eşleştirilmiş deney-kontrol ikilileri) bu test yine uygundur.
Fark puanları normal dağılmıyorsa panel beni uyarır mı?
Uyarmaz. Bu yöntem hiçbir varsayım denetimi çalıştırmaz; bağımsız örneklem t-testinde gördüğünüz Levene bloğunun karşılığı burada yoktur. Dağılıma bakmak isterseniz Değişken sekmesindeki türetilmiş sütun kuralıyla fark sütununu oluşturup normallik testini ayrıca çalıştırın. Dağılım güçlü çarpıksa Wilcoxon işaretli sıralar testi daha uygun olur.
Etki büyüklüğü neden bağımsız örneklem t-testindekinden büyük çıkıyor?
Çünkü bölen farklıdır. Burada ortalama fark, fark puanlarının standart sapmasına bölünür; iki ölçüm birbiriyle ne kadar ilişkiliyse fark puanlarının yayılımı o kadar küçülür ve aynı ortalama fark daha büyük bir değer üretir. Bu nicelik dz olarak adlandırılır ve gruplar arası d ile aynı ölçekte değildir; iki araştırmayı karşılaştırırken hangisinin hangi sürümü raporladığına bakın.
Bazı katılımcıların ikinci ölçümü eksik, ne olur?
Test yalnız tam çiftler üzerinden çalışır, dolayısıyla sonuçtaki çift sayısı toplam katılımcı sayısından küçük olabilir. Bu sayıyı her koşuda kontrol edin: beklediğinizden belirgin biçimde düşükse kayıp veri örüntüsünü incelemeden ortalama farkı yorumlamayın, çünkü analiz yalnız ikinci ölçümü tamamlayanları temsil eder.

Kaynaklar

  • Field, A. (2018). Discovering Statistics Using IBM SPSS Statistics
  • Cohen, J. (1988). Statistical Power Analysis for the Behavioral Sciences
  • Lakens, D. (2013). Calculating and Reporting Effect Sizes to Facilitate Cumulative Science: A Practical Primer for t-tests and ANOVAs
  • scipy.stats.ttest_rel belgeleri

Kendi verinizle deneyin

Ücretsiz planda ayda 50 analiz koşusu vardır; kart istenmez.