Betimsel

Betimsel İstatistikler

Veri kümesindeki her sütunu tek bir özet satıra indirir: sayısal sütunlarda merkez ve yayılım ölçüleri, metin sütunlarında geçerli yanıt ve kategori sayıları.

Yöntem özeti

Betimsel istatistikler, elinizdeki yanıt dosyasının ne içerdiğini çıkarım yapmadan anlatır. Sayısal her sütun için geçerli gözlem sayısı, ortalama, medyan, mod, standart sapma, en küçük ve en büyük değer ile alt ve üst çeyrek değerleri hesaplanır; bu sekiz sayı bir dağılımın nereye toplandığını, ne kadar yayıldığını ve hangi sınırlar arasında kaldığını birlikte gösterir. Metin ya da kategori içeren sütunlar için ayrı bir özet üretilir: kaç geçerli yanıt var, kaç farklı değer görülüyor, en sık verilen yanıt hangisi ve kaç kez tekrarlanıyor. Özetin başında veri kümesinin satır ve sütun sayısı ile sütun adlarının listesi yer alır, böylece dosyanın panele beklediğiniz biçimde açıldığını ilk bakışta görürsünüz. Burada hiçbir hipotez sınanmaz; bu yöntem, sınama yapılacak yöntemlerin öncesinde veriyi tanıma adımıdır.

Hangi araştırma sorularında kullanılır?

  • Yüklediğim yanıt dosyasında hangi sütunlar sayısal okunmuş, hangileri metin olarak kalmış?
  • Memnuniyet puanlarının ortalaması ile medyanı birbirinden ne kadar uzak, yani dağılım çarpık mı?
  • Katılımcıların yaş aralığı gerçekten örneklem planında öngörülen sınırlar içinde mi?
  • Hangi ölçek maddesinde yanıtlar geniş biçimde dağılmış, hangisinde herkes aynı noktaya yığılmış?

Ne zaman kullanılmalıdır?

  • Her analizin ilk adımı olarak; veri dosyası panele açıldıktan hemen sonra sütunların doğru türde okunduğunu görmek için.
  • Rapor ve tezlerin örneklem tanıtımı bölümünde yer alan özet tabloyu üretmek gerektiğinde.
  • Bir ölçek maddesinde taban ya da tavan etkisi olup olmadığını anlamak için; çeyrek değerlerin ölçeğin ucuna dayanması bunun işaretidir.
  • Ortalama ile medyan arasındaki uzaklığa bakarak parametrik bir testin makul olup olmadığına dair ilk izlenimi edinmek istediğinizde.
  • Veri girişi hatalarını yakalamak için; en küçük ya da en büyük değerin ölçeğin dışına çıkması neredeyse her zaman kodlama hatasıdır.

Gerekli değişken türleri

  • Sayısal sütunlar tam özeti alır: ölçek toplam puanları, süreler, tutarlar, yaş gibi aralık ve oran düzeyindeki sütunlar.
  • Metin ve kategori sütunları için merkez ölçüleri hesaplanmaz; bunlar yerine geçerli yanıt sayısı, farklı değer sayısı ve en sık yanıt raporlanır.
  • Sıralı bir ölçekte ortalama hesaplanabilir ancak basamaklar arası uzaklığın eşit olduğu varsayımını gerektirir; tek bir Likert maddesinde medyan ve mod daha güvenli okumalardır.
  • Yöntem sütun seçmez, veri kümesinin tamamını özetler; bu yüzden katılımcı kimliği ya da zaman damgası gibi sayısal görünen teknik sütunlar da özet tabloda yer alır.

Temel varsayımlar

Sütun türlerinin doğru tanımlanmış olması
Sayı olarak ele alınması gereken bir sütun metin olarak okunduysa ortalama ve yayılım ölçüleri hiç hesaplanmaz, sütun kategori özetine düşer. Bunun en sık nedeni ondalık ayırıcının virgül olması ya da hücrelerde birim yazısının bulunmasıdır.
Kayıp değer kodlarının bildirilmiş olması
99 ya da -1 gibi kayıp değer kodları sayı olarak kaldığı sürece ortalamaya ve yayılıma karışır; böyle bir kod ortalamayı ve en büyük değeri görünür biçimde bozar.
Ortalamanın anlamlı bir özet olması
Belirgin biçimde çarpık dağılımlarda ya da birkaç çok uzak değerin bulunduğu sütunlarda ortalama tipik katılımcıyı temsil etmez. Böyle sütunlarda medyan ve çeyrek değerler dağılımı daha dürüst anlatır.
Gözlemlerin tek bir topluluktan gelmesi
Özet, veri kümesinin bütünü üzerinden alınır. İki farklı alt örneklem aynı dosyada birleştirilmişse, birleşik ortalama iki grubun hiçbirini tanımlamayan bir ara değer olabilir.

YouReply bu varsayımları nasıl kontrol eder?

  • Sütun türlerinin doğru tanımlanmış olması: Değişken sekmesi her sütunun türünü ve ölçüm düzeyini gösterir, gerektiğinde orada değiştirilir. Yöntemin kendisi bir tür denetimi yapıp uyarı üretmez; özet tablodaki bir sütunun beklediğiniz bölümde olup olmadığına sizin bakmanız gerekir.
  • Kayıp değer kodlarının bildirilmiş olması: Kayıp değer kodları Değişken sekmesinde tanımlanır. Yöntem, olağandışı bir değerin kayıp kodu olabileceğini kendiliğinden sezmez.
  • Ortalamanın anlamlı bir özet olması: Bu değerlendirme için bir sınama çalıştırılmaz. Ortalama ile medyanın özet tabloda yan yana bulunması, aradaki farkı gözle karşılaştırmanızı sağlar.
  • Gözlemlerin tek bir topluluktan gelmesi: Panel bu varsayımı otomatik denetlemez; değerlendirme araştırmacıya aittir.

Analiz nasıl yürütülür?

  1. 1Yanıt dosyanızı panelin yükleme alanına sürükleyin; CSV ya da XLSX dosyası Veri sekmesindeki düzenlenebilir ızgaraya açılır.
  2. 2Değişken sekmesinde sütun adlarını, etiketleri, türleri ve ölçüm düzeylerini gözden geçirin; sayı olması gereken sütunlar burada düzeltilir.
  3. 3Aynı sekmede kayıp değer kodlarını ve gerekiyorsa değer etiketlerini bildirin; ölçek toplamı gibi türetilmiş bir sütun da burada oluşturulur.
  4. 4Analiz sekmesinde yöntem seçiciden betimsel istatistikleri seçin; arama kutusunu ya da 'Yalnız verime uyanlar' anahtarını kullanabilirsiniz.
  5. 5Bu yöntemde doldurulacak bir parametre bulunmaz, çünkü özet veri kümesinin tamamı üzerinden alınır; doğrudan çalıştırın.
  6. 6Sonuçta önce ortalamaların ve standart sapmaların çubuk grafiklerine bakın, ardından açılır bölümlerdeki sayısal ve kategorik özet tablolarını okuyun.
  7. 7Tabloları Excel, grafikleri PNG olarak indirin; hesaplama künyesi kartı hangi kütüphane çağrısının ve hangi sürümün kullanıldığını yazar.

Üretilen istatistikler ve tablolar

Veri kümesinin boyutu
Satır sayısı, sütun sayısı ve sütun adlarının listesi. Dosyanın eksiksiz açıldığını doğrulamanın en hızlı yolu bu üç bilgidir.
Merkezî eğilim ölçüleri
Her sayısal sütun için ortalama, hemen ardından medyan ve mod. Üçünün birbirine yakın olması dağılımın bakışımlı olduğuna işaret eder.
Yayılım ölçüleri
Standart sapma ile en küçük ve en büyük değer. Standart sapma yanıtların ortalama çevresinde ne kadar dağıldığını, uç değerler ise kullanılan aralığın sınırlarını verir.
Çeyrek değerler
25. yüzdelik, medyan ve 75. yüzdelik birlikte okunduğunda katılımcıların orta yarısının hangi aralıkta toplandığını gösterir.
Kategorik sütun özeti
Sayısal olmayan her sütun için geçerli yanıt sayısı, farklı değer sayısı, en sık görülen değer ve o değerin kaç kez geçtiği.
Özet grafikleri
Sayısal sütunların ortalamalarını gösteren bir çubuk grafik ile standart sapmalarını gösteren ikinci bir çubuk grafik çizilir.

Etki büyüklüğü ve güven aralığı

Standart sapma
Bir etki büyüklüğü değil, yayılımın kendi birimiyle ifade edilen ölçüsüdür. Ortalamaya bölündüğünde elde edilen değişim katsayısı, farklı ölçeklerde ölçülmüş sütunların yayılımını karşılaştırmaya yarar. Bu yöntemde hiçbir hipotez sınanmadığı için standartlaştırılmış bir etki ölçüsü hesaplanmaz; gruplar arası bir fark ölçüsü istiyorsanız ilgili karşılaştırma yöntemini çalıştırmanız gerekir.
Çeyrekler arası aralık
Üst çeyrekten alt çeyreği çıkardığınızda kalan genişlik, uç değerlerden etkilenmeyen bir yayılım ölçüsüdür. Panel bu farkı ayrı bir alan olarak döndürmez, iki yüzdeliği özet tablodan okuyup kendiniz hesaplayabilirsiniz. Çarpık dağılımlarda standart sapmadan daha açıklayıcıdır.

Bu yöntem hiçbir güven aralığı döndürmez. Ortalama için standart hata ya da aralık hesaplanmaz, p değeri üretilmez ve hiçbir sınama çalıştırılmaz; dönen bütün sayılar eldeki örneklemin betimlemesidir. Ortalamanın evren değeri için aralık gerekiyorsa tek örneklem t-testini çalıştırmanız gerekir.

Örnek araştırma sorusu ve örnek sonuç

Aşağıdaki sayılar temsili bir örnektir; gerçek bir araştırmanın ya da gerçek bir kullanıcının verisi değildir.

Araştırma sorusu
Temsili bir abone memnuniyeti araştırmasında yanıt dosyası beklendiği gibi mi açıldı ve genel memnuniyet puanları nasıl dağılmış?
Değişkenler
Genel memnuniyet puanı, 0-100 arası (sürekli) · Katılımcı yaşı, yıl (sürekli) · Yaşadığı şehir (kategorik)
Örnek sonuç
Dosya 428 satır ve 12 sütun olarak açıldı. Genel memnuniyet puanında 415 geçerli değer var; ortalama 72,4, medyan 75,0, mod 80,0, standart sapma 16,8, en küçük değer 12, alt çeyrek 62,0, üst çeyrek 85,0, en büyük değer 100. Yaş sütununda 428 geçerli değer, ortalama 37,2 ve en büyük değer 69 olarak görünüyor. Şehir sütununda 428 geçerli yanıt içinde 18 farklı değer var; en sık verilen yanıt 131 kez tekrarlanıyor.
Yorum
Medyanın ortalamadan 2,6 puan yukarıda olması, memnuniyet dağılımının sola doğru hafif bir kuyruk taşıdığını, yani düşük puan veren küçük bir grubun ortalamayı aşağı çektiğini söylüyor. Katılımcıların orta yarısı 62 ile 85 arasında toplanmış; bu genişlik, tek bir ortalamayla anlatılan memnuniyetin aslında oldukça farklı yanıtları kapsadığını gösteriyor. Memnuniyet sütununda 13 yanıt eksik, bu yüzden sütunun gözlem sayısı dosyanın satır sayısından düşük. Mod olarak 80,0 görünmesi yanıtların onluk değerlere yuvarlanma eğiliminde olduğunu düşündürüyor; eşit frekanslı bir başka değer varsa özet tabloda görünmez. Bu sayılar temsilidir, gerçek bir araştırmanın sonucu değildir.

Örnek veri setiyle gerçek çıktı

Aşağıdaki sonuçları analiz motoru bu veri dosyasını çözümleyerek üretti. Değişkeni değiştirdiğinizde araştırma sorusu da değişiyor; sonuçların tamamı önceden hesaplandı, sayfa motora istek göndermiyor.

Genel müşteri anketi (sentetik)

Üç yüz yanıtlayıcılı geniş bir anket: iki ve üç kategorili gruplayıcılar, sürekli ölçümler, beşli sıralı ölçek, iki kategorili satın alma sonucu, dört kategorili marka tercihi, üç tekrarlı ölçüm, eşleştirilmiş ikili sorular, üç kodlayıcı, dört fiyat sorusu ve kasıtlı olarak boş bırakılmış hücreler.

Satır sayısı
300
Sütunlar
katilimci_no, cinsiyet, egitim_duzeyi, bolge, yas, gelir, memnuniyet, hizmet_puani, fiyat_puani, kalite_puani, baglilik, tavsiye_skoru, satin_aldi, marka_tercihi, memnuniyet_duzeyi, on_puan, son_puan, olcum_1, olcum_2, olcum_3, kullanim_once, kullanim_sonra, kullanim_izleme, kodlayici_1, kodlayici_2, kodlayici_3, fiyat_cok_ucuz, fiyat_ucuz, fiyat_pahali, fiyat_cok_pahali, geri_bildirim_puani, izleme_puani
Veri setini CSV olarak indir

Veri sentetiktir: gerçek bir araştırmadan değil, sabit bir tohumla üretildi. Aşağıdaki değerleri analiz motoru bu dosyayı çözümleyerek üretti; aynı dosyayı panele yükleyince aynı sonuçları görürsünüz.

Araştırma sorusu: Ankette ölçülen bütün değişkenlerin ortalaması, yayılımı ve çeyrekleri nedir?

Satır sayısı
300
Sütun sayısı
32

Sütun istatistikleri

Sütun istatistikleri
SatırGözlem sayısıOrtalamaOrtancaStandart sapmaEn küçük değerBirinci çeyrek (Q1)Ortanca (Q2)Üçüncü çeyrek (Q3)En büyük değer
katilimci_no300150,50150,5086,75175,75150,50225,25300
cinsiyet300--------
egitim_duzeyi300--------
bolge300--------
yas30037,47378,971931374461
gelir30045,4142,0517,0912,6033,4042,0555,88114
memnuniyet3005,245,300,9602,804,505,3067
hizmet_puani3004,664,601,001,703,984,605,407
fiyat_puani3004,104,101,1813,304,104,907
kalite_puani3004,594,701,0623,884,705,307
baglilik3005,385,901,7114,505,9077
tavsiye_skoru3007,3471,73267910
satin_aldi3000,51710,50100111
marka_tercihi300--------
memnuniyet_duzeyi3003,6040,89613445
on_puan30053,6554,309,1227,5048,0854,306076,10
son_puan30059,4459,8512,0424,9051,9559,8567,8094
olcum_13003,443,500,99412,603,504,136,10
olcum_23003,873,951,21133,954,707
olcum_33004,284,251,3713,404,255,207
kullanim_once3000,30300,46000011
kullanim_sonra3000,55310,49800111
kullanim_izleme3000,58710,49300111
kodlayici_13002,4021,1111234
kodlayici_23002,5331,1311344
kodlayici_33002,5121,0812234
fiyat_cok_ucuz30067,276713,9321586778107
fiyat_ucuz30089,949015,25388090100130
fiyat_pahali300128,5612918,8665116129140,25195
fiyat_cok_pahali300169,5217023,20101156170185224
geri_bildirim_puani2554,1041,1413,40456,80
izleme_puani2203,643,801,3212,703,804,706,40

Hesaplama künyesi: scipy 1.18.0 · statsmodels 0.14.6 · scikit-learn 1.9.0 · numpy 2.5.1 · pandas 3.0.5 · semopy 2.3.11 · 89fc29a · Veri tohumu: 20260914

Sonuç nasıl raporlanır?

Genel memnuniyet puanı ortalama 72,4 (SS = 16,8), medyan 75,0 ve çeyrekler arası aralık 62,0-85,0 olarak bulundu (n = 415).

APA düzenine yakın örnek cümle; sayılar temsilidir.

Ne zaman kullanılmamalıdır?

  • Hiçbir sınama yürütülmediği için bu yöntemle bir fark ya da ilişki iddiasında bulunulamaz; dönen sayılar yalnız eldeki örnekleme aittir.
  • Mod olarak yalnız ilk tepe değeri bildirilir; iki değer aynı sıklıkta en çok tekrarlanıyorsa ikincisi özet tabloda hiç görünmez ve dağılımın çift tepeli olduğu fark edilmez.
  • Özet sütun sütun alınır, sütunlar arasındaki birliktelik hakkında bilgi vermez; birlikte değişim için korelasyon matrisine ya da çapraz tabloya geçmek gerekir.
  • Kategori sütunlarında yalnız en sık görülen değer raporlanır, tam frekans dağılımı verilmez; bütün kategorilerin yüzdeleri gerektiğinde frekans dağılımı çalıştırılmalıdır.
  • Yöntem sütun seçimi almadığı için katılımcı kimliği gibi anlamı olmayan sayısal sütunlar da özetlenir; bu satırların yorumlanmaması okuyucunun sorumluluğundadır.
  • Ağırlıklı bir örneklemde özet ağırlıksız hesaplanır; temsiliyet düzeltmesi uygulanacaksa ağırlıklandırmanın ayrıca ele alınması gerekir.

Varsayımlar karşılanmazsa kullanılabilecek yöntemler

  • Frekans DağılımıNeden: Kategorik ya da kısa ölçekli sütunlarda bütün kategorilerin sayı ve yüzdelerini görmek gerektiğinde; en sık değerle yetinmez.
  • Normallik TestleriNeden: Dağılımın normalden sapıp sapmadığına gözle değil bir sınamayla karar vermek istediğinizde.
  • Aykırı Değer TespitiNeden: En küçük ve en büyük değerlerde şüpheli noktalar görünüyorsa, uç gözlemleri ölçütle belirlemek için.
  • Eksik Veri AnaliziNeden: Gözlem sayıları sütunlar arasında farklılaşıyorsa, eksikliğin hangi sütunlarda ve hangi oranda olduğunu görmek için.

Sık sorulan sorular

Yalnız belirli sütunların özetini alabilir miyim?
Bu yöntemde sütun seçme parametresi yoktur; özet veri kümesinin tamamı üzerinden alınır ve bütün sütunlar tabloya girer. İstemediğiniz sütunları rapordan çıkarmanın pratik yolu, tabloyu Excel olarak indirip orada süzmek ya da dosyayı yüklemeden önce gereksiz sütunları çıkarmaktır.
Ortalama ile medyan arasındaki fark ne kadar olursa dikkate değer?
Sabit bir eşik yoktur, farkı standart sapmayla birlikte okumak gerekir. Aradaki uzaklık standart sapmanın küçük bir bölümü kadarsa dağılım kabaca bakışımlı sayılabilir; fark standart sapmanın dörtte biri düzeyine çıktığında çarpıklık raporlamayı etkileyecek kadar belirginleşir ve medyanı da bildirmek yerinde olur.
Gözlem sayısı neden sütunlar arasında değişiyor?
Her sütunun gözlem sayısı o sütundaki geçerli değerlerden sayılır, dolayısıyla boş bırakılan ya da kayıp koduyla işaretlenen hücreler o sütunun sayısını düşürür. Atlanabilir soruların bulunduğu anketlerde bu olağandır. Farkın nereden geldiğini görmek için eksik veri analizini çalıştırabilirsiniz.
Bu tabloyu tez ya da yayında doğrudan kullanabilir miyim?
Tabloyu Excel olarak indirip kendi biçiminize taşıyabilirsiniz, ancak yayın kurallarının beklediği düzen genellikle sütun başına tek satır ve ondalık basamak sayısının tutarlı olmasıdır. Panelin ürettiği ondalıkları yuvarlamanız, gözlem sayısını her değişken için ayrı yazmanız ve ölçeğin kuramsal aralığını tablo notunda belirtmeniz beklenir.

Kaynaklar

  • Tukey, J. W. (1977). Exploratory Data Analysis
  • Wilkinson, L., & the Task Force on Statistical Inference (1999). Statistical Methods in Psychology Journals: Guidelines and Explanations
  • Altman, D. G., & Bland, J. M. (2005). Standard deviations and standard errors
  • pandas.DataFrame.describe belgeleri

Kendi verinizle deneyin

Ücretsiz planda ayda 50 analiz koşusu vardır; kart istenmez.