Küme analizi
Hiyerarşik Küme Analizi
Yanıtlayıcıları en benzer çiftlerden başlayarak adım adım birleştirir ve istediğiniz küme sayısında durarak her kümenin profilini verir.
Yöntem özeti
Hiyerarşik küme analizi kümeleri tek seferde kurmaz, kademe kademe inşa eder. Başlangıçta her yanıtlayıcı kendi başına bir kümedir; her adımda birbirine en yakın iki küme birleştirilir ve bu işlem bütün vakalar tek bir kümede toplanana kadar sürer. Hangi iki kümenin yakın sayılacağını bağlama ölçütü belirler: Ward ölçütü birleşmenin küme içi kareler toplamını en az artıracağı çifti seçer, tam bağlama iki kümenin en uzak üyelerine bakar, ortalama bağlama bütün üye çiftlerinin ortalama uzaklığını alır, tek bağlama ise en yakın üyeleri ölçüt sayar. Panel bu birleşme dizisini kurduktan sonra ağacı sizin verdiğiniz küme sayısında keser ve ortaya çıkan kümeleri betimler. Değişkenler varsayılan olarak standartlaştırılır. Çıktının omurgası profil tablosudur: küme başına değişken ortalamaları ve bunların genel ortalamadan sapması, kümelere ad vermenin dayanağıdır.
Hangi araştırma sorularında kullanılır?
- Görece küçük bir örneklemde yanıtlayıcılar kaç ayrı tipe ayrılıyor ve bu tipler hangi değişkenlerde ayrışıyor?
- Nitel aşamayı besleyecek üç ya da dört yanıtlayıcı profili çıkarabilir miyim?
- Kuramsal olarak beklediğim bölüm sayısı veride karşılık buluyor mu?
- Birleştirme ölçütünü değiştirdiğimde yanıtlayıcı bölümleri kararlı kalıyor mu?
Ne zaman kullanılmalıdır?
- Bölüm sayısı kuramdan, önceki araştırmadan ya da uygulama gereğinden geldiğinde; bu yöntemde küme sayısı her zaman parametredir.
- Kümeleme için en az iki sayısal değişken bulunduğunda; daha az değişkenle motor çalışmaz.
- Örneklem küçük ya da orta büyüklükte olduğunda, çünkü birleşme dizisi bütün vaka çiftlerinin uzaklığı üzerinden kurulur.
- Kümelerin küresel olmayabileceği durumlarda, çünkü bağlama ölçütünü değiştirerek farklı biçimlere duyarlılık sınanabilir.
- Aynı veride birkaç bağlama ölçütünü deneyip çıkan bölümlerin ne kadar kararlı olduğunu görmek istediğinizde.
Gerekli değişken türleri
- Kümeleme yalnız sayısal sütunlarla yürür ve en az iki sütun zorunludur; ölçüm düzeyi Değişken sekmesinde 'scale' olmalıdır.
- Sonuç değişkeni seçilmez; bütün değişkenler benzerlik hesabına eşit biçimde girer.
- Demografik kategorik sütunlar analizin girdisi olamaz, ancak çıkan kümelerin betimlenmesinde kullanılabilir.
- Her satır bir yanıtlayıcıdır; seçilen değişkenlerden birinde kayıp değeri bulunan satırlar analizden önce düşürülür.
Temel varsayımlar
- Benzerlik hesabının ölçeğe duyarlı olması
- Vakalar arası uzaklık bütün değişkenlerin katkısını toplar, dolayısıyla yayılımı büyük bir değişken ağaca kendi damgasını vurur.
- Birleşmelerin geri alınamaz olması
- İki küme bir kez birleştiğinde sonraki adımlarda ayrılmaz. Erken verilmiş yanlış bir birleşme kararı ağacın üst kademelerine taşınır ve son çözümde de kalır.
- Bağlama ölçütünün yapıya uygun olması
- Ward ölçütü benzer büyüklükte ve topak kümeler üretme eğilimindedir; tek bağlama uzun zincirler kurarak vakaları birer birer büyük kümeye ekleyebilir ve tek bir kalabalık küme ile birkaç küçük artık küme doğurabilir.
- Aykırı gözlemlerin bulunmaması
- Bütün vakaların bir kümeye yerleştirilmesi zorunludur, dolayısıyla uzakta duran gözlemler ya kendi başına küçük kümeler oluşturur ya da yakın bir kümeye eklenerek onun ortalamasını kaydırır.
- Değişken kümesinin dengeli olması
- Aynı yapıyı ölçen birkaç değişken analize girdiğinde benzerlik hesabı o yapıyı birden çok kez sayar ve birleşmeler onun etrafında şekillenir.
YouReply bu varsayımları nasıl kontrol eder?
- Benzerlik hesabının ölçeğe duyarlı olması: Standartlaştırma varsayılan olarak açıktır ve değişkenler birleşme dizisi kurulmadan önce aynı ölçeğe getirilir. Kapatılabilir, ancak bu durumda birim farkının sonucu ne kadar yönlendirdiğini değerlendirmek araştırmacıya düşer.
- Birleşmelerin geri alınamaz olması: Panel bu varsayımı otomatik denetlemez; değerlendirme araştırmacıya aittir.
- Bağlama ölçütünün yapıya uygun olması: Panel ölçüt seçimini denetlemez, seçtiğiniz ölçütü uygular. Küme boyutları sonuçta raporlandığı için zincirlenme belirtisi olan çok dengesiz bir boyut dağılımını oradan görebilirsiniz.
- Aykırı gözlemlerin bulunmaması: Bu yöntemde uç değer taraması yapılmaz. Tek ya da iki vakadan oluşan bir küme gördüğünüzde aykırı değer tespitini ayrıca koşmak yerinde olur.
- Değişken kümesinin dengeli olması: Değişkenler arası korelasyon bu yöntemde incelenmez. Madde havuzunu önce boyutlara indirmek için faktör analizi ya da temel bileşenler analizi ayrı yöntemler olarak sunulur.
Analiz nasıl yürütülür?
- 1Dosyanızı panele yükleyin; satırlar yanıtlayıcı, sütunlar değişken olmalıdır ve ilk satır değişken adlarını taşımalıdır.
- 2Değişken sekmesinde kümelemeye girecek sütunların ölçüm düzeyini 'scale' yapın, kayıp değer kodlarını tanımlayın ve gerekirse türetilmiş sütunlarla bileşik puanlar kurun.
- 3Analiz sekmesinde yöntem seçiciyi açın, arama kutusuna yöntem adını yazın ya da Küme Analizi kategorisinden seçin; 'Yalnız verime uyanlar' anahtarı açıkken uymayan yöntemler soluklaştırılır ve nedeni yazılır.
- 4Parametre formunda değişkenleri işaretleyin ve küme sayısını girin; alan varsayılan olarak 3 gelir ve bu yöntemde otomatik seçim yapılmaz.
- 5Bağlama ölçütünü seçin. Varsayılan Ward'dır; tam, ortalama ve tek bağlama da seçilebilir. Standartlaştırmayı açık bırakmanız önerilir.
- 6Koşuyu başlatın. Sonuçta küme boyutları, profil tablosu, kalite ölçüleri ve vaka başına küme etiketleri açılır kapanır bölümler hâlinde listelenir.
- 7Profil tablosundan kümeleri adlandırıp tabloları Excel olarak indirin. Bu yöntemde dendrogram çizilmediği için küme sayısı kararını farklı sayıları deneyip kalite ölçülerini karşılaştırarak vermeniz gerekir.
Üretilen istatistikler ve tablolar
- Çözümün künyesi
- Analize giren eksiksiz gözlem sayısı, kesme noktası olarak kullanılan küme sayısı ve uygulanan bağlama ölçütü.
- Küme boyutları
- Her kümeye düşen vaka sayısı ve oranı. Çok dengesiz bir dağılım, seçilen bağlama ölçütünün zincirlenmeye yol açtığına işaret eder.
- Küme profili tablosu
- Küme başına değişken ortalamaları ve bu ortalamaların genel ortalamadan sapması. Kümelerin içeriği bu sapmalardan okunur.
- Kalite ölçüleri
- Siluet puanı, Calinski-Harabasz ve Davies-Bouldin indeksleri. Hesaplanamadıkları durumda alan boş döner, yerine değer üretilmez.
- Vaka başına küme etiketi
- Her vakanın atandığı küme ve analizde tutulan satırların dizini. Etiketler kendi verinizle eşlenip sonraki analizlerde gruplama değişkeni olarak kullanılabilir.
- Kümeleme girdilerinin özeti
- Hangi değişkenlerin analize girdiği ve standartlaştırmanın açık mı kapalı mı olduğu. Birleşme uzaklıkları ve ağaç yapısı bu çıktının parçası değildir.
Etki büyüklüğü ve güven aralığı
- Siluet puanı
- Vakaların kendi kümesine yakınlığını en yakın komşu kümeye yakınlığıyla karşılaştıran ve eksi bir ile artı bir arasında değer alan ölçü. Çözümün ayrışma kalitesini yargılayan birincil sayıdır; bu yöntemde küme sayısını otomatik seçmeye yaramaz ama farklı küme sayılarını elle deneyip karşılaştırmanın ölçütüdür.
- Calinski-Harabasz indeksi
- Kümeler arası yayılımı küme içi yayılıma oranlar; yüksek değerler daha belirgin ayrışmaya karşılık gelir. Aynı veri üzerinde farklı küme sayılarını ya da farklı bağlama ölçütlerini karşılaştırmakta işe yarar, veri setleri arasında taşınamaz.
- Davies-Bouldin indeksi
- Kümelerin en çok benzedikleri komşularıyla örtüşmesinin ortalaması; burada küçük değerler iyidir. Aynı çözümde siluetin yüksek, Davies-Bouldin'in de düşük olması ayrışmanın iki ayrı ölçüyle desteklendiği anlamına gelir.
Bu yöntem güven aralığı döndürmez ve kümeler arasında anlamlılık sınaması yapmaz. Küme ortalamaları, sapmalar ve kalite ölçülerinin hepsi nokta tahminidir; standart hata da raporlanmaz. Kümeler verinin kendisinden türetildiği için aynı değişkenler üzerinde yapılacak bir sınama dairesel olur. Ayrıca birleşme uzaklıkları döndürülmediğinden, birleşmelerin hangi kademede hızlandığına bakarak küme sayısına karar verme yolu da bu çıktıyla kapalıdır. Kararlılığı değerlendirmenin pratik yolu küme sayısını ve bağlama ölçütünü değiştirip profil tablosunun aynı öyküyü anlatmaya devam edip etmediğine bakmaktır. Kümeler arası farkı sınamak gerekiyorsa kümelemeye girmemiş bir değişken seçilmelidir.
Örnek araştırma sorusu ve örnek sonuç
Aşağıdaki sayılar temsili bir örnektir; gerçek bir araştırmanın ya da gerçek bir kullanıcının verisi değildir.
- Araştırma sorusu
- Bir kurumsal itibar araştırmasında 180 yanıtlayıcı dört itibar boyutuna göre üç profile ayrılıyor mu? (Temsili örnek, gerçek veri değildir.)
- Değişkenler
- Güvenilirlik, yenilikçilik, sosyal sorumluluk ve çalışan memnuniyeti algısı: dördü de 1 ile 7 arası bileşik puan · 180 eksiksiz yanıt, küme sayısı 3, bağlama ölçütü Ward, standartlaştırma açık
- Örnek sonuç
- Kümeler 74 (yüzde 41,1), 63 (yüzde 35,0) ve 43 (yüzde 23,9) vaka içeriyor. Profil tablosunda birinci küme dört boyutta da genel ortalamanın üzerinde, en yüksek sapma güvenilirlikte (0,88); ikinci küme yenilikçilikte 1,04 puan üzerinde ama sosyal sorumlulukta 0,61 puan altında; üçüncü küme dört boyutta da ortalamanın altında, en düşük sapma çalışan memnuniyetinde (-1,19). Kalite ölçüleri siluet 0,41, Calinski-Harabasz 96,8, Davies-Bouldin 0,94. Aynı veri ortalama bağlamayla yeniden koşulduğunda boyutlar 71, 66 ve 43 oldu ve profil tablosu aynı kalıbı korudu.
- Yorum
- Üç küme itibar algısında birbirinden ayırt edilebiliyor: bütün boyutlarda olumlu bakan bir kitle, yenilikçiliği öne çıkarıp sosyal sorumlulukta çekinceli olan bir kitle ve genel olarak olumsuz bakan bir kitle. Siluetin 0,41 olması ayrışmanın orta düzeyde olduğunu, sınırların keskin olmadığını söyler. Bağlama ölçütü değiştirildiğinde küme boyutlarının yalnız birkaç vaka kayması ve profillerin korunması çözümün kararlı olduğu yönünde bir kanıttır ve bu karşılaştırma raporda belirtilmelidir. Üç kümenin seçilmesi veriden gelen bir karar değil, parametreden gelen bir tercihtir: ikili ve dörtlü çözümler de koşulup kalite ölçüleri karşılaştırılmalıdır, çünkü bu yöntem küme sayısını kendiliğinden aramaz.
Örnek veri setiyle gerçek çıktı
Aşağıdaki sonuçları analiz motoru bu veri dosyasını çözümleyerek üretti. Değişkeni değiştirdiğinizde araştırma sorusu da değişiyor; sonuçların tamamı önceden hesaplandı, sayfa motora istek göndermiyor.
Genel müşteri anketi (sentetik)
Üç yüz yanıtlayıcılı geniş bir anket: iki ve üç kategorili gruplayıcılar, sürekli ölçümler, beşli sıralı ölçek, iki kategorili satın alma sonucu, dört kategorili marka tercihi, üç tekrarlı ölçüm, eşleştirilmiş ikili sorular, üç kodlayıcı, dört fiyat sorusu ve kasıtlı olarak boş bırakılmış hücreler.
- Satır sayısı
- 300
- Sütunlar
- katilimci_no, cinsiyet, egitim_duzeyi, bolge, yas, gelir, memnuniyet, hizmet_puani, fiyat_puani, kalite_puani, baglilik, tavsiye_skoru, satin_aldi, marka_tercihi, memnuniyet_duzeyi, on_puan, son_puan, olcum_1, olcum_2, olcum_3, kullanim_once, kullanim_sonra, kullanim_izleme, kodlayici_1, kodlayici_2, kodlayici_3, fiyat_cok_ucuz, fiyat_ucuz, fiyat_pahali, fiyat_cok_pahali, geri_bildirim_puani, izleme_puani
Veri sentetiktir: gerçek bir araştırmadan değil, sabit bir tohumla üretildi. Aşağıdaki değerleri analiz motoru bu dosyayı çözümleyerek üretti; aynı dosyayı panele yükleyince aynı sonuçları görürsünüz.
Araştırma sorusu: Müşteriler algı puanlarına göre kademeli olarak birleştirildiğinde üç küme nasıl şekilleniyor?
- Çözümlenen değişkenler
- memnuniyet,hizmet_puani,fiyat_puani,kalite_puani,baglilik
- İstenen küme sayısı
- 3
- Birleştirme ölçütü
- ward
- Değişkenler standartlaştırılsın
- true
- Çözümlenen gözlem sayısı
- 300
- Küme sayısı
- 3
- linkage
- ward
- Değişkenler standartlaştırıldı
- Evet
Küme büyüklükleri
- 0
- 122
- 1
- 108
- 2
- 70
Küme profilleri
| Küme | Büyüklük | Oran | Küme ortalamaları | Genel ortalamadan sapma |
|---|---|---|---|---|
| 0 | 122 | 0,407 | - | - |
| 1 | 108 | 0,360 | - | - |
| 2 | 70 | 0,233 | - | - |
Kümeleme kalite ölçüleri
- Silüet skoru
- 0,147
- Calinski-Harabasz ölçütü (yüksek olması iyi)
- 58,10
- Davies-Bouldin ölçütü (düşük olması iyi)
- 1,82
Hesaplama künyesi: scipy 1.18.0 · statsmodels 0.14.6 · scikit-learn 1.9.0 · numpy 2.5.1 · pandas 3.0.5 · semopy 2.3.11 · 89fc29a · Veri tohumu: 20260914
Sonuç nasıl raporlanır?
Dört itibar boyutu standartlaştırıldıktan sonra 180 yanıtlayıcı Ward bağlamasıyla hiyerarşik küme analizine alındı ve üç kümeli çözüm incelendi (74, 63 ve 43 vaka; siluet 0,41).
APA düzenine yakın örnek cümle; sayılar temsilidir.
Ne zaman kullanılmamalıdır?
- Küme sayısı her zaman parametreden gelir. K-ortalamalarda bulunan otomatik arama bu yöntemde yoktur, dolayısıyla birkaç değeri elle deneyip kalite ölçülerini karşılaştırmak gerekir.
- Uygulama ağacı istenen küme sayısında keser ve birleşme uzaklıklarını döndürmez; dendrogram çizilmediği için ağacın hangi kademede hızlandığı panelden incelenemez.
- Bir kez yapılan birleşme geri alınmaz, bu yüzden erken adımda verilen hatalı bir karar son çözüme taşınır.
- Birleşme dizisi bütün vaka çiftlerinin uzaklığı üzerinden kurulduğu için çok büyük veri setlerinde hesap ağırlaşır ve yöntem pratik olmaktan çıkar.
- Tek bağlama ölçütü zincirleme eğilimi gösterir ve tek bir kalabalık kümeyle birkaç artık küme üretebilir; boyut dağılımına bakmadan ölçüt seçilmemelidir.
- Kümeler arası farklar için anlamlılık sınaması ya da güven aralığı verilmez; kategorik değişkenler de kümelemeye girmez.
Varsayımlar karşılanmazsa kullanılabilecek yöntemler
- K-Ortalamalar Küme AnaliziNeden: Örneklem büyükse ya da küme sayısını siluet puanına göre otomatik seçtirmek isteniyorsa.
- Açımlayıcı Faktör Analizi (AFA)Neden: Gruplanması gereken şey yanıtlayıcılar değil maddelerse; maddelerin hangi boyutlarda toplandığını gösterir.
- Temel Bileşenler Analizi (PCA)Neden: Örtüşen çok sayıda değişken benzerlik hesabına girmeden önce az sayıda bileşene indirilecekse.
- Tek Yönlü ANOVANeden: Kümeler belirlendikten sonra bu kümelerin kümelemeye girmemiş bir değişkende ayrışıp ayrışmadığı sınanacaksa.
Sık sorulan sorular
- Küme sayısına nasıl karar vereceğim?
- Bu yöntemde küme sayısı her zaman sizin verdiğiniz değerdir ve alan varsayılan olarak 3 gelir; otomatik bir arama yapılmaz. Pratik yol birkaç değeri sırayla koşup kalite ölçülerini karşılaştırmaktır: siluet puanının en yüksek, Davies-Bouldin indeksinin en düşük olduğu çözüm ayrışma bakımından öndedir. Yalnız sayılara bakmak yeterli değildir; her kümenin profil tablosunda kendine özgü bir öyküsü olmalı ve kümeler uygulamada ayrı ele alınabilecek büyüklükte kalmalıdır. Küme sayısını veriden otomatik seçmek istiyorsanız k-ortalamalar yöntemi bu aramayı yapar.
- Hangi bağlama ölçütünü seçmeliyim?
- Varsayılan olan Ward ölçütü, anket verisinde en sık kullanılan seçenektir ve birbirine yakın büyüklükte, toplu kümeler üretme eğilimindedir. Tam bağlama iki kümenin en uzak üyelerine baktığı için sıkı ve küçük kümeler verir, ortalama bağlama ikisinin arasında durur. Tek bağlama en yakın üyeyi ölçüt aldığı için zincirlenmeye açıktır: vakalar birer birer büyük kümeye eklenir ve sonuçta tek bir kalabalık kümeyle birkaç küçük artık küme kalır. Uygulamada iyi bir alışkanlık, aynı küme sayısıyla iki ya da üç ölçütü koşup profil tablolarının benzer kalıp kalmadığına bakmaktır; benzer kalıyorsa çözüm ölçüt seçimine bağlı değildir.
- Değişkenleri standartlaştırmam gerekir mi?
- Gerekir ve panel bunu varsayılan olarak yapar. Benzerlik hesabı bütün değişkenlerin katkısını topladığı için yayılımı büyük bir değişken birleşme dizisini kendi başına yönlendirir; örneğin yıllık ciro ile yedili ölçekten gelen bir tutum puanını ham hâlleriyle aynı analize koymak kümeleri ciro üzerinden kurmak demektir. Bütün değişkenler aynı ölçekten geliyorsa ve yayılım farkının kendisi bilgi taşıyorsa standartlaştırmayı kapatmak savunulabilir. Kapatmayı seçerseniz iki koşuyu karşılaştırıp farkın kümelerin öyküsünü değiştirip değiştirmediğini görmek gerekir.
- Dendrogramı nereden görebilirim?
- Bu yöntemde dendrogram çizilmez ve birleşme uzaklıkları da döndürülmez; uygulama ağacı yalnız verdiğiniz küme sayısında keser ve ortaya çıkan kümeleri betimler. Dolayısıyla birleşmelerin hangi kademede hızlandığına bakarak kesme noktası seçme yolu panelde açık değildir. Bunun yerine birkaç küme sayısını deneyip kalite ölçülerini ve profil tablolarını karşılaştırmanız gerekir. Ağacın kendisini incelemeniz gereken bir çalışmada, aynı bağlama ölçütüyle dendrogram üreten bir istatistik yazılımında çizimi ayrıca yapmak gerekir.
Kaynaklar
- Ward, J. H. (1963). Hierarchical Grouping to Optimize an Objective Function
- Hair, J. F., Black, W. C., Babin, B. J., & Anderson, R. E. (2019). Multivariate Data Analysis
- Rousseeuw, P. J. (1987). Silhouettes: A Graphical Aid to the Interpretation and Validation of Cluster Analysis
- sklearn.cluster.AgglomerativeClustering belgeleri
Kendi verinizle deneyin
Ücretsiz planda ayda 50 analiz koşusu vardır; kart istenmez.