Kruskal-Wallis H testi: SPSS'te nasıl yapılır ve nasıl yorumlanır?
Üç veya daha fazla bağımsız grubu karşılaştırmak istiyorsun ama verin normal dağılmıyor ya da sıralı. Kruskal-Wallis H testini SPSS'te çalıştırmayı, çıktıyı okumayı, hangi grupların farklı olduğunu ikili karşılaştırmalarla bulmayı ve sonucu raporlamayı bir örnek üzerinden adım adım anlatıyoruz.
Son güncelleme: 24 Eylül 2026
Kruskal-Wallis H testi ne zaman kullanılır?
Kruskal-Wallis H testi (Kruskal ve Wallis, 1952), üç veya daha fazla bağımsız grubun bir değişkendeki puanlarını karşılaştırır. Mann-Whitney U testinin ikiden fazla gruba genişletilmiş halidir: puanların kendisiyle değil, bütün gruplar birlikte küçükten büyüğe sıralandığında aldıkları sıralarla çalışır. Bu yüzden normal dağılım varsayımı gerektirmez.
Şu üç koşul birlikte sağlanıyorsa doğru testtir:
- Üç veya daha fazla bağımsız grup var. Her kişi yalnız bir grupta: üç fakülte, dört farklı şehir, ailesiyle, yurtta ve öğrenci evinde kalanlar gibi.
- Bağımlı değişken en az sıralı. Tek bir Likert maddesi, bir sıralama ya da sürekli bir puan olabilir.
- Veri tek yönlü ANOVA'ya uygun değil. Bağımlı değişken sıralıysa ya da puan bir veya daha fazla grupta belirgin biçimde normal dağılmıyorsa, özellikle de gruplar küçükse. Normalliğe her grupta ayrı bakılır; nasıl yapılacağını SPSS'te normallik testi rehberinde bulabilirsin.
Senin durumun farklıysa:
- Puan her grupta yaklaşık normalse: tek yönlü ANOVA. Varsayımlar sağlandığında daha güçlüdür ve sonucu ortalamalar üzerinden yorumlarsın.
- Yalnız varyanslar eşit değilse: Kruskal-Wallis'e geçme. Sıra testleri de gruplardaki yayılım farkından etkilenir. Doğru çözüm tek yönlü ANOVA'nın Welch testi (Delacre vd., 2019) ve Games-Howell karşılaştırmalarıdır.
- Yalnız iki grubun varsa: Mann-Whitney U testi.
- Aynı kişileri üç veya daha fazla kez ölçtüysen: Friedman testi.
- Grupların doğal bir sırası ve yönlü bir beklentin varsa (az, orta ve çok kullanım gibi): Jonckheere-Terpstra testi daha güçlüdür. SPSS'in yeni penceresinde Test for ordered alternatives (Jonckheere-Terpstra for k samples) adıyla bulunur.
- İki faktörün etkisini birlikte inceleyeceksen: Kruskal-Wallis tek bir gruplama değişkeni içindir, faktöriyel ANOVA'nın karşılığı değildir.
Emin değilsen hangi istatistiksel test rehberindeki karar tablosuna bak.
Hipotezler
- H₀: Grupların puan dağılımı aynıdır.
- H₁: En az bir grubun puan dağılımı diğerlerinden farklıdır; en az bir grubun puanları diğerlerinden yüksek (ya da düşük) olma eğilimindedir.
SPSS'in yeni penceresi sıfır hipotezini "The distribution of … is the same across categories of …" diye yazar. Anlamlı bir H yalnızca en az bir farkın olduğunu söyler. Hangi grupların farklı olduğunu ikili karşılaştırmalar gösterir.
Varsayımlar
- Bağımsız gözlemler. Her kişi yalnız bir grupta ve yalnız bir kez yer alır.
- Bağımlı değişken en az sıralı ölçekte.
- Medyan yorumu için benzer dağılım biçimi. Sonucu "medyanlar farklı" diye yorumlayacaksan grupların dağılım biçimi (yayılımı ve çarpıklığı) benzer olmalıdır. Histogramları ya da kutu grafiklerini karşılaştır. Biçimler farklıysa sonucu "bir grubun puanları diğerlerinden yüksek olma eğiliminde" diye, sıra ortalamaları üzerinden yorumla.
Normallik gerekmez. Levene gibi ayrı bir varyans testi de istenmez; yayılım farkı 3. maddedeki biçim karşılaştırmasının parçasıdır.
SPSS'te adım adım
Örnek senaryo (temsili veri): Ailesiyle (n = 33), öğrenci evinde (n = 27) ve yurtta (n = 30) kalan üniversite öğrencilerinin yalnızlık puanları karşılaştırılıyor. Puan 10 maddelik bir ölçekten geliyor: 10 ile 50 arasında değişiyor, yüksek puan daha fazla yalnızlık demek. Barınma değişkeni 1 = ailesiyle, 2 = öğrenci evinde, 3 = yurtta diye kodlu.
Puan üç grupta da sağa çarpık: çarpıklık sırasıyla 1,39 (SH 0,41), 1,42 (SH 0,45) ve 1,38 (SH 0,43). z değerleri 3,17 ile 3,41 arasında, yani 50'den küçük gruplar için kullanılan ±1,96 sınırının dışında. Shapiro-Wilk de üç grupta anlamlı (p ≤ ,006). Gruplar 30 kişi civarında olduğu için tek yönlü ANOVA da savunulabilirdi. Ancak çarpıklık belirgin ve bütün ölçütler aynı yönü gösterdiği için araştırmacı Kruskal-Wallis H testini seçiyor.
- Menüden Analyze → Nonparametric Tests → Legacy Dialogs → K Independent Samples yolunu aç.
- Yalnızlık puanını Test Variable List kutusuna, barınma değişkenini Grouping Variable kutusuna taşı.
- Define Range düğmesine bas. Minimum kutusuna 1, Maximum kutusuna 3 yaz ve Continue de. Bu iki değer arasındaki her kod ayrı bir grup olur; aralığın dışındaki kodlar analize alınmaz. Grupların 1'den 4'e kodluysa Maximum 4 olur.
- Test Type altında Kruskal-Wallis H kutusunun işaretli olduğunu kontrol et. Varsayılan olarak işaretlidir.
- OK de. Sözdizimini saklamak istersen Paste de.
NPAR TESTS
/K-W=yalnizlik BY barinma(1 3)
/MISSING ANALYSIS.
Bu pencere grup medyanlarını vermez. Raporlayacağın medyanlar için Analyze → Compare Means → Means yolunu aç, Options altında Median istatistiğini ekle. SPSS 29 ve sonrasında bu menünün adı Compare Means and Proportions'tır. Örnekte medyanlar ailesiyle kalanlarda 17, öğrenci evinde kalanlarda 18, yurtta kalanlarda 21.
MEANS TABLES=yalnizlik BY barinma
/CELLS=MEAN COUNT STDDEV MEDIAN.
Çıktı nasıl okunur?
Ranks tablosu
| Barınma | N | Mean Rank |
|---|---|---|
| Ailesiyle | 33 | 35,98 |
| Öğrenci evinde | 27 | 43,17 |
| Yurtta | 30 | 58,07 |
| Total | 90 |
SPSS üç gruptaki 90 puanı tek bir sıraya dizer: en düşük puan 1. sırayı, en yüksek puan 90. sırayı alır. Eşit puanlara (bağlara) ortalama sıra verilir. Mean Rank her grubun sıra ortalamasıdır. Gruplar arasında hiç fark olmasaydı her grubun sıra ortalaması genel ortalamaya, (N + 1) / 2 = 45,5'e yakın olurdu. Sıra ortalaması yüksek olan grubun puanları daha yüksek olma eğilimindedir. Burada yurtta kalanların sıra ortalaması (58,07) en yüksek, ailesiyle kalanlarınki (35,98) en düşük.
N sütununu da kontrol et. Define Range'e yanlış aralık yazdıysan bir grup bu tabloda hiç görünmez.
Test Statistics tablosu
| Yalnızlık puanı | |
|---|---|
| Kruskal-Wallis H | 11,582 |
| df | 2 |
| Asymp. Sig. | ,003 |
- Kruskal-Wallis H: test istatistiği. Grupların sıra ortalamaları genel ortalamadan (45,5) uzaklaştıkça büyür. Eski SPSS sürümleri bu satıra Chi-Square der; değer aynıdır ve raporda H olarak yazılır.
- df: serbestlik derecesi, grup sayısı eksi bir: 3 − 1 = 2.
- Asymp. Sig.: karar satırı. SPSS, H'yi ki-kare dağılımıyla karşılaştırarak p değerini bulur. Değer ,05'ten küçükse en az bir grup diğerlerinden farklıdır. Burada p = ,003.
SPSS, H'yi bağlar için düzeltir. Düzeltilmemiş H, 1 − Σ(t³ − t) / (N³ − N) değerine bölünür; burada t her bağ grubundaki kişi sayısıdır. Örnekte puanlar tam sayı olduğu için çok sayıda bağ var ve bu değer 0,9959: düzeltilmemiş H = 11,535, düzeltilmiş H = 11,535 / 0,9959 = 11,582. Tek bir Likert maddesinde bağlar çok daha fazladır ve düzeltmenin etkisi büyür. SPSS ,000 gösteriyorsa raporda p < ,001 yaz.
Etki büyüklüğü: ε²
p değeri, gerçekte fark olmasaydı bu kadar büyük ya da daha büyük bir farkı gözlemenin ne kadar olası olduğunu gösterir; farkın ne kadar büyük olduğunu söylemez. Kruskal-Wallis için yaygın bir etki büyüklüğü epsilon karedir (Tomczak ve Tomczak, 2014). SPSS bu değeri vermez, elle hesaplanır:
ε² = H / (N − 1) = 11,582 / 89 = ,13
Tomczak ve Tomczak (2014) formülü H / [(N² − 1) / (N + 1)] diye yazar; sadeleştirince aynı ifadeye varılır. ε² 0 (hiç ilişki yok) ile 1 (tam ilişki) arasında değişir. Kesin yorum sınırları yoktur; η² için kullanılan ölçütler (Cohen, 1988: ,01 küçük, ,06 orta, ,14 büyük) kaba bir rehber olarak kullanılabilir. Bu ölçütlere göre ε² = ,13 orta ile büyük arasında bir etkidir. Hangi ölçütü kullandığını raporda belirt.
Hangi gruplar farklı? İkili karşılaştırmalar
Anlamlı bir H, en az bir farkın olduğunu söyler ama hangisi olduğunu söylemez. Bunun için grupları ikişer ikişer karşılaştırırsın: üç grupta üç, dört grupta altı karşılaştırma yapılır. Her ek karşılaştırma birinci tip hata olasılığını artırdığı için p değerleri düzeltilir. H anlamlı çıkmadıysa ikili karşılaştırmalara geçme.
Yeni pencerede Dunn testi
Legacy pencere ikili karşılaştırma yapmaz. SPSS'in yeni penceresi ise Kruskal-Wallis testinin ardından bütün çiftleri Dunn (1964) yöntemiyle karşılaştırır ve p değerlerini Bonferroni yöntemiyle düzeltir:
- Analyze → Nonparametric Tests → Independent Samples yolunu aç.
- Fields sekmesinde Use custom field assignments seçili olsun. Yalnızlık puanını Test Fields kutusuna, barınma değişkenini Groups kutusuna taşı.
- Settings sekmesinde, Choose Tests altında Customize tests seçeneğini işaretle.
- Compare Distributions across Groups bölümünde Kruskal-Wallis 1-way ANOVA (k samples) kutusunu işaretle. Altındaki Multiple comparisons listesinde All pairwise seçili olsun.
- Run de. Sözdizimi için Paste de.
Objective sekmesine dokunmana gerek yok: Settings sekmesinde değişiklik yaptığında SPSS Custom analysis seçeneğine kendisi geçer. Bu pencere değişkenlerin ölçüm düzeyine bakar. Variable View'daki Measure sütununda barınma değişkeni Nominal ya da Ordinal, yalnızlık puanı Scale ya da Ordinal olmalıdır; grup değişkeni Nominal ya da Ordinal değilse test çalışmaz.
NPTESTS
/INDEPENDENT TEST (yalnizlik) GROUP (barinma) KRUSKAL_WALLIS(COMPARE=PAIRWISE)
/MISSING SCOPE=ANALYSIS USERMISSING=EXCLUDE
/CRITERIA ALPHA=0.05 CILEVEL=95.
Bu pencere önce Hypothesis Test Summary tablosunu verir: sıfır hipotezi, testin adı, Sig. ve Decision sütunu ("Reject the null hypothesis."). Ardından gelen Independent-Samples Kruskal-Wallis Test Summary tablosu, Legacy penceredeki H, df ve p değerlerinin aynısını verir ve dipnotta test istatistiğinin bağlar için düzeltildiğini yazar. Kutu grafiği de burada gelir; grupların dağılım biçimini karşılaştırmak için kullan.
Eski sürümlerde bu sonuçlar tek bir model nesnesi (Model Viewer) içinde gelir: nesneye çift tıkla ve sağ alttaki View listesinden Pairwise Comparisons görünümünü seç. Yeni sürümlerde tablolar doğrudan çıktı penceresinde görünür.
Pairwise Comparisons tablosu
| Sample 1-Sample 2 | Test Statistic | Std. Error | Std. Test Statistic | Sig. | Adj. Sig. |
|---|---|---|---|---|---|
| Ailesiyle-Öğrenci evinde | −7,182 | 6,765 | −1,062 | ,288 | ,865 |
| Ailesiyle-Yurtta | −22,082 | 6,577 | −3,358 | ,001 | ,002 |
| Öğrenci evinde-Yurtta | −14,900 | 6,916 | −2,154 | ,031 | ,094 |
Her satır bir çifti karşılaştırır. SPSS dipnotta her satırın "Sample 1 ile Sample 2'nin dağılımları aynıdır" sıfır hipotezini sınadığını yazar.
- Test Statistic: iki grubun sıra ortalamaları farkı, Sample 1 eksi Sample 2. Ailesiyle-Yurtta için 35,98 − 58,07 = −22,09; SPSS yuvarlanmamış sıra ortalamalarını kullandığı için tabloda −22,082 yazar. İşaret yalnızca grupların hangi sırayla yazıldığını gösterir. Hangi grubun yüksek olduğunu Ranks tablosundan oku.
- Std. Error: farkın standart hatası. Bütün gruplardaki sıralardan hesaplanır ve bağlar için düzeltilir: SE = √( [N(N + 1) / 12 − Σ(t³ − t) / (12(N − 1))] × (1/nᵢ + 1/nⱼ) ). Ailesiyle-Yurtta için √( [682,5 − 2,787] × (1/33 + 1/30) ) = 6,577.
- Std. Test Statistic: Dunn testinin z değeri, yani Test Statistic ÷ Std. Error: −22,082 ÷ 6,577 ≈ −3,358.
- Sig.: düzeltilmemiş p değeri. Kararı bu sütunla verme.
- Adj. Sig.: Bonferroni düzeltmeli p değeri. Sig. değeri karşılaştırma sayısıyla (burada 3) çarpılır, sonuç 1'i geçerse 1 yazılır. SPSS yuvarlanmamış değerle çarptığı için elle hesapladığında son basamak farklı çıkabilir. Kararı bu sütunla ver.
Sonuç: yalnız ailesiyle ve yurtta kalanlar arasındaki fark anlamlı (Adj. Sig. = ,002). Öğrenci evinde ve yurtta kalanların karşılaştırması düzeltmeden önce anlamlı görünüyor (Sig. = ,031), ama düzeltmeden sonra değil (Adj. Sig. = ,094). Sig. sütununa bakıp "iki fark var" demek sık yapılan bir hatadır.
İkili karşılaştırmalar için etki büyüklüğü olarak r = |z| / √n hesaplanabilir; burada n, karşılaştırılan iki grubun toplam kişi sayısıdır (Field, 2018; Fritz vd., 2012). Ailesiyle-Yurtta için r = 3,358 / √63 = ,42. Cohen'in (1988) ölçütlerine göre r ≈ ,10 küçük, ,30 orta, ,50 büyük etkidir; ,42 orta ile büyük arasındadır. Diğer iki çift için r = ,14 ve ,29.
Alternatif: Bonferroni düzeltmeli Mann-Whitney U
Yeni pencereyi kullanamıyorsan ya da danışmanın bu yöntemi istiyorsa, grupları Legacy 2 Independent Samples penceresinde ikişer ikişer Mann-Whitney U testiyle karşılaştırabilirsin. Her testte Define Groups kutusuna o çiftin kodlarını yaz: 1 ve 2, 1 ve 3, 2 ve 3.
NPAR TESTS
/M-W= yalnizlik BY barinma(1 3)
/MISSING ANALYSIS.
Dikkat: K-W satırındaki (1 3) bir aralıktır ve 1, 2, 3 kodlarının hepsini alır. M-W satırındaki (1 3) ise yalnız iki grubu, ailesiyle (1) ve yurtta (3) kalanları karşılaştırır. Diğer iki çift için parantezdeki kodları değiştirip komutu yeniden çalıştır.
Bu yöntemde SPSS düzeltme yapmaz; anlamlılık düzeyini sen düzeltirsin: α = ,05 / karşılaştırma sayısı = ,05 / 3 ≈ ,017. Yalnız p değeri ,017'den küçük olan karşılaştırmalar anlamlı sayılır.
| Karşılaştırma | U | z | p | r |
|---|---|---|---|---|
| Ailesiyle-Öğrenci evinde | 368,00 | −1,15 | ,248 | ,15 |
| Ailesiyle-Yurtta | 258,50 | −3,26 | ,001 | ,41 |
| Öğrenci evinde-Yurtta | 264,50 | −2,25 | ,024 | ,30 |
Burada da yalnız ailesiyle ve yurtta kalanlar arasındaki fark anlamlı: öğrenci evinde ve yurtta kalanların karşılaştırmasında p (,024) düzeltilmiş sınırın (,017) üstünde. Sonuçlar Dunn testinden biraz farklıdır, çünkü her Mann-Whitney U testi yalnız iki grubun puanlarını yeniden sıralar. Dunn testi ise Kruskal-Wallis'in üç grubu birlikte sıralayan ortak sıralarını kullanır. Hangi yöntemi kullandığını raporda yaz.
Raporlama (APA)
Üç grubun dağılım biçimi benzer: hepsi sağa çarpık (çarpıklık 1,38 ile 1,42 arasında) ve standart sapmaları birbirine yakın (6,74 ile 6,95 arasında). Bu yüzden farkı medyanlar üzerinden anlatmak yerinde:
Yalnızlık puanları barınma durumuna göre anlamlı biçimde farklılaştı, H(2) = 11,58, p = ,003, ε² = ,13. Bonferroni düzeltmeli Dunn karşılaştırmalarına göre yurtta kalan öğrencilerin puanları (Mdn = 21) ailesiyle kalanlarınkinden (Mdn = 17) yüksekti, z = 3,36, düzeltilmiş p = ,002, r = ,42. Öğrenci evinde kalanlar (Mdn = 18) ne ailesiyle kalanlardan (düzeltilmiş p = ,865) ne de yurtta kalanlardan (düzeltilmiş p = ,094) anlamlı biçimde farklıydı.
Sonuçları tabloyla da verebilirsin:
| Barınma | n | Medyan | Sıra ortalaması |
|---|---|---|---|
| Ailesiyle | 33 | 17 | 35,98 |
| Öğrenci evinde | 27 | 18 | 43,17 |
| Yurtta | 30 | 21 | 58,07 |
Tablonun altına testi ve ikili karşılaştırmaları not olarak yaz: H(2) = 11,58, p = ,003, ε² = ,13; Bonferroni düzeltmeli Dunn testine göre yalnız ailesiyle ve yurtta kalanlar arasındaki fark anlamlı.
Sonuç anlamlı çıkmadıysa
- "Gruplar aynı" deme. "Gruplar arasında anlamlı bir fark bulunmadı" de. Anlamlı çıkmaması, farkın olmadığını kanıtlamaz.
- İkili karşılaştırmalarda fark arama. Genel test anlamlı değilken tek tek çiftlere bakmak birinci tip hata riskini artırır.
- Yine H, sd, p ve ε² değerlerini raporla. Özellikle gruplar küçükse test gerçek bir farkı kaçırmış olabilir.
- Sonucu anlamlı yapmak için testi değiştirme ya da veri çıkarma. Testi, analizden önce araştırma sorusuna ve verinin yapısına göre seçersin.
Sık yapılan hatalar
- Üç grubu düzeltmesiz, ikişer ikişer Mann-Whitney U ile karşılaştırmak. Birinci tip hata olasılığı şişer. Önce Kruskal-Wallis yapılır, anlamlıysa düzeltilmiş ikili karşılaştırmalara geçilir.
- Pairwise Comparisons tablosunda Sig. sütununa göre karar vermek. Karar Adj. Sig. sütunuyla verilir.
- Yalnız varyanslar eşit değil diye Kruskal-Wallis'e geçmek. Bu durumda doğru seçim Welch testi ve Games-Howell karşılaştırmalarıdır.
- Testi "ortalamaları karşılaştırır" diye anlatmak. Kruskal-Wallis sıraları karşılaştırır. Raporda ortalama ve standart sapma değil, medyan ve sıra ortalaması ver.
- Dağılım biçimleri farklıyken sonucu medyan farkı diye yorumlamak. Önce histogramlara ya da kutu grafiklerine bak.
- Eski sürümlerdeki Chi-Square satırını ki-kare testi sanmak. O değer Kruskal-Wallis H'dir.
- Raporda "p = ,000" yazmak. Doğrusu p < ,001.
Kaynaklar
- Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2. baskı). Lawrence Erlbaum.
- Delacre, M., Leys, C., Mora, Y. L. ve Lakens, D. (2019). Taking parametric assumptions seriously: Arguments for the use of Welch's F-test instead of the classical F-test in one-way ANOVA. International Review of Social Psychology, 32(1), Makale 13. https://doi.org/10.5334/irsp.198
- Dunn, O. J. (1964). Multiple comparisons using rank sums. Technometrics, 6(3), 241–252. https://doi.org/10.1080/00401706.1964.10490181
- Field, A. (2018). Discovering statistics using IBM SPSS Statistics (5. baskı). SAGE.
- Fritz, C. O., Morris, P. E. ve Richler, J. J. (2012). Effect size estimates: Current use, calculations, and interpretation. Journal of Experimental Psychology: General, 141(1), 2–18. https://doi.org/10.1037/a0024338
- Kruskal, W. H. ve Wallis, W. A. (1952). Use of ranks in one-criterion variance analysis. Journal of the American Statistical Association, 47(260), 583–621. https://doi.org/10.1080/01621459.1952.10483441
- Tomczak, M. ve Tomczak, E. (2014). The need to report effect size estimates revisited. An overview of some recommended measures of effect size. Trends in Sport Sciences, 21(1), 19–25.