Friedman testi: SPSS'te nasıl yapılır ve nasıl yorumlanır?
Aynı kişileri üç ya da daha fazla kez ölçtün ama verin normal dağılmıyor ya da sıralı. Friedman testini SPSS'te çalıştırmayı, çıktıdaki her tabloyu okumayı, hangi ölçümlerin farklı olduğunu ikili karşılaştırmalarla bulmayı ve sonucu Kendall W ile raporlamayı bir örnek üzerinden adım adım anlatıyoruz.
Son güncelleme: 24 Eylül 2026
Friedman testi ne zaman kullanılır?
Friedman testi (Friedman, 1937), aynı kişilerin üç ya da daha fazla ölçümünü karşılaştırır: ön test, son test ve izleme testi; dönem başı, ara sınav ve final haftası; aynı öğrencilerin üç farklı ders yöntemine verdiği puanlar gibi. Puanların kendisiyle değil, her kişinin puanları kendi içinde sıralandığında aldıkları sıralarla çalışır. Bu yüzden normal dağılım varsayımı gerektirmez. Tekrarlı ölçümler ANOVA'sının parametrik olmayan karşılığıdır.
Şu üç koşul birlikte sağlanıyorsa doğru testtir:
- Aynı kişiler üç ya da daha fazla kez ölçülmüş ya da aynı kişiler üç veya daha fazla koşulda puan vermiş. Veri dosyasında her ölçüm ayrı bir sütundur.
- Bağımlı değişken en az sıralı. Tek bir Likert maddesi, bir sıralama ya da sürekli bir puan olabilir.
- Veri tekrarlı ölçümler ANOVA'sına uygun değil. Bağımlı değişken sıralıysa ya da puanlar ve ölçümler arasındaki farklar belirgin biçimde normal dağılmıyorsa, özellikle de örneklem küçükse. Ayrıntısı aşağıda.
Senin durumun farklıysa:
- Yalnız iki ölçümün varsa (ön test ve son test gibi): Wilcoxon işaretli sıralar testi.
- Ölçümler farklı kişilerden geliyorsa (üç ayrı sınıf gibi): Kruskal-Wallis H testi. Friedman testi aynı kişilerin ölçümleri içindir.
- Puanlar ve ölçümler arasındaki farklar yaklaşık normalse: tekrarlı ölçümler ANOVA'sı. Hangisini ne zaman seçeceğini aşağıda anlatıyoruz. Bağımsız gruplardaki karşılığı için tek yönlü ANOVA rehberine bakabilirsin.
- Bağımlı değişken iki kategoriliyse (evet ya da hayır gibi): Cochran's Q testi. Aynı pencerede bulunur.
- Bir deney ve bir kontrol grubunu zaman içinde karşılaştırıyorsan: Friedman testi tek bir grubun ölçümlerini karşılaştırır. İki grubu ayrı ayrı Friedman testiyle sınamak, değişimin gruplar arasında farklı olup olmadığını (grup × zaman etkileşimini) sınamaz. Bu desen karma (mixed) ANOVA gerektirir ve bu rehberin kapsamı dışındadır.
Emin değilsen hangi istatistiksel test rehberindeki karar tablosuna bak.
Friedman testi puanları nasıl sıralar?
Friedman testi puanları kişi kişi sıralar. Her öğrencinin üç puanı yalnız kendi arasında küçükten büyüğe dizilir: en düşük puan 1, ortanca puan 2, en yüksek puan 3 sırasını alır. Eşit puanlara ortalama sıra verilir. Aşağıdaki örnekten iki öğrenci:
| Öğrenci | Dönem başı | Ara sınav | Final | Sıralar |
|---|---|---|---|---|
| 1 | 12 | 14 | 16 | 1; 2; 3 |
| 12 | 14 | 17 | 17 | 1; 2,5; 2,5 |
Sonra her ölçümün sıraları bütün öğrenciler için toplanır. Böylece kişiler arasındaki düzey farkı ortadan kalkar: kaygısı hep yüksek olan öğrenci de, hep düşük olan öğrenci de teste yalnız "hangi ölçümde daha kaygılıydım" bilgisiyle katılır. Kruskal-Wallis testi ise bütün puanları tek bir sırada dizer. Bu yüzden iki test birbirinin yerine kullanılamaz.
Hipotezler
- H₀: Ölçümlerin puan dağılımı aynıdır.
- H₁: En az bir ölçümün puan dağılımı diğerlerinden farklıdır; kişilerin puanları en az bir ölçümde diğerlerinden yüksek (ya da düşük) olma eğilimindedir.
SPSS'in yeni penceresi sıfır hipotezini "The distributions of … are the same." diye yazar. Anlamlı bir sonuç yalnızca en az bir farkın olduğunu söyler. Hangi ölçümlerin farklı olduğunu ikili karşılaştırmalar gösterir.
Varsayımlar
- İlişkili ölçümler, bağımsız kişiler. Her kişi bütün ölçümlerde yer alır; kişiler birbirinden bağımsızdır.
- Bağımlı değişken en az sıralı ölçekte. Sıralı ya da sürekli bir puan olabilir.
- Geniş veri biçimi. Her ölçüm ayrı bir sütunda, her kişi tek bir satırdadır. Zamanı tek bir sütunda (1, 2, 3 diye) tutuyorsan önce Data → Restructure ile veriyi geniş biçime çevir.
- Bütün ölçümleri olan kişiler. Friedman testi bir ölçümü eksik olan kişiyi analizden tamamen çıkarır. Test Statistics tablosundaki N'yi kişi sayınla karşılaştır.
Normallik ve küresellik gerekmez. Sonucu "medyanlar farklı" diye değil, "kişilerin puanları bir ölçümde diğerlerinden yüksek olma eğiliminde" diye yorumla; medyanları betimleyici bilgi olarak ver.
Neden tekrarlı ölçümler ANOVA'sı değil?
Aynı kişilerin üç ölçümünü karşılaştırmanın parametrik yolu tekrarlı ölçümler ANOVA'sıdır: Analyze → General Linear Model → Repeated Measures. Varsayımları sağlandığında Friedman testinden daha güçlüdür, yani gerçek bir farkı bulma olasılığı daha yüksektir. Sonucu da ortalamalar üzerinden yorumlarsın.
İki varsayımına bak:
- Normallik: puanların ve özellikle ölçümler arasındaki farkların yaklaşık normal dağılması. Farkları Transform → Compute Variable ile ayrı değişkenler olarak hesapla (ör.
fark_final = kaygi_final - kaygi_donembasi) ve normallik rehberindeki gibi incele. - Küresellik (sphericity): bütün ölçüm çiftleri arasındaki farkların varyanslarının eşit olması. SPSS bunu Mauchly's Test of Sphericity tablosunda sınar; varsayım sağlanmazsa Tests of Within-Subjects Effects tablosundaki Greenhouse-Geisser satırını kullanırsın (Field, 2018). Mauchly testinin gücü örneklem büyüklüğüne bağlıdır: küçük örneklemde büyük bir ihlali bile anlamlı bulmayabilir.
Yalnız küresellik sağlanmıyor diye Friedman testine geçme; Greenhouse-Geisser düzeltmesi tam bu durum içindir. Friedman testini, bağımlı değişken sıralıysa ya da normallik belirgin biçimde bozuluyorsa seç, özellikle örneklem küçükse ve uç değerler varsa.
Aşağıdaki örnekte durum bu. Final haftası puanlarında Shapiro-Wilk testi anlamlı (p = ,015). Final ile dönem başı arasındaki fark sola çarpık: çarpıklık −1,09 (SH 0,45), z = −2,44, yani ±1,96 sınırının dışında; Shapiro-Wilk de anlamlı (p = ,021). 27 öğrenciden 22'sinin kaygısı artmış, ama iki öğrencininki 5 ve 7 puan düşmüş; bu iki değer farkların dağılımını çarpıtıyor. Ara sınav ile final arasındaki farkta da Shapiro-Wilk anlamlı (p = ,044). Örneklem küçük ve puan kısa bir Likert formundan geliyor. Araştırmacı bu yüzden Friedman testini seçiyor.
SPSS'te adım adım
Temsili veri. Bir araştırmacı aynı 27 öğrencinin sınav kaygısını bir dönem boyunca üç kez ölçüyor: dönem başında (2. hafta), ara sınav haftasında (8. hafta) ve final haftasında (15. hafta). Kaygı, her maddesi 1–5 arası puanlanan beş maddelik kısa bir formla ölçülüyor; toplam puan 5 ile 25 arasında, yüksek puan daha fazla kaygı demek. Veri dosyasında her ölçüm ayrı bir sütunda: kaygi_donembasi, kaygi_ara ve kaygi_final.
- Menüden Analyze → Nonparametric Tests → Legacy Dialogs → K Related Samples yolunu aç.
- Üç değişkeni zaman sırasıyla Test Variables kutusuna taşı. Tablolar bu sırayla gelir.
- Test Type altında Friedman kutusunun işaretli olduğunu kontrol et; varsayılan olarak işaretlidir. Etki büyüklüğü için Kendall's W kutusunu da işaretle.
- Statistics düğmesine bas, Quartiles kutusunu işaretle ve Continue de. Ölçümlerin medyanları bu tablodan gelir.
- OK de. Sözdizimini saklamak istersen Paste de.
NPAR TESTS
/FRIEDMAN=kaygi_donembasi kaygi_ara kaygi_final
/KENDALL=kaygi_donembasi kaygi_ara kaygi_final
/STATISTICS QUARTILES
/MISSING LISTWISE.
Çıktı nasıl okunur?
Descriptive Statistics tablosu
| N | 25th | 50th (Median) | 75th | |
|---|---|---|---|---|
| Dönem başı | 27 | 11,00 | 13,00 | 17,00 |
| Ara sınav | 27 | 14,00 | 15,00 | 17,00 |
| Final | 27 | 13,00 | 16,00 | 19,00 |
Son üç sütun Percentiles başlığının altındadır. 50th (Median) sütunu her ölçümün medyanıdır: dönem başında 13, ara sınav haftasında 15, final haftasında 16. 25th ve 75th sütunları birinci ve üçüncü çeyrektir; raporda medyanın yanında çeyrekleri vermek için kullanırsın.
Ranks tablosu
| Mean Rank | |
|---|---|
| Dönem başı | 1,48 |
| Ara sınav | 2,11 |
| Final | 2,41 |
Mean Rank, bir ölçümün 27 öğrencideki sıralarının ortalamasıdır. Her öğrencide sıralar 1 ile 3 arasında olduğu için, ölçümler arasında hiç fark olmasaydı her sıra ortalaması (k + 1) / 2 = 2'ye yakın olurdu; burada k ölçüm sayısıdır. Sıra ortalaması yüksek olan ölçümde öğrencilerin puanları daha yüksek olma eğilimindedir. Kaygı dönem boyunca artıyor: sıra ortalaması dönem başında en düşük (1,48), final haftasında en yüksek (2,41).
Test Statistics tablosu
| İstatistik | Değer |
|---|---|
| N | 27 |
| Chi-Square | 12,911 |
| df | 2 |
| Asymp. Sig. | ,002 |
- N: analize giren kişi sayısı. Ölçümlerinden biri eksik olan kişiler burada düşer.
- Chi-Square: Friedman test istatistiği (χ²). Sıra ortalamaları 2'den uzaklaştıkça büyür. Adı ki-karedir, çünkü p değeri ki-kare dağılımından hesaplanır; ki-kare bağımsızlık testiyle ilgisi yoktur.
- df: serbestlik derecesi, ölçüm sayısı eksi bir: 3 − 1 = 2.
- Asymp. Sig.: karar satırı. Değer ,05'ten küçükse en az bir ölçümün puanları diğerlerinden farklıdır. Burada p = ,002.
Tablonun dipnotu (a. Friedman Test) testin adını verir. SPSS ,000 gösteriyorsa raporda p < ,001 yaz.
SPSS, χ²'yi bağlar için düzeltir. Önce düzeltilmemiş değer, ölçümlerin sıra toplamlarından (Rⱼ: 40, 57 ve 65) hesaplanır:
χ² = 12 / (N·k·(k + 1)) × ΣRⱼ² − 3N(k + 1) = 12 / 324 × 9074 − 324 = 12,074
Sonra bu değer 1 − ΣT / (N·k·(k² − 1)) değerine bölünür. ΣT, her kişinin kendi içindeki bağlar için hesaplanan (t³ − t) değerlerinin toplamıdır; t, o kişide eşit puan alan ölçüm sayısıdır. Örnekte 7 öğrencinin iki ölçümü eşit (t = 2): ΣT = 7 × 6 = 42 ve düzeltme değeri 1 − 42 / 648 = 0,9352. Düzeltilmiş χ² = 12,074 / 0,9352 = 12,911. Bağ ne kadar çoksa düzeltme o kadar büyür; tek bir Likert maddesinde etkisi belirgindir.
Kendall's W: ikinci Test Statistics tablosu
Kendall's W kutusunu işaretlediğin için SPSS aynı Ranks tablosunu bir kez daha, ardından ikinci bir Test Statistics tablosu verir:
| İstatistik | Değer |
|---|---|
| N | 27 |
| Kendall's W | ,239 |
| Chi-Square | 12,911 |
| df | 2 |
| Asymp. Sig. | ,002 |
Dipnot (a. Kendall's Coefficient of Concordance) W'nin uyum katsayısı olduğunu söyler. Bu tablodaki Chi-Square, df ve Asymp. Sig. değerleri Friedman tablosundakilerin aynısıdır, çünkü Kendall'ın uyum katsayısı W (Kendall ve Babington Smith, 1939) Friedman istatistiğinin 0 ile 1 arasına ölçeklenmiş halidir. Kararı Friedman tablosuyla verirsin; bu tablodan yalnız W'yi alırsın.
Etki büyüklüğü: Kendall W
p değeri, gerçekte fark olmasaydı bu kadar büyük ya da daha büyük bir farkı gözlemenin ne kadar olası olduğunu gösterir; farkın ne kadar büyük olduğunu söylemez. Friedman testi için yaygın etki büyüklüğü Kendall W'dir (Tomczak ve Tomczak, 2014). SPSS bu değeri Kendall's W kutusuyla verir; elle de hesaplayabilirsin:
W = χ² / (N(k − 1)) = 12,911 / (27 × 2) = ,24
W, kişilerin ölçümleri ne ölçüde aynı sırada gördüğünü gösterir. W = 1 ise her öğrencinin sıralaması aynıdır: örneğin herkesin kaygısı dönem başında en düşük, final haftasında en yüksektir. W = 0 ise ortak bir sıralama yoktur. Örnekte kaygı çoğu öğrencide artıyor, ama üç ölçümün sıralaması öğrenciden öğrenciye epey değişiyor.
W için genel kabul görmüş yorum sınırları yoktur. Bazı kaynaklar Cohen'in (1988) r için önerdiği ölçütleri (,10 küçük, ,30 orta, ,50 büyük) W'ye de uygular; ama Cohen bu değerleri W için önermemiştir ve W, r ile aynı ölçekte değildir. W, sıralar üzerinden hesaplanan bir η² gibidir: kişilerin kendi içindeki sıra farklarının ne kadarının ölçümden kaynaklandığını gösterir. r'nin sınırlarını W'ye uygulamak, onları η²'ye uygulamak gibi olur. Bu yüzden W'ye küçük, orta ya da büyük diye etiket vermek yerine değeri olduğu gibi raporla ve yorumla: örnekte W = ,24, yani öğrencilerin kendi içindeki sıra farklarının yaklaşık dörtte biri ölçüm zamanından kaynaklanıyor. Danışmanın yine de bir etiket istiyorsa hangi ölçütü kullandığını raporda belirt.
Hangi ölçümler farklı? İkili karşılaştırmalar
Anlamlı bir Friedman sonucu en az bir farkın olduğunu söyler ama hangisi olduğunu söylemez. Bunun için ölçümleri ikişer ikişer karşılaştırırsın: üç ölçümde üç, dört ölçümde altı karşılaştırma yapılır. Her ek karşılaştırma birinci tip hata olasılığını artırdığı için p değerleri düzeltilir. Friedman testi anlamlı çıkmadıysa ikili karşılaştırmalara geçme.
Yeni pencerede Dunn-Bonferroni karşılaştırmaları
Legacy pencere ikili karşılaştırma yapmaz. SPSS'in yeni penceresi Friedman testinin ardından bütün çiftleri Dunn'ın (1964) yaklaşımıyla, Friedman testinin sıra ortalamalarını kullanarak karşılaştırır ve p değerlerini Bonferroni yöntemiyle düzeltir:
- Analyze → Nonparametric Tests → Related Samples yolunu aç.
- Fields sekmesinde Use custom field assignments seçili olsun. Üç değişkeni zaman sırasıyla Test Fields kutusuna taşı.
- Settings sekmesinde, Choose Tests altında Customize tests seçeneğini işaretle.
- Compare Distributions bölümünde Friedman's 2-way ANOVA by ranks (k samples) kutusunu işaretle. Altındaki Multiple comparisons listesinde All pairwise seçili olsun.
- Run de. Sözdizimi için Paste de.
NPTESTS
/RELATED TEST(kaygi_donembasi kaygi_ara kaygi_final) FRIEDMAN(COMPARE=PAIRWISE)
/MISSING SCOPE=ANALYSIS USERMISSING=EXCLUDE
/CRITERIA ALPHA=0.05 CILEVEL=95.
Bu pencere değişkenlerin ölçüm düzeyine bakar. Variable View'daki Measure sütununda üç değişken de Scale ya da Ordinal olmalıdır; Nominal değişkenlere Friedman testi uygulanmaz. Customize tests'i seçmeyip otomatik seçimi bırakırsan SPSS Friedman testini yalnız Scale değişkenlere uygular. SPSS 22'den eski sürümlerde test yalnız Scale değişkenlerle çalışır.
Çıktı Hypothesis Test Summary tablosuyla başlar: sıfır hipotezi, testin adı (Related-Samples Friedman's Two-Way Analysis of Variance by Ranks), Sig. ve Decision sütunu. Ardından gelen özet tablo Total N, Test Statistic, serbestlik derecesi ve Asymptotic Sig. (2-sided test) satırlarında Legacy penceredeki değerlerin aynısını verir. Eski sürümlerde bu sonuçlar tek bir model nesnesi (Model Viewer) içinde gelir: nesneye çift tıkla ve sağ alttaki View listesinden Pairwise Comparisons görünümünü seç. Yeni sürümlerde tablolar doğrudan çıktı penceresinde görünür. SPSS ikili karşılaştırmaları yalnız Friedman testi anlamlıysa gösterir.
Pairwise Comparisons tablosu
| Sample 1-Sample 2 | Test Statistic | Std. Error | Std. Test Statistic | Sig. | Adj. Sig. |
|---|---|---|---|---|---|
| Dönem başı-Ara sınav | −,630 | ,272 | −2,313 | ,021 | ,062 |
| Dönem başı-Final | −,926 | ,272 | −3,402 | ,001 | ,002 |
| Ara sınav-Final | −,296 | ,272 | −1,089 | ,276 | ,829 |
Her satır bir çifti karşılaştırır. SPSS dipnotta her satırın "Sample 1 ile Sample 2'nin dağılımları aynıdır" sıfır hipotezini sınadığını ve p değerlerinin Bonferroni yöntemiyle düzeltildiğini yazar.
- Test Statistic: iki ölçümün sıra ortalamaları farkı. Dönem başı-Final için 1,48 − 2,41 = −0,93; SPSS yuvarlanmamış sıra ortalamalarını kullandığı için tabloda −,926 yazar. SPSS satırları sıra ortalaması küçük olan ölçümden başlayarak adlandırır, ama farkı değişkenleri kutuya koyduğun sıraya göre alabilir: önce gelen ölçümden sonra geleni çıkarır. Bu örnekte iki sıra aynı olduğu için değer Sample 1 eksi Sample 2'dir; değişkenleri başka bir sırayla girersen işaret satır adıyla uyuşmayabilir. İşarete göre yorum yapma; hangi ölçümün yüksek olduğunu Ranks tablosundan oku.
- Std. Error: farkın standart hatası: √(k(k + 1) / (6N)) = √(3 × 4 / (6 × 27)) = √0,0741 ≈ 0,272. Yalnız ölçüm sayısına ve kişi sayısına bağlı olduğu için bütün satırlarda aynıdır. SPSS bu standart hatayı bağlar için düzeltmez.
- Std. Test Statistic: z değeri, yani Test Statistic ÷ Std. Error. Dönem başı-Final için −0,926 ÷ 0,272 ≈ −3,40.
- Sig.: düzeltilmemiş p değeri. Kararı bu sütunla verme.
- Adj. Sig.: Bonferroni düzeltmeli p değeri. Sig. değeri karşılaştırma sayısıyla (burada 3) çarpılır, sonuç 1'i geçerse 1 yazılır. SPSS yuvarlanmamış değerle çarptığı için elle hesapladığında son basamak farklı çıkabilir. Kararı bu sütunla ver.
Sonuç: yalnız dönem başı ile final haftası arasındaki fark anlamlı (Adj. Sig. = ,002). Dönem başı ile ara sınav karşılaştırması düzeltmeden önce anlamlı görünüyor (Sig. = ,021), ama düzeltmeden sonra değil (Adj. Sig. = ,062). Ara sınav ile final haftası arasında anlamlı fark yok (Adj. Sig. = ,829).
Bu yöntemin bir sınırlılığı var: sıra ortalamaları bütün ölçümlerin birlikte sıralanmasından geldiği için, iki ölçümün karşılaştırması diğer ölçümlerin puanlarından da etkilenir (Benavoli vd., 2016). Bu yüzden bazı araştırmacılar yalnız iki ölçüme bakan Wilcoxon testlerini tercih eder.
Alternatif: Bonferroni düzeltmeli Wilcoxon testleri
Danışmanın bu yöntemi istiyorsa ya da yeni pencereyi kullanamıyorsan, ölçümleri Legacy 2 Related Samples penceresinde ikişer ikişer Wilcoxon işaretli sıralar testiyle karşılaştırabilirsin. Test Pairs kutusuna üç çifti ekle: dönem başı ile ara sınav, dönem başı ile final, ara sınav ile final. Wilcoxon kutusu varsayılan olarak işaretlidir.
NPAR TESTS
/WILCOXON=kaygi_donembasi kaygi_donembasi kaygi_ara WITH kaygi_ara kaygi_final kaygi_final (PAIRED)
/MISSING ANALYSIS.
Bu yöntemde SPSS düzeltme yapmaz; anlamlılık düzeyini sen düzeltirsin: α = ,05 / karşılaştırma sayısı = ,05 / 3 ≈ ,017. Yalnız p değeri ,017'den küçük olan karşılaştırmalar anlamlı sayılır. SPSS her çift için z değerini Z, p değerini Asymp. Sig. (2-tailed) satırında verir:
| Karşılaştırma | z | p | r |
|---|---|---|---|
| Dönem başı-Ara sınav | −2,14 | ,032 | ,29 |
| Dönem başı-Final | −2,96 | ,003 | ,40 |
| Ara sınav-Final | −1,48 | ,140 | ,20 |
Burada da yalnız dönem başı ile final haftası arasındaki fark anlamlı: dönem başı ile ara sınav karşılaştırmasında p (,032) düzeltilmiş sınırın (,017) üstünde. Sonuç Dunn-Bonferroni ile aynı, ama p değerleri farklı: Wilcoxon testi yalnız o iki ölçüme bakar ve farkların büyüklüğünü de kullanır. Hangi yöntemi kullandığını raporda yaz ve yöntemi sonuçlara bakmadan önce seç.
Tablodaki etki büyüklüğü r = |z| / √N ile hesaplandı (Fritz vd., 2012). N olarak toplam gözlem sayısını aldık: 27 kişi × 2 ölçüm = 54. Eşleştirilmiş veride N'nin nasıl seçileceği kaynaklara göre değişir; ayrıntısı Wilcoxon rehberinde. Çift sayısını (27) alsaydın değerler büyürdü (,41; ,57 ve ,28), bu yüzden hangisini kullandığını raporda yaz. Cohen'in (1988) ölçütlerine göre r ≈ ,10 küçük, ,30 orta, ,50 büyük etkidir.
Raporlama (APA)
Öğrencilerin sınav kaygısı puanları üç ölçüm arasında anlamlı biçimde farklılaştı, χ²(2, N = 27) = 12,91, p = ,002, W = ,24. Bonferroni düzeltmeli ikili karşılaştırmalara göre kaygı puanları final haftasında (Mdn = 16) dönem başına göre (Mdn = 13) daha yüksek olma eğilimindeydi, z = 3,40, düzeltilmiş p = ,002. Ara sınav haftasındaki puanlar (Mdn = 15) ne dönem başından (düzeltilmiş p = ,062) ne de final haftasından (düzeltilmiş p = ,829) anlamlı biçimde farklıydı.
Sonuçları tabloyla da verebilirsin:
| Ölçüm | Medyan | Ç₁–Ç₃ | Sıra ortalaması |
|---|---|---|---|
| Dönem başı | 13 | 11–17 | 1,48 |
| Ara sınav | 15 | 14–17 | 2,11 |
| Final | 16 | 13–19 | 2,41 |
Ç₁–Ç₃: birinci ve üçüncü çeyrek. Tablonun altına kişi sayısını, testi ve ikili karşılaştırmaları not olarak yaz: n = 27; χ²(2, N = 27) = 12,91, p = ,002, W = ,24; Bonferroni düzeltmeli karşılaştırmalara göre yalnız dönem başı ile final haftası arasındaki fark anlamlı.
Sonuç anlamlı çıkmadıysa
- "Ölçümler aynı" deme. "Ölçümler arasında anlamlı bir fark bulunmadı" de. Anlamlı çıkmaması, farkın olmadığını kanıtlamaz.
- İkili karşılaştırmalarda fark arama. Yeni pencere bu durumda ikili karşılaştırma tablosunu zaten vermez. Wilcoxon testleriyle tek tek çiftlere bakmak birinci tip hata riskini artırır.
- Yine χ², sd, N, p ve W değerlerini raporla. Özellikle örneklem küçükse test gerçek bir farkı kaçırmış olabilir.
- Sonucu anlamlı yapmak için testi değiştirme ya da veri çıkarma. Testi, analizden önce araştırma sorusuna ve verinin yapısına göre seçersin.
Sık yapılan hatalar
- Üç ölçümü düzeltmesiz Wilcoxon testleriyle karşılaştırmak. Birinci tip hata olasılığı şişer. Önce Friedman testi yapılır, anlamlıysa düzeltilmiş ikili karşılaştırmalara geçilir.
- Pairwise Comparisons tablosunda Sig. sütununa göre karar vermek. Karar Adj. Sig. sütunuyla verilir.
- Tekrarlı ölçümleri bağımsız gruplar gibi analiz etmek. Zamanı bir grup değişkeni yapıp Kruskal-Wallis ya da tek yönlü ANOVA çalıştırmak, aynı kişilerin ölçüldüğü bilgisini atar.
- Deney ve kontrol grubunu ayrı ayrı Friedman testiyle sınayıp "program etkili" demek. Bu, grup × zaman etkileşimini sınamaz.
- Yalnız küresellik sağlanmıyor diye Friedman testine geçmek. Tekrarlı ölçümler ANOVA'sında Greenhouse-Geisser düzeltmesini kullan.
- Testi "ortalamaları karşılaştırır" diye anlatmak. Friedman testi her kişinin içindeki sıraları karşılaştırır. Raporda ortalama ve standart sapma değil, medyan ve sıra ortalaması ver.
- Raporda "p = ,000" yazmak. Doğrusu p < ,001.
Kaynaklar
- Benavoli, A., Corani, G. ve Mangili, F. (2016). Should we really use post-hoc tests based on mean-ranks? Journal of Machine Learning Research, 17(5), 1–10. https://jmlr.org/papers/v17/benavoli16a.html
- Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2. baskı). Lawrence Erlbaum.
- Dunn, O. J. (1964). Multiple comparisons using rank sums. Technometrics, 6(3), 241–252. https://doi.org/10.1080/00401706.1964.10490181
- Field, A. (2018). Discovering statistics using IBM SPSS Statistics (5. baskı). SAGE.
- Friedman, M. (1937). The use of ranks to avoid the assumption of normality implicit in the analysis of variance. Journal of the American Statistical Association, 32(200), 675–701. https://doi.org/10.1080/01621459.1937.10503522
- Fritz, C. O., Morris, P. E. ve Richler, J. J. (2012). Effect size estimates: Current use, calculations, and interpretation. Journal of Experimental Psychology: General, 141(1), 2–18. https://doi.org/10.1037/a0024338
- Kendall, M. G. ve Babington Smith, B. (1939). The problem of m rankings. The Annals of Mathematical Statistics, 10(3), 275–287. https://doi.org/10.1214/aoms/1177732186
- Tomczak, M. ve Tomczak, E. (2014). The need to report effect size estimates revisited. An overview of some recommended measures of effect size. Trends in Sport Sciences, 21(1), 19–25.