Lisansüstü tezlerde en çok sınanan ve en çok yanlış anlaşılan varsayım normalliktir. Hemen her bulgular bölümü bir Shapiro-Wilk ya da Kolmogorov-Smirnov tablosuyla açılır, p değeri 0,05’in altına düşer düşmez öğrenci parametrik olmayan testlere kaçar ya da tam tersine, tabloyu göstermelik bir ritüel gibi ekleyip geçer. Oysa normallik varsayımı ne her koşulda belirleyicidir ne de görmezden gelinebilir; önemi, hangi analizi yaptığınıza, örneklemin büyüklüğüne ve sapmanın biçimine göre değişir. Bu yazı, o değişkenliği bir karar mantığına dönüştürmeyi amaçlıyor.
Varsayım Aslında Neye Ait?
Kavramın en kritik ve en az bilinen yanı şudur: parametrik testlerin normallik varsayımı, ham verinin kendisine değil, test istatistiğinin örnekleme dağılımına ilişkindir. Bağımsız örneklem t-testi, gruplardaki puanların normal dağılmasını değil, örneklem ortalamaları arasındaki farkın normal dağılmasını gerektirir. ANOVA’da bu koşul, her grup içindeki hataların normal dağılması biçiminde ifade edilir. Regresyonda ise ne bağımlı ne de bağımsız değişkenin dağılımı söz konusudur; varsayım doğrudan artıklara, yani gözlenen değerlerle model tarafından kestirilen değerler arasındaki farklara aittir.
Bu ayrımın pratik sonucu büyüktür. Bir regresyon modelinde bağımlı değişkenin histogramı çarpık diye modelden vazgeçmek gerekmez; bakılması gereken, model kurulduktan sonra artıkların dağılımıdır. Benzer biçimde, bir bağımsız değişkenin iki değerli olması ya da yaş gibi bir değişkenin sağa çarpık olması, regresyonun normallik varsayımını ihlal etmez. Ham veriye uygulanan normallik testleri, aslında sorulmayan bir soruya cevap verir. Bu yüzden analiz raporlarında hangi büyüklüğün normalliğinin sınandığı açıkça belirtilmelidir.
Merkezi Limit Teoremi ve Örneklem Büyüklüğü
Örnekleme dağılımının neden bu kadar önemli olduğunu merkezi limit teoremi açıklar. Popülasyon hangi biçimde dağılırsa dağılsın, yeterince büyük örneklemlerden alınan ortalamaların dağılımı normale yaklaşır. Ders kitaplarındaki “n ≥ 30” kuralı bu teoremin kaba bir özetidir: orta düzeyde çarpık dağılımlarda, grup başına otuz civarı gözlem, ortalamanın örnekleme dağılımını t-testinin güvenle çalışacağı kadar simetrik hale getirir. Kural işe yarar, fakat sınırları vardır.
İlk sınır, sapmanın şiddetidir. Ağır çarpıklık taşıyan bir dağılımda (gelir, bekleme süresi, hata sayısı gibi değişkenlerde sıkça görülen uzun sağ kuyruk) otuz gözlem yeterli olmayabilir; yakınsama için yüzlerce gözlem gerekebilir. İkinci sınır uç değerlerdir. Birkaç aşırı gözlem, örneklem büyüklüğünden bağımsız olarak ortalamayı ve varyansı kendine çeker; teorem “sonunda” normale yaklaşmayı garanti eder ama tek bir örneklemde standart hatanın doğru kestirileceğini garanti etmez. Üçüncü sınır, testin türüdür. Merkezi limit teoremi ortalamalar için çalışır; varyanslara dayalı testler ve küçük gruplu karşılaştırmalar bu güvenceden aynı ölçüde yararlanamaz. Kısacası, büyük örneklem normallik kaygısını hafifletir ama ortadan kaldırmaz; hafifletmenin derecesi sapmanın biçimine bağlıdır.
Normallik Nasıl Değerlendirilir?
Normallik testleri arasında Shapiro-Wilk, özellikle küçük ve orta büyüklükteki örneklemlerde Kolmogorov-Smirnov’a göre belirgin biçimde daha güçlüdür. SPSS’in sunduğu Lilliefors düzeltmeli Kolmogorov-Smirnov, normalden sapmaları yakalamakta zayıftır ve küçük örneklemlerde ihlali gözden kaçırabilir. Bu nedenle bir test raporlanacaksa tercih Shapiro-Wilk olmalıdır.
Ne var ki her iki testin de ortak bir sorunu vardır: anlamlılık testi oldukları için örneklem büyüdükçe güçleri artar ve pratik açıdan önemsiz sapmaları bile anlamlı bulurlar. Beş yüz kişilik bir örneklemde neredeyse hiçbir ölçek puanı Shapiro-Wilk’ten geçmez; buna karşın aynı sapma, t-testinin sonuçlarını hiç etkilemeyecek kadar küçük olabilir. Tersi de doğrudur: yirmi kişilik bir örneklemde test, ciddi bir çarpıklığı bile anlamlı bulamayabilir. Bu asimetri nedeniyle normallik kararı yalnızca p değerine yaslanmamalıdır.
Daha sağlıklı bir yaklaşım, sapmanın büyüklüğünü doğrudan ölçmektir. Çarpıklık ve basıklık katsayıları bunu sağlar. Alanyazında iki yaygın ölçüt kullanılır: George ve Mallery’nin önerdiği, her iki katsayının da ±2 aralığında kalmasını yeterli sayan gevşek ölçüt ile Tabachnick ve Fidell’in de yer verdiği, ±1 aralığını ideal kabul eden daha sıkı ölçüt. Hangi ölçütün seçildiği raporda belirtilmeli ve tutarlı biçimde uygulanmalıdır. Bunların yanına histogram ve Q-Q grafiği eklenmelidir; grafikler, sapmanın nereden kaynaklandığını (tek bir uç değer mi, sistematik bir kuyruk mu, tavan etkisi mi) sayıların gösteremeyeceği biçimde açığa çıkarır.
| Yöntem | Ne zaman uygun | Nasıl yorumlanır |
|---|---|---|
| Shapiro-Wilk testi | Küçük ve orta örneklemler (yaklaşık n < 50–100) | p > 0,05 normallikten anlamlı sapma olmadığını gösterir; büyük örneklemde tek başına kullanılmaz |
| Kolmogorov-Smirnov (Lilliefors) | Yalnızca alternatif yoksa; gücü düşüktür | Shapiro-Wilk ile aynı mantık, ancak sapmaları kaçırma olasılığı yüksektir |
| Çarpıklık ve basıklık katsayıları | Her örneklem büyüklüğünde, özellikle n > 100 | ±1 (sıkı) veya ±2 (gevşek) aralığı; ölçüt raporda belirtilir |
| Histogram | Her durumda, ön inceleme olarak | Simetri, tek tepelilik, tavan/taban etkisi gözle değerlendirilir |
| Q-Q grafiği | Her durumda, özellikle artıklar için | Noktaların doğru üzerinde toplanması beklenir; kuyruklardaki sapmalar uç değerlere işaret eder |
Varsayım Sağlanmıyorsa Ne Yapılır?
Normallik ihlali bir hüküm değil, bir teşhistir; tedavi ihlalin nedenine göre belirlenir. İlk adım her zaman uç değer incelemesidir. Sapmanın kaynağı birkaç aşırı gözlemse, bunların veri girişi hatası mı, farklı bir alt popülasyondan gelen gözlemler mi yoksa gerçek ama nadir değerler mi olduğu araştırılır. Hatalı kayıtlar düzeltilir ya da çıkarılır; gerçek uç değerler ise gerekçesiz atılmaz, çünkü örneklemi temsil ettiği evrenden koparmak bulguların geçerliğini zedeler.
İkinci seçenek dönüşümdür. Sağa çarpık ve pozitif değerli değişkenlerde logaritmik dönüşüm, sayım verilerinde karekök dönüşümü dağılımı simetriye yaklaştırabilir. Ancak dönüşümün bir yorum bedeli vardır: artık yordadığınız şey gelir değil, gelirin logaritmasıdır ve katsayılar bu ölçekte anlam taşır. Tersine dönüşümle geri çevrilen kestirimler ortalamayı değil geometrik ortalamayı temsil eder. Dönüşüm, yalnızca sonuçlar bu ölçekte anlamlı biçimde yorumlanabiliyorsa tercih edilmelidir.
Üçüncü ve çoğu zaman en verimli yol, sağlam (robust) yöntemlerdir. Welch t-testi ve Welch ANOVA, varyans eşitsizliğine karşı dayanıklıdır ve normallikten ılımlı sapmalarda da klasik testlerden daha güvenilir sonuç verir. Bootstrap yöntemi ise örnekleme dağılımını kuramsal bir varsayımdan değil, verinin kendisinden yeniden örnekleme yoluyla türetir; güven aralıkları böylece normallik gerektirmeden hesaplanır. Ortalamalar üzerinden yorum yapmayı sürdürmek istiyorsanız ve örneklem çok küçük değilse bootstrap, parametrik olmayan testlere göre daha az bilgi kaybettirir.
Parametrik olmayan testler (Mann-Whitney U, Kruskal-Wallis, Wilcoxon) en son değil, belirli koşullarda ilk seçenektir: bağımlı değişken gerçekten sıralı düzeydeyse, örneklem küçük ve dağılım ağır çarpıksa ya da sorunuz ortalamalardan çok sıralamalarla ilgiliyse. Şunu unutmamak gerekir: bu testler ortalamaları değil dağılımları karşılaştırır ve grupların dağılım biçimi farklıysa “medyan farkı” yorumu bile her zaman geçerli olmaz. Hangi yolun sizin tasarımınıza uyduğunu netleştirmek için hangi testi seçmeliyim aracı iyi bir başlangıç noktası sunar.
Likert Ölçekleri ve Toplam Puanlar
Sosyal bilim tezlerinde normallik tartışmasının büyük bölümü Likert tipi ölçeklerde düğümlenir. Tek bir madde, beş ya da yedi kategorili sıralı bir değişkendir; normal dağılması beklenmez ve tek maddeye dayalı karşılaştırmalar için sıralı yöntemler daha uygundur. Ancak tezlerde analiz edilen şey çoğunlukla tek madde değil, on ya da yirmi maddenin toplamı veya ortalamasıdır. Çok sayıda maddeden oluşan toplam puanlar, hem olası değer sayısının artması hem de merkezi limit teoreminin madde düzeyinde işlemesi nedeniyle sürekli değişkene yaklaşır ve pratikte aralık ölçeği gibi ele alınır.
Bu noktada dikkat edilmesi gereken, toplam puanın simetrisinden çok tavan ve taban etkileridir. Katılımcıların büyük çoğunluğunun en üst seçenekleri işaretlediği bir memnuniyet ölçeğinde çarpıklık yapısaldır; dönüşüm bu sorunu çözmez, çünkü sorun dağılımın biçiminde değil ölçme aracının ayırt edicilik gücündedir. Böyle durumlarda hem çarpıklık değerlerini raporlamak hem de sağlam yöntemlerle sonuçların değişip değişmediğini göstermek, okuru ikna etmenin en dürüst yoludur.
Regresyon ve SEM’de Normallik
Çoklu regresyonda normallik, yukarıda vurgulandığı gibi artıklara ilişkindir ve model kurulduktan sonra sınanır. Standartlaştırılmış artıkların histogramı ve normal olasılık grafiği bu iş için yeterlidir; ayrıca artıkların kestirilen değerlere karşı saçılım grafiği, normallik ihlalinin çoğu zaman eşlik ettiği değişen varyans sorununu da görünür kılar. Katsayı kestirimleri normallik ihlalinde yanlı hale gelmez; etkilenen şey standart hatalar ve dolayısıyla p değerleridir. Bu yüzden ihlal durumunda sağlam standart hatalar ya da bootstrap güven aralıkları çoğunlukla yeterli bir çözümdür.
Yapısal eşitlik modellemesinde ise en yaygın kestirim yöntemi olan maksimum olabilirlik, çok değişkenli normallik varsayar. Tek tek değişkenlerin normal olması bu koşulu garanti etmez; bu yüzden Mardia’nın çok değişkenli çarpıklık ve basıklık katsayıları raporlanır. Mardia basıklık değeri için normalleştirilmiş kestirimin 5’in üzerinde olması, pratikte sorun yaratacak düzeyde bir ihlale işaret eder. Böyle bir durumda üç yol açıktır: Satorra-Bentler ölçeklendirmeli ki-kare ve sağlam standart hatalar sunan robust ML kestirimi, AMOS gibi yazılımlarda kolayca uygulanabilen bootstrap, ya da sıralı göstergeler için ağırlıklandırılmış en küçük kareler (WLSMV) yaklaşımı. Ölçüm modelinden yapısal modele uzanan bu kararlar, yapısal eşitlik modellemesi uygulamalarında uyum indekslerini de doğrudan etkilediği için erken aşamada verilmelidir.
Tezde Nasıl Raporlanır?
İyi bir normallik raporu, hangi büyüklüğün, hangi ölçütle ve hangi sonuçla değerlendirildiğini birkaç cümlede anlatır; sayfalarca test tablosu yerine yorumlanmış bir özet sunar. Aşağıdaki paragraf bunun bir örneğidir.
“Analizlere geçilmeden önce bağımlı değişkenlerin dağılımı incelenmiştir. Örneklem büyüklüğü (n = 412) nedeniyle normallik testlerinin küçük sapmalara aşırı duyarlı olacağı dikkate alınarak, karar çarpıklık ve basıklık katsayıları ile grafik incelemeye dayandırılmıştır. Akademik motivasyon toplam puanının çarpıklık değeri -0,43 (SH = 0,12), basıklık değeri 0,28 (SH = 0,24); tükenmişlik toplam puanının çarpıklık değeri 0,71, basıklık değeri 0,36 olarak hesaplanmıştır. Tüm değerler ±1 ölçütü (Tabachnick ve Fidell, 2013) içinde kaldığından ve histogram ile Q-Q grafikleri normalden belirgin bir sapma göstermediğinden, dağılımlar parametrik analizler için yeterli kabul edilmiştir. Regresyon analizinde ayrıca standartlaştırılmış artıkların normal olasılık grafiği incelenmiş ve doğrusal bir örüntü gözlenmiştir.”
Ölçütün belirtilmesi, örneklem büyüklüğünün karara nasıl yansıdığının açıklanması ve artıklara ayrıca değinilmesi, bu paragrafı sıradan bir tablodan ayıran unsurlardır. Jüri üyelerinin normallik konusunda sordukları soruların çoğu tam da bu üç noktaya yönelir; tez savunmasına hazırlık sürecinde bu gerekçeleri kendi cümlelerinizle anlatabilmek, tablonun kendisinden daha değerlidir. Varsayım kontrollerinin bütünü, sağlam bir veri analizi sürecinin görünmeyen ama belirleyici katmanını oluşturur.
Sık Sorulan Sorular
Shapiro-Wilk anlamlı çıktı, hemen Mann-Whitney’e mi geçmeliyim?
Hayır. Önce örneklem büyüklüğüne, çarpıklık ve basıklık değerlerine ve grafiklere bakın. Grup başına otuzun üzerinde gözlem varsa ve katsayılar ±1 aralığındaysa, anlamlı bir Shapiro-Wilk sonucu tek başına parametrik testten vazgeçmeyi gerektirmez. Sapma belirginse, Welch testi ya da bootstrap güven aralıkları ortalama yorumunu korurken daha güvenilir sonuç verir; parametrik olmayan test, dağılım ağır çarpık ve örneklem küçükse öne çıkar.
Bağımsız değişkenlerimin normal dağılması gerekir mi?
Regresyon ve ANOVA’da hayır. Bağımsız değişkenler kategorik, iki değerli ya da çarpık olabilir; varsayım artıklara aittir. Bağımsız değişkenlerde dikkat edilmesi gereken normallik değil, aşırı uç değerlerin ve yüksek kaldıraç noktalarının varlığıdır, çünkü bunlar katsayıları orantısız biçimde etkileyebilir.
Çarpıklık için ±1 mi, ±2 mi kullanmalıyım?
Her ikisi de alanyazında kabul görür; önemli olan seçiminizi kaynağıyla belirtmek ve tüm değişkenlere aynı ölçütü uygulamaktır. ±1 daha muhafazakârdır ve küçük örneklemlerde tercih edilebilir; ±2 büyük örneklemlerde ve merkezi limit teoreminin devreye girdiği durumlarda savunulabilir. Değerler iki ölçüt arasında kalıyorsa, sağlam bir yöntemle sonuçların değişmediğini göstermek en güvenli yoldur.
SEM’de Mardia katsayısı yüksekse model geçersiz mi olur?
Model geçersiz olmaz; ancak standart ML ile hesaplanan ki-kare ve standart hatalar yanlı olabilir. Robust ML kestirimi ya da bootstrap ile analizi yineleyip düzeltilmiş uyum indekslerini ve güven aralıklarını raporlamak yeterlidir. Sonuçlar iki kestirim arasında önemli ölçüde değişmiyorsa bu da bulguların dayanıklılığına ilişkin güçlü bir kanıttır.