İçeriğe geç
Likert Verisi Parametrik Testlerle Analiz Edilir mi?
Bilgilendirme: Bu yazı akademik süreçler hakkında genel bilgi vermek amacıyla hazırlanmıştır. Ressar, öğrenci adına tez yazma hizmeti sunmaz; yalnızca veri analizi, istatistik ve metodoloji danışmanlığı sağlar.

Likert ölçeği analizi, sosyal bilimlerde anket verisiyle çalışan hemen her araştırmacının karşısına aynı soruyu çıkarır: “Kesinlikle katılmıyorum”dan “Kesinlikle katılıyorum”a uzanan beş kutucuktan elde edilen veri, t-testi, ANOVA ve regresyon gibi parametrik yöntemlerle analiz edilebilir mi, yoksa ordinal doğası gereği yalnızca parametrik olmayan testlere mi izin verir? Bu tartışma on yıllardır sürüyor ve tez jürilerinde hâlâ en sık sorulan metodolojik sorulardan biri. Bu yazıda tartışmanın kökenini, tek madde ile ölçek puanı arasındaki belirleyici farkı, simülasyon literatürünün ne söylediğini, uygulanabilir karar kurallarını ve bulguların her iki yaklaşımla nasıl raporlanacağını ele alıyoruz.

Tartışmanın Kökeni: Ölçme Düzeyi ve İzin Verilen İstatistikler

Tartışma, Stevens’ın ölçme düzeyleri sınıflandırmasına dayanır. Bu çerçevede sıralı (ordinal) düzeyde ölçülen bir değişkenin kategorileri arasında bir sıra vardır, ancak aralıkların eşit olduğu varsayılamaz: “Katılmıyorum” ile “Kararsızım” arasındaki mesafenin, “Katılıyorum” ile “Kesinlikle katılıyorum” arasındaki mesafeye eşit olduğunu bilemeyiz. Ortalama ve standart sapma gibi istatistikler eşit aralık varsayımını gerektirdiğinden, katı yorumla ordinal veriye uygulanmamalıdır. Jamieson (2004), tam da bu gerekçeyle Likert verisinin ortalamayla özetlenmesini ve parametrik testlerle analiz edilmesini eleştiren, sık atıf alan uyarı niteliğinde bir metin kaleme almıştır.

Karşı görüş ise iki dayanağa sahiptir. Birincisi, parametrik testlerin ölçme düzeyi hakkında değil, verinin dağılımı hakkında varsayımda bulunduğudur; t-testi sayıların “ne anlama geldiğini” değil, örneklem ortalamalarının dağılımını sorgular. İkincisi, Likert tipi bir ölçeğin birden fazla maddesinin toplanması ya da ortalamasının alınmasıyla oluşan bileşik puanın, tek maddeden farklı davrandığıdır. Carifio ve Perla (2008), bu tartışmanın büyük bölümünün, Likert maddesi ile Likert ölçeği arasındaki ayrımın gözden kaçırılmasından kaynaklandığını savunur.

Tek Madde mi, Ölçek Puanı mı? Belirleyici Ayrım

Bir Likert maddesi, tek bir ifadeye verilen 1–5 (ya da 1–7) arası yanıttır ve ordinal bir değişkendir; bu konuda taraflar arasında gerçek bir anlaşmazlık yoktur. Beş kategoriye sıkışmış, çoğu zaman tavan ya da taban etkisi gösteren bu değişkenin ortalamasını “3,42” biçiminde raporlamak, kategoriler arasındaki mesafeleri bildiğimiz izlenimini yaratır ve yorumlama açısından zayıftır. Tek maddelik bir değişken bağımlı değişkenseniz, ordinal yöntemlere yönelmek metodolojik olarak en savunulabilir yoldur.

Likert tipi ölçek ise aynı yapıyı (örneğin iş doyumu, akademik öz yeterlik, örgütsel bağlılık) ölçmek üzere tasarlanmış birden fazla maddenin toplanması ya da ortalamasıyla elde edilen bileşik puandır. On maddelik beşli bir ölçekte toplam puan 10 ile 50 arasında 41 farklı değer alabilir; bu dağılım tek maddenin beş kategorisinden çok farklı, çoğu zaman yaklaşık simetrik ve çan biçimine yakın bir görünüm sergiler. Klasik test kuramı ve ölçek geliştirme geleneği, bu bileşik puanı gizil yapının yaklaşık aralıklı bir ölçümü olarak ele alır (Carifio & Perla, 2008; Harpe, 2015). Dolayısıyla “Likert verisi parametrik analiz edilir mi” sorusunun cevabı, neyi analiz ettiğinize bağlıdır: Tek madde için “genellikle hayır”, geçerliği ve güvenirliği kanıtlanmış bir ölçeğin toplam puanı için “genellikle evet”.

Simülasyon Literatürü Ne Söylüyor?

Norman (2010) ve parametrik testlerin sağlamlığı

Norman (2010), “Likert scales, levels of measurement and the laws of statistics” başlıklı makalesinde, parametrik testlerin ordinal ve normal dağılmayan Likert tipi verilerle uygulanmasının yol açtığı iddia edilen sorunları hem kuramsal hem ampirik olarak ele alır. Sonucu nettir: Pearson korelasyonu, t-testi ve ANOVA, verinin ordinal ya da çarpık olması, örneklem küçük olması ve varyanslar eşit olmaması durumlarında bile Tip I hata oranı açısından büyük ölçüde sağlamdır ve parametrik olmayan alternatiflerle neredeyse aynı sonuçlara ulaşır. Bu bulgu, on yıllardır süren simülasyon çalışmalarıyla tutarlıdır: Merkezi limit teoremi, örneklem ortalamalarının dağılımının, ham verinin biçiminden bağımsız olarak makul örneklem büyüklüklerinde normale yaklaşmasını sağlar.

Sağlamlığın sınırları

Sağlamlık koşulsuz değildir. Tek maddelik değişkenlerde, özellikle yanıtların büyük bölümü uç kategorilerde toplanmışsa (tavan ya da taban etkisi), parametrik testlerin gücü düşer ve ortalama farkı yorumlanması güç bir nicelik hâline gelir. Grup büyüklükleri çok eşitsiz ve varyanslar farklıysa klasik t-testi yerine Welch düzeltmesi tercih edilmelidir. Ayrıca sağlamlık, “ortalama 3,8’in anlamı nedir” sorusunu çözmez; testin Tip I hata oranını korumasıyla ortalamanın anlamlı bir özet olması ayrı meselelerdir. Norman’ın bulgusu parametrik testlerin “kullanılabileceğini” gösterir; her durumda “en iyi seçim” olduğunu değil.

Uygulanabilir Karar Kuralları

Tartışmayı uygulamaya çevirdiğimizde, dört sorudan oluşan bir karar sırası öneriyoruz. Birinci soru, analiz biriminin tek madde mi yoksa bileşik ölçek puanı mı olduğudur. Tek madde söz konusuysa gruplar arası karşılaştırmalar için Mann-Whitney U ya da Kruskal-Wallis, kategori dağılımlarını karşılaştırmak için ki-kare, birden fazla yordayıcının etkisini incelemek için sıralı (ordinal) lojistik regresyon uygun araçlardır. İkinci soru, bileşik puanın kaç maddeden oluştuğu ve güvenirliğinin ne düzeyde olduğudur. En az dört maddeden oluşan, iç tutarlılığı kabul edilebilir (genel kural olarak Cronbach alfa ≥ ,70) bir ölçek puanı için t-testi, ANOVA ve doğrusal regresyon çoğu durumda savunulabilir. Güvenirliğin yorumlanması konusunda Cronbach alfa nasıl yorumlanır yazımıza başvurabilirsiniz.

Üçüncü soru, ölçek puanının dağılımı ve örneklem büyüklüğüdür. Bileşik puanlarda çarpıklık ve basıklık değerlerinin ±1 (bazı kaynaklarda ±2) aralığında olması ve grup başına 30 civarı gözlem bulunması, parametrik testler için yeterli bir zemin oluşturur; bu koşullarda normallik testlerinin anlamlı çıkması tek başına parametrik olmayan yönteme geçmeyi gerektirmez. Dördüncü soru, bulguların hangi biçimde daha anlamlı yorumlanacağıdır: Ölçek puanı için ortalama fark ve Cohen d, tek madde için medyan, kategori yüzdeleri ve olasılık oranı daha doğal özetlerdir. Bu dört soruya verilen yanıtlar, hangi testin kullanılacağını büyük ölçüde belirler.

Normallik ve Örneklem Büyüklüğünün Rolü

Likert tartışmasında normallik varsayımı çoğu zaman yanlış yere yerleştirilir. Parametrik testlerin normallik varsayımı ham veriye değil, örneklem ortalamalarının (ya da regresyonda hataların) dağılımına ilişkindir. Bileşik ölçek puanının ham dağılımı hafif çarpıksa bile, grup başına 30’un üzerinde gözlemle ortalamaların dağılımı normale yeterince yaklaşır. Kolmogorov-Smirnov ve Shapiro-Wilk testleri büyük örneklemlerde küçük sapmaları bile anlamlı bulduğundan, karar için çarpıklık ve basıklık katsayılarına ve histogram ile Q-Q grafiğine bakmak daha bilgilendiricidir. Bu konunun ayrıntıları için normallik varsayımı ne zaman önemlidir yazımızı öneririz.

Örneklem büyüklüğü iki yönden önemlidir. Küçük örneklemlerde (grup başına 15’in altında) merkezi limit teoremi devreye girmez; ham dağılım belirgin biçimde çarpıksa parametrik olmayan test daha güvenli olur. Büyük örneklemlerde ise asıl sorun anlamlılık değil, anlamlılığın pratik önemidir: 600 kişilik bir örneklemde 0,15 puanlık bir ortalama farkı istatistiksel olarak anlamlı çıkabilir, ancak beşli bir ölçekte bu farkın kuramsal ya da uygulamalı bir karşılığı olmayabilir. Bu nedenle etki büyüklüğü raporlamak zorunludur ve örneklem büyüklüğü, planlama aşamasında beklenen etki büyüklüğüne göre önceden hesaplanmalıdır.

Beşli mi Yedili mi? Nötr Orta Nokta Sorunu

Kategori sayısı, ölçeğin aralıklı veriye ne kadar yaklaştığını etkiler. Yedili ölçek, beşliye göre daha fazla ayrım sağlar, tavan etkisini azaltır ve bileşik puanın dağılımını daha sürekli hâle getirir; psikometrik literatür, güvenirliğin genellikle beş ile yedi kategori arasında plato yaptığını, daha fazla kategorinin katılımcı için ayırt edilemez hâle geldiğini gösterir. Beşli ölçek ise yanıt yükünü düşürür ve Türkçe uyarlamalarda yaygın olduğundan karşılaştırılabilirlik sağlar. Ölçek uyarlıyorsanız orijinal formatı korumak, yeni ölçek geliştiriyorsanız yedili formatı düşünmek makul bir yaklaşımdır.

Nötr orta nokta (“Kararsızım”, “Ne katılıyorum ne katılmıyorum”) ayrı bir tartışma konusudur. Orta noktayı içermek, gerçekten kararsız katılımcıların zorla bir tarafa itilmesini engeller; çıkarmak ise sosyal beğenirlik ya da ilgisizlik nedeniyle ortaya yığılmayı azaltır. Analiz açısından önemli olan, orta noktanın “bilmiyorum” ya da “uygulanamaz” seçeneğiyle karıştırılmamasıdır; bu ikisi ölçek üzerinde bir konum değil, eksik veri kategorisidir ve toplam puana dahil edilmemelidir. Orta noktaya yığılma tek maddede belirgin bir tepe oluşturur ve bu maddenin ordinal ele alınması gerektiğine dair bir işaret olarak okunmalıdır.

Jüri İtirazları ve Savunma Stratejileri

Tez savunmalarında Likert verisine ilişkin itirazlar birkaç kalıba oturur. En yaygını “Bu veri ordinaldir, t-testi kullanamazsınız” itirazıdır. Yanıt, analiz biriminin tek madde değil, güvenirliği raporlanmış çok maddeli bir ölçek puanı olduğunu belirtmek; bu puanın yaklaşık aralıklı kabul edildiğini Carifio ve Perla (2008) ile Harpe (2015) üzerinden gerekçelendirmek ve parametrik testlerin bu tür verilerle sağlamlığını Norman (2010) simülasyonlarına dayandırmaktır. İkinci itiraz “Normallik testi anlamlı çıktı, neden ANOVA yaptınız” biçimindedir. Burada normallik varsayımının ortalamaların dağılımına ilişkin olduğu, örneklem büyüklüğünün yeterli olduğu ve çarpıklık-basıklık değerlerinin kabul edilebilir aralıkta kaldığı gösterilmelidir.

Üçüncü ve en sağlıklı itiraz, “Parametrik olmayan testle sonuç değişiyor mu” sorusudur. Bu soruya en iyi yanıt, savunma öncesinde her iki analizi de yapmış olmak ve sonuçların tutarlı olduğunu bir cümleyle raporlamaktır; tutarsızlık varsa bu, dağılımla ilgili gerçek bir sorunun işaretidir ve ciddiye alınmalıdır. Dördüncü itiraz ölçeğin tek maddelerine ilişkin “ortalama” raporlamalarına yöneliktir; madde düzeyinde betimsel istatistikleri frekans ve yüzdelerle, ölçek düzeyinde ortalama ve standart sapmayla sunmak bu itirazı baştan önler. Jüri hazırlığı ve anket ve SPSS analizi sürecinde bu senaryoların önceden çalışılması, savunmayı belirgin biçimde rahatlatır.

Etki Büyüklükleri ve Raporlama Örnekleri

Hangi yöntem seçilirse seçilsin, p değeri tek başına yeterli değildir; etki büyüklüğü bulgunun pratik anlamını taşır. Parametrik analizlerde iki grup için Cohen d, ANOVA için eta kare ya da kısmi eta kare, regresyon için standardize katsayılar ve R² raporlanır. Parametrik olmayan analizlerde Mann-Whitney U için r = Z / √N, Kruskal-Wallis için epsilon kare, sıralı lojistik regresyon için olasılık oranları (odds ratio) ve güven aralıkları kullanılır. Aşağıdaki iki örnek, aynı araştırma sorusunun (kadın ve erkek öğretmenlerin iş doyumu düzeyleri farklı mıdır) iki farklı yaklaşımla nasıl raporlanabileceğini gösterir.

Parametrik raporlama (12 maddelik ölçek puanı): “İş doyumu ölçeği toplam puanının (α = ,88) cinsiyete göre farklılaşıp farklılaşmadığı bağımsız örneklemler t-testi ile incelenmiştir. Çarpıklık (−0,41) ve basıklık (0,22) değerleri kabul edilebilir aralıkta olup Levene testi varyansların homojenliğini göstermiştir (p = ,31). Kadın öğretmenlerin iş doyumu puanları (Ort. = 3,92; SS = 0,54; n = 164), erkek öğretmenlerinkinden (Ort. = 3,71; SS = 0,61; n = 138) anlamlı düzeyde yüksek bulunmuştur; t(300) = 3,17; p = ,002; Cohen d = 0,37; %95 GA [0,08; 0,34]. Etki büyüklüğü küçük ile orta arasındadır.”

Parametrik olmayan raporlama (tek madde: “İşimden genel olarak memnunum”): “Tek maddelik genel memnuniyet ifadesine verilen yanıtlar ordinal düzeyde ele alınmış ve cinsiyete göre Mann-Whitney U testi ile karşılaştırılmıştır. Kadın öğretmenlerin medyan yanıtı 4 (ÇAA = 1), erkek öğretmenlerin medyan yanıtı 4 (ÇAA = 2) olup sıra ortalamaları sırasıyla 162,4 ve 138,5’tir. Fark istatistiksel olarak anlamlıdır; U = 9.531; Z = −2,48; p = ,013; r = ,14. Kadın öğretmenlerin %68,3’ü, erkek öğretmenlerin %57,2’si ifadeye ‘katılıyorum’ ya da ‘kesinlikle katılıyorum’ yanıtını vermiştir.” Her iki metinde de test istatistiği, serbestlik derecesi ya da örneklem büyüklüğü, tam p değeri ve etki büyüklüğü birlikte yer alır; APA yedinci sürüm bu ögelerin tümünü ister.

DurumÖnerilen yaklaşımTipik testlerEtki büyüklüğü
Tek Likert maddesi, iki grupOrdinal / parametrik olmayanMann-Whitney U, ki-karer, Cramér V
Tek Likert maddesi, üç ve üzeri grupOrdinal / parametrik olmayanKruskal-Wallis, ki-kareEpsilon kare
Tek Likert maddesi, çoklu yordayıcıOrdinal regresyonSıralı lojistik regresyonOlasılık oranı
Ölçek puanı (4+ madde, α ≥ ,70), n ≥ 30/grupParametrikt-testi, ANOVA, doğrusal regresyonCohen d, η², R²
Ölçek puanı, küçük örneklem ve belirgin çarpıklıkParametrik olmayan veya sağlam yöntemlerMann-Whitney, Kruskal-Wallis, bootstrapr, epsilon kare
Ölçek puanı, eşit olmayan varyanslarParametrik (düzeltmeli)Welch t-testi, Welch ANOVACohen d, ω²

Sık Sorulan Sorular

Likert ölçeği verisiyle korelasyon analizi yapabilir miyim?

Ölçek toplam puanları arasında Pearson korelasyonu yaygın ve savunulabilir bir uygulamadır; Norman (2010) bu testin ordinal veriyle de sağlam olduğunu göstermiştir. Tek maddeler arasındaki ilişkiler için Spearman rho ya da Kendall tau tercih edilmelidir; çok az kategori söz konusuysa polikorik korelasyon daha doğru bir tahmin verir. Faktör analizi bağlamında da tek maddeler için polikorik korelasyon matrisi kullanılması giderek daha sık önerilmektedir.

Ölçek puanını toplam mı yoksa ortalama olarak mı hesaplamalıyım?

İstatistiksel açıdan ikisi doğrusal dönüşümle birbirine bağlıdır ve test sonuçları değişmez. Ortalama puan, orijinal yanıt ölçeğinde (1–5) yorumlanabildiği ve madde sayısı farklı alt boyutları karşılaştırmayı kolaylaştırdığı için raporlamada genellikle tercih edilir. Ölçeğin orijinal geliştiricisi toplam puan kullanmışsa ve kesme noktaları toplam puana göre tanımlanmışsa, karşılaştırılabilirlik için o yöntemi izlemek gerekir.

Ters kodlanmış maddeleri ne zaman çevirmeliyim?

Ters ifadeli maddeler, güvenirlik analizinden ve toplam puan hesabından önce mutlaka yeniden kodlanmalıdır; aksi hâlde Cronbach alfa yapay olarak düşer ve toplam puan anlamsızlaşır. Beşli ölçekte dönüşüm 6 − x, yedili ölçekte 8 − x biçimindedir. Yeniden kodlama sonrasında madde-toplam korelasyonlarının pozitif olduğunu kontrol etmek, dönüşümün doğru yapıldığının basit bir doğrulamasıdır.

Parametrik ve parametrik olmayan testler farklı sonuç verirse hangisini raporlamalıyım?

Önce farkın nedenini anlamaya çalışın: Aykırı değerler, belirgin çarpıklık ya da küçük örneklem çoğu zaman açıklayıcıdır. Analiz planınızda önceden belirlediğiniz testi ana bulgu olarak raporlayıp diğerini duyarlılık analizi olarak sunmak, sonuç seçmek (p-hacking) izlenimini önler. İki sonuç niteliksel olarak farklıysa (biri anlamlı diğeri değilse), bunu gizlemek yerine açıkça tartışmak ve bulguyu ihtiyatla yorumlamak bilimsel açıdan doğru olan yoldur.

Likert verisinin parametrik testlerle analiz edilip edilemeyeceği sorusunun cevabı, “her zaman” ya da “asla” değil, “neyi, hangi koşullarda analiz ettiğinize bağlı olarak”dır. Tek maddeyi ordinal doğasına uygun ele almak, güvenirliği kanıtlanmış ölçek puanlarında parametrik yöntemleri etki büyüklükleriyle birlikte kullanmak ve şüpheli durumlarda her iki yaklaşımı da raporlamak, hem metodolojik olarak savunulabilir hem de jüri karşısında güven veren bir çerçeve sunar. Anket verinizin analiz planı ya da raporlaması konusunda metodolojik destek almak isterseniz, talep formu üzerinden ölçeğinizi ve araştırma sorularınızı bizimle paylaşabilirsiniz.