Likert ölçeği analizi, sosyal bilimlerde anket verisiyle çalışan hemen her araştırmacının karşısına aynı soruyu çıkarır: “Kesinlikle katılmıyorum”dan “Kesinlikle katılıyorum”a uzanan beş kutucuktan elde edilen veri, t-testi, ANOVA ve regresyon gibi parametrik yöntemlerle analiz edilebilir mi, yoksa ordinal doğası gereği yalnızca parametrik olmayan testlere mi izin verir? Bu tartışma on yıllardır sürüyor ve tez jürilerinde hâlâ en sık sorulan metodolojik sorulardan biri. Bu yazıda tartışmanın kökenini, tek madde ile ölçek puanı arasındaki belirleyici farkı, simülasyon literatürünün ne söylediğini, uygulanabilir karar kurallarını ve bulguların her iki yaklaşımla nasıl raporlanacağını ele alıyoruz.
Tartışmanın Kökeni: Ölçme Düzeyi ve İzin Verilen İstatistikler
Tartışma, Stevens’ın ölçme düzeyleri sınıflandırmasına dayanır. Bu çerçevede sıralı (ordinal) düzeyde ölçülen bir değişkenin kategorileri arasında bir sıra vardır, ancak aralıkların eşit olduğu varsayılamaz: “Katılmıyorum” ile “Kararsızım” arasındaki mesafenin, “Katılıyorum” ile “Kesinlikle katılıyorum” arasındaki mesafeye eşit olduğunu bilemeyiz. Ortalama ve standart sapma gibi istatistikler eşit aralık varsayımını gerektirdiğinden, katı yorumla ordinal veriye uygulanmamalıdır. Jamieson (2004), tam da bu gerekçeyle Likert verisinin ortalamayla özetlenmesini ve parametrik testlerle analiz edilmesini eleştiren, sık atıf alan uyarı niteliğinde bir metin kaleme almıştır.
Karşı görüş ise iki dayanağa sahiptir. Birincisi, parametrik testlerin ölçme düzeyi hakkında değil, verinin dağılımı hakkında varsayımda bulunduğudur; t-testi sayıların “ne anlama geldiğini” değil, örneklem ortalamalarının dağılımını sorgular. İkincisi, Likert tipi bir ölçeğin birden fazla maddesinin toplanması ya da ortalamasının alınmasıyla oluşan bileşik puanın, tek maddeden farklı davrandığıdır. Carifio ve Perla (2008), bu tartışmanın büyük bölümünün, Likert maddesi ile Likert ölçeği arasındaki ayrımın gözden kaçırılmasından kaynaklandığını savunur.
Tek Madde mi, Ölçek Puanı mı? Belirleyici Ayrım
Bir Likert maddesi, tek bir ifadeye verilen 1–5 (ya da 1–7) arası yanıttır ve ordinal bir değişkendir; bu konuda taraflar arasında gerçek bir anlaşmazlık yoktur. Beş kategoriye sıkışmış, çoğu zaman tavan ya da taban etkisi gösteren bu değişkenin ortalamasını “3,42” biçiminde raporlamak, kategoriler arasındaki mesafeleri bildiğimiz izlenimini yaratır ve yorumlama açısından zayıftır. Tek maddelik bir değişken bağımlı değişkenseniz, ordinal yöntemlere yönelmek metodolojik olarak en savunulabilir yoldur.
Likert tipi ölçek ise aynı yapıyı (örneğin iş doyumu, akademik öz yeterlik, örgütsel bağlılık) ölçmek üzere tasarlanmış birden fazla maddenin toplanması ya da ortalamasıyla elde edilen bileşik puandır. On maddelik beşli bir ölçekte toplam puan 10 ile 50 arasında 41 farklı değer alabilir; bu dağılım tek maddenin beş kategorisinden çok farklı, çoğu zaman yaklaşık simetrik ve çan biçimine yakın bir görünüm sergiler. Klasik test kuramı ve ölçek geliştirme geleneği, bu bileşik puanı gizil yapının yaklaşık aralıklı bir ölçümü olarak ele alır (Carifio & Perla, 2008; Harpe, 2015). Dolayısıyla “Likert verisi parametrik analiz edilir mi” sorusunun cevabı, neyi analiz ettiğinize bağlıdır: Tek madde için “genellikle hayır”, geçerliği ve güvenirliği kanıtlanmış bir ölçeğin toplam puanı için “genellikle evet”.
Simülasyon Literatürü Ne Söylüyor?
Norman (2010) ve parametrik testlerin sağlamlığı
Norman (2010), “Likert scales, levels of measurement and the laws of statistics” başlıklı makalesinde, parametrik testlerin ordinal ve normal dağılmayan Likert tipi verilerle uygulanmasının yol açtığı iddia edilen sorunları hem kuramsal hem ampirik olarak ele alır. Sonucu nettir: Pearson korelasyonu, t-testi ve ANOVA, verinin ordinal ya da çarpık olması, örneklem küçük olması ve varyanslar eşit olmaması durumlarında bile Tip I hata oranı açısından büyük ölçüde sağlamdır ve parametrik olmayan alternatiflerle neredeyse aynı sonuçlara ulaşır. Bu bulgu, on yıllardır süren simülasyon çalışmalarıyla tutarlıdır: Merkezi limit teoremi, örneklem ortalamalarının dağılımının, ham verinin biçiminden bağımsız olarak makul örneklem büyüklüklerinde normale yaklaşmasını sağlar.
Sağlamlığın sınırları
Sağlamlık koşulsuz değildir. Tek maddelik değişkenlerde, özellikle yanıtların büyük bölümü uç kategorilerde toplanmışsa (tavan ya da taban etkisi), parametrik testlerin gücü düşer ve ortalama farkı yorumlanması güç bir nicelik hâline gelir. Grup büyüklükleri çok eşitsiz ve varyanslar farklıysa klasik t-testi yerine Welch düzeltmesi tercih edilmelidir. Ayrıca sağlamlık, “ortalama 3,8’in anlamı nedir” sorusunu çözmez; testin Tip I hata oranını korumasıyla ortalamanın anlamlı bir özet olması ayrı meselelerdir. Norman’ın bulgusu parametrik testlerin “kullanılabileceğini” gösterir; her durumda “en iyi seçim” olduğunu değil.
Uygulanabilir Karar Kuralları
Tartışmayı uygulamaya çevirdiğimizde, dört sorudan oluşan bir karar sırası öneriyoruz. Birinci soru, analiz biriminin tek madde mi yoksa bileşik ölçek puanı mı olduğudur. Tek madde söz konusuysa gruplar arası karşılaştırmalar için Mann-Whitney U ya da Kruskal-Wallis, kategori dağılımlarını karşılaştırmak için ki-kare, birden fazla yordayıcının etkisini incelemek için sıralı (ordinal) lojistik regresyon uygun araçlardır. İkinci soru, bileşik puanın kaç maddeden oluştuğu ve güvenirliğinin ne düzeyde olduğudur. En az dört maddeden oluşan, iç tutarlılığı kabul edilebilir (genel kural olarak Cronbach alfa ≥ ,70) bir ölçek puanı için t-testi, ANOVA ve doğrusal regresyon çoğu durumda savunulabilir. Güvenirliğin yorumlanması konusunda Cronbach alfa nasıl yorumlanır yazımıza başvurabilirsiniz.
Üçüncü soru, ölçek puanının dağılımı ve örneklem büyüklüğüdür. Bileşik puanlarda çarpıklık ve basıklık değerlerinin ±1 (bazı kaynaklarda ±2) aralığında olması ve grup başına 30 civarı gözlem bulunması, parametrik testler için yeterli bir zemin oluşturur; bu koşullarda normallik testlerinin anlamlı çıkması tek başına parametrik olmayan yönteme geçmeyi gerektirmez. Dördüncü soru, bulguların hangi biçimde daha anlamlı yorumlanacağıdır: Ölçek puanı için ortalama fark ve Cohen d, tek madde için medyan, kategori yüzdeleri ve olasılık oranı daha doğal özetlerdir. Bu dört soruya verilen yanıtlar, hangi testin kullanılacağını büyük ölçüde belirler.
Normallik ve Örneklem Büyüklüğünün Rolü
Likert tartışmasında normallik varsayımı çoğu zaman yanlış yere yerleştirilir. Parametrik testlerin normallik varsayımı ham veriye değil, örneklem ortalamalarının (ya da regresyonda hataların) dağılımına ilişkindir. Bileşik ölçek puanının ham dağılımı hafif çarpıksa bile, grup başına 30’un üzerinde gözlemle ortalamaların dağılımı normale yeterince yaklaşır. Kolmogorov-Smirnov ve Shapiro-Wilk testleri büyük örneklemlerde küçük sapmaları bile anlamlı bulduğundan, karar için çarpıklık ve basıklık katsayılarına ve histogram ile Q-Q grafiğine bakmak daha bilgilendiricidir. Bu konunun ayrıntıları için normallik varsayımı ne zaman önemlidir yazımızı öneririz.
Örneklem büyüklüğü iki yönden önemlidir. Küçük örneklemlerde (grup başına 15’in altında) merkezi limit teoremi devreye girmez; ham dağılım belirgin biçimde çarpıksa parametrik olmayan test daha güvenli olur. Büyük örneklemlerde ise asıl sorun anlamlılık değil, anlamlılığın pratik önemidir: 600 kişilik bir örneklemde 0,15 puanlık bir ortalama farkı istatistiksel olarak anlamlı çıkabilir, ancak beşli bir ölçekte bu farkın kuramsal ya da uygulamalı bir karşılığı olmayabilir. Bu nedenle etki büyüklüğü raporlamak zorunludur ve örneklem büyüklüğü, planlama aşamasında beklenen etki büyüklüğüne göre önceden hesaplanmalıdır.
Beşli mi Yedili mi? Nötr Orta Nokta Sorunu
Kategori sayısı, ölçeğin aralıklı veriye ne kadar yaklaştığını etkiler. Yedili ölçek, beşliye göre daha fazla ayrım sağlar, tavan etkisini azaltır ve bileşik puanın dağılımını daha sürekli hâle getirir; psikometrik literatür, güvenirliğin genellikle beş ile yedi kategori arasında plato yaptığını, daha fazla kategorinin katılımcı için ayırt edilemez hâle geldiğini gösterir. Beşli ölçek ise yanıt yükünü düşürür ve Türkçe uyarlamalarda yaygın olduğundan karşılaştırılabilirlik sağlar. Ölçek uyarlıyorsanız orijinal formatı korumak, yeni ölçek geliştiriyorsanız yedili formatı düşünmek makul bir yaklaşımdır.
Nötr orta nokta (“Kararsızım”, “Ne katılıyorum ne katılmıyorum”) ayrı bir tartışma konusudur. Orta noktayı içermek, gerçekten kararsız katılımcıların zorla bir tarafa itilmesini engeller; çıkarmak ise sosyal beğenirlik ya da ilgisizlik nedeniyle ortaya yığılmayı azaltır. Analiz açısından önemli olan, orta noktanın “bilmiyorum” ya da “uygulanamaz” seçeneğiyle karıştırılmamasıdır; bu ikisi ölçek üzerinde bir konum değil, eksik veri kategorisidir ve toplam puana dahil edilmemelidir. Orta noktaya yığılma tek maddede belirgin bir tepe oluşturur ve bu maddenin ordinal ele alınması gerektiğine dair bir işaret olarak okunmalıdır.
Jüri İtirazları ve Savunma Stratejileri
Tez savunmalarında Likert verisine ilişkin itirazlar birkaç kalıba oturur. En yaygını “Bu veri ordinaldir, t-testi kullanamazsınız” itirazıdır. Yanıt, analiz biriminin tek madde değil, güvenirliği raporlanmış çok maddeli bir ölçek puanı olduğunu belirtmek; bu puanın yaklaşık aralıklı kabul edildiğini Carifio ve Perla (2008) ile Harpe (2015) üzerinden gerekçelendirmek ve parametrik testlerin bu tür verilerle sağlamlığını Norman (2010) simülasyonlarına dayandırmaktır. İkinci itiraz “Normallik testi anlamlı çıktı, neden ANOVA yaptınız” biçimindedir. Burada normallik varsayımının ortalamaların dağılımına ilişkin olduğu, örneklem büyüklüğünün yeterli olduğu ve çarpıklık-basıklık değerlerinin kabul edilebilir aralıkta kaldığı gösterilmelidir.
Üçüncü ve en sağlıklı itiraz, “Parametrik olmayan testle sonuç değişiyor mu” sorusudur. Bu soruya en iyi yanıt, savunma öncesinde her iki analizi de yapmış olmak ve sonuçların tutarlı olduğunu bir cümleyle raporlamaktır; tutarsızlık varsa bu, dağılımla ilgili gerçek bir sorunun işaretidir ve ciddiye alınmalıdır. Dördüncü itiraz ölçeğin tek maddelerine ilişkin “ortalama” raporlamalarına yöneliktir; madde düzeyinde betimsel istatistikleri frekans ve yüzdelerle, ölçek düzeyinde ortalama ve standart sapmayla sunmak bu itirazı baştan önler. Jüri hazırlığı ve anket ve SPSS analizi sürecinde bu senaryoların önceden çalışılması, savunmayı belirgin biçimde rahatlatır.
Etki Büyüklükleri ve Raporlama Örnekleri
Hangi yöntem seçilirse seçilsin, p değeri tek başına yeterli değildir; etki büyüklüğü bulgunun pratik anlamını taşır. Parametrik analizlerde iki grup için Cohen d, ANOVA için eta kare ya da kısmi eta kare, regresyon için standardize katsayılar ve R² raporlanır. Parametrik olmayan analizlerde Mann-Whitney U için r = Z / √N, Kruskal-Wallis için epsilon kare, sıralı lojistik regresyon için olasılık oranları (odds ratio) ve güven aralıkları kullanılır. Aşağıdaki iki örnek, aynı araştırma sorusunun (kadın ve erkek öğretmenlerin iş doyumu düzeyleri farklı mıdır) iki farklı yaklaşımla nasıl raporlanabileceğini gösterir.
Parametrik raporlama (12 maddelik ölçek puanı): “İş doyumu ölçeği toplam puanının (α = ,88) cinsiyete göre farklılaşıp farklılaşmadığı bağımsız örneklemler t-testi ile incelenmiştir. Çarpıklık (−0,41) ve basıklık (0,22) değerleri kabul edilebilir aralıkta olup Levene testi varyansların homojenliğini göstermiştir (p = ,31). Kadın öğretmenlerin iş doyumu puanları (Ort. = 3,92; SS = 0,54; n = 164), erkek öğretmenlerinkinden (Ort. = 3,71; SS = 0,61; n = 138) anlamlı düzeyde yüksek bulunmuştur; t(300) = 3,17; p = ,002; Cohen d = 0,37; %95 GA [0,08; 0,34]. Etki büyüklüğü küçük ile orta arasındadır.”
Parametrik olmayan raporlama (tek madde: “İşimden genel olarak memnunum”): “Tek maddelik genel memnuniyet ifadesine verilen yanıtlar ordinal düzeyde ele alınmış ve cinsiyete göre Mann-Whitney U testi ile karşılaştırılmıştır. Kadın öğretmenlerin medyan yanıtı 4 (ÇAA = 1), erkek öğretmenlerin medyan yanıtı 4 (ÇAA = 2) olup sıra ortalamaları sırasıyla 162,4 ve 138,5’tir. Fark istatistiksel olarak anlamlıdır; U = 9.531; Z = −2,48; p = ,013; r = ,14. Kadın öğretmenlerin %68,3’ü, erkek öğretmenlerin %57,2’si ifadeye ‘katılıyorum’ ya da ‘kesinlikle katılıyorum’ yanıtını vermiştir.” Her iki metinde de test istatistiği, serbestlik derecesi ya da örneklem büyüklüğü, tam p değeri ve etki büyüklüğü birlikte yer alır; APA yedinci sürüm bu ögelerin tümünü ister.
| Durum | Önerilen yaklaşım | Tipik testler | Etki büyüklüğü |
|---|---|---|---|
| Tek Likert maddesi, iki grup | Ordinal / parametrik olmayan | Mann-Whitney U, ki-kare | r, Cramér V |
| Tek Likert maddesi, üç ve üzeri grup | Ordinal / parametrik olmayan | Kruskal-Wallis, ki-kare | Epsilon kare |
| Tek Likert maddesi, çoklu yordayıcı | Ordinal regresyon | Sıralı lojistik regresyon | Olasılık oranı |
| Ölçek puanı (4+ madde, α ≥ ,70), n ≥ 30/grup | Parametrik | t-testi, ANOVA, doğrusal regresyon | Cohen d, η², R² |
| Ölçek puanı, küçük örneklem ve belirgin çarpıklık | Parametrik olmayan veya sağlam yöntemler | Mann-Whitney, Kruskal-Wallis, bootstrap | r, epsilon kare |
| Ölçek puanı, eşit olmayan varyanslar | Parametrik (düzeltmeli) | Welch t-testi, Welch ANOVA | Cohen d, ω² |
Sık Sorulan Sorular
Likert ölçeği verisiyle korelasyon analizi yapabilir miyim?
Ölçek toplam puanları arasında Pearson korelasyonu yaygın ve savunulabilir bir uygulamadır; Norman (2010) bu testin ordinal veriyle de sağlam olduğunu göstermiştir. Tek maddeler arasındaki ilişkiler için Spearman rho ya da Kendall tau tercih edilmelidir; çok az kategori söz konusuysa polikorik korelasyon daha doğru bir tahmin verir. Faktör analizi bağlamında da tek maddeler için polikorik korelasyon matrisi kullanılması giderek daha sık önerilmektedir.
Ölçek puanını toplam mı yoksa ortalama olarak mı hesaplamalıyım?
İstatistiksel açıdan ikisi doğrusal dönüşümle birbirine bağlıdır ve test sonuçları değişmez. Ortalama puan, orijinal yanıt ölçeğinde (1–5) yorumlanabildiği ve madde sayısı farklı alt boyutları karşılaştırmayı kolaylaştırdığı için raporlamada genellikle tercih edilir. Ölçeğin orijinal geliştiricisi toplam puan kullanmışsa ve kesme noktaları toplam puana göre tanımlanmışsa, karşılaştırılabilirlik için o yöntemi izlemek gerekir.
Ters kodlanmış maddeleri ne zaman çevirmeliyim?
Ters ifadeli maddeler, güvenirlik analizinden ve toplam puan hesabından önce mutlaka yeniden kodlanmalıdır; aksi hâlde Cronbach alfa yapay olarak düşer ve toplam puan anlamsızlaşır. Beşli ölçekte dönüşüm 6 − x, yedili ölçekte 8 − x biçimindedir. Yeniden kodlama sonrasında madde-toplam korelasyonlarının pozitif olduğunu kontrol etmek, dönüşümün doğru yapıldığının basit bir doğrulamasıdır.
Parametrik ve parametrik olmayan testler farklı sonuç verirse hangisini raporlamalıyım?
Önce farkın nedenini anlamaya çalışın: Aykırı değerler, belirgin çarpıklık ya da küçük örneklem çoğu zaman açıklayıcıdır. Analiz planınızda önceden belirlediğiniz testi ana bulgu olarak raporlayıp diğerini duyarlılık analizi olarak sunmak, sonuç seçmek (p-hacking) izlenimini önler. İki sonuç niteliksel olarak farklıysa (biri anlamlı diğeri değilse), bunu gizlemek yerine açıkça tartışmak ve bulguyu ihtiyatla yorumlamak bilimsel açıdan doğru olan yoldur.
Likert verisinin parametrik testlerle analiz edilip edilemeyeceği sorusunun cevabı, “her zaman” ya da “asla” değil, “neyi, hangi koşullarda analiz ettiğinize bağlı olarak”dır. Tek maddeyi ordinal doğasına uygun ele almak, güvenirliği kanıtlanmış ölçek puanlarında parametrik yöntemleri etki büyüklükleriyle birlikte kullanmak ve şüpheli durumlarda her iki yaklaşımı da raporlamak, hem metodolojik olarak savunulabilir hem de jüri karşısında güven veren bir çerçeve sunar. Anket verinizin analiz planı ya da raporlaması konusunda metodolojik destek almak isterseniz, talep formu üzerinden ölçeğinizi ve araştırma sorularınızı bizimle paylaşabilirsiniz.