İçeriğe geç
Etki Büyüklüğü Nedir? p Değeri Neden Tek Başına Yetmez?
Bilgilendirme: Bu yazı akademik süreçler hakkında genel bilgi vermek amacıyla hazırlanmıştır. Ressar, öğrenci adına tez yazma hizmeti sunmaz; yalnızca veri analizi, istatistik ve metodoloji danışmanlığı sağlar.

Tez savunmalarında ve hakem raporlarında giderek daha sık duyulan bir soru var: “Sonuç anlamlı, tamam; peki etki ne kadar büyük?” Bu soru, p değerinin tek başına bir bulguyu anlatmaya yetmediğinin en somut göstergesidir. Bu yazıda p değerinin gerçekte ne söylediğini, neden yanıltıcı biçimde okunduğunu ve etki büyüklüğü ölçülerinin bu boşluğu nasıl doldurduğunu, hesaplama ve raporlama örnekleriyle birlikte ele alacağız.

p Değeri Aslında Ne Söyler, Ne Söylemez?

Teknik tanımıyla p değeri, sıfır hipotezinin doğru olduğu varsayımı altında, gözlenen sonucun ya da ondan daha uç bir sonucun elde edilme olasılığıdır. Dikkat ederseniz bu tanımda iki koşullu ifade var: verinin olasılığı, hipotez verili iken hesaplanır. Yani p = ,03 demek “sıfır hipotezi doğruysa bu kadar uç bir veriyi görme olasılığı yüzde üçtür” demektir; “hipotezin yanlış olma olasılığı yüzde 97’dir” demek değildir. Bu ikisi birbirine çok benzer görünür, ancak mantıksal olarak tamamen farklı önermelerdir.

Amerikan İstatistik Derneği’nin 2016 tarihli bildirisi (Wasserstein & Lazar, 2016) tam da bu yanlış okumaları hedef alır. Bildirinin altı ilkesinden ikisi konumuz açısından belirleyicidir: p değeri, incelenen hipotezin doğru olma olasılığını ölçmez ve bir etkinin büyüklüğünü ya da bir sonucun önemini göstermez. Küçük bir p değeri, etkinin küçük ya da büyük olduğuna dair hiçbir şey söylemez; yalnızca verinin sıfır hipoteziyle ne kadar uyumsuz olduğuna dair bir işarettir. Dahası, bu uyumsuzluk hem etkinin büyüklüğüne hem de örneklem büyüklüğüne bağlıdır.

Bu nedenle “p = ,001 elde ettik, sonuç çok güçlü” cümlesi, bir jüri üyesi için alarm zilidir. p değerinin küçüklüğü kanıtın gücünü değil, kanıtın sıfır hipoteziyle uyumsuzluğunu sıralar. Etkinin pratik anlamı, ancak etki büyüklüğü ve güven aralığıyla birlikte okunduğunda ortaya çıkar.

Büyük Örneklem, Küçük Etki: Somut Bir Örnek

Bir öğrencinin 5.000 katılımcıdan oluşan bir veri setinde, sosyal medya kullanım süresi ile akademik erteleme arasında r = ,04 korelasyon bulduğunu düşünelim. Bu değer için hesaplanan t istatistiği yaklaşık 2,83 ve iki yönlü p değeri ,005’tir. Kâğıt üzerinde “istatistiksel olarak anlamlı” bir ilişki vardır. Oysa r = ,04, açıklanan varyansın binde iki (r² = ,0016) civarında olduğu anlamına gelir; başka bir deyişle sosyal medya süresi, ertelemedeki değişkenliğin yüzde 0,16’sını açıklamaktadır. Aynı korelasyon 50 kişilik bir örneklemde bulunsaydı p değeri ,78 civarında olur ve kimse anlamlılıktan söz etmezdi.

Bu örnek, anlamlılık testinin bir örneklem büyüklüğü fonksiyonu olduğunu gösterir. Yeterince büyük örneklemle sıfırdan farklı her etki, ne kadar önemsiz olursa olsun, “anlamlı” çıkar. Tersi de doğrudur: küçük örneklemlerde pratik olarak önemli bir etki, anlamlılık eşiğini aşamayabilir. Cumming (2014), bu kısır döngüden çıkışın yolu olarak “yeni istatistik” adını verdiği yaklaşımı önerir: tahmin, güven aralığı ve meta-analitik düşünce. Etki büyüklüğü bu yaklaşımın merkezindedir.

Etki Büyüklüğü Aileleri ve Yorumlama Eşikleri

Etki büyüklüğü, bir ilişkinin ya da farkın büyüklüğünü örneklem büyüklüğünden bağımsız bir ölçekte ifade eden standartlaştırılmış bir sayıdır. Kullanılan ölçü, araştırma sorusunun türüne göre değişir; bu nedenle ölçüleri aileler hâlinde düşünmek yararlıdır.

Fark tabanlı ölçüler: Cohen d ve Hedges g

Cohen d, iki grup ortalaması arasındaki farkın birleştirilmiş standart sapmaya bölünmesiyle elde edilir; sonuç, farkı “standart sapma birimi” cinsinden ifade eder. d = 0,50, iki grubun ortalamalarının yarım standart sapma ayrıldığını söyler. Hedges g aynı mantığa dayanır ancak küçük örneklemlerde d’nin etkiyi hafifçe abartma eğilimini düzelten bir katsayı içerir; toplam örneklem 20’nin altındaysa g tercih edilmelidir, daha büyük örneklemlerde iki değer neredeyse aynıdır. Cohen’in (1988) sınırları 0,20 (küçük), 0,50 (orta) ve 0,80 (büyük) biçimindedir.

İlişki tabanlı ölçüler: r ve türevleri

Pearson korelasyon katsayısı zaten bir etki büyüklüğüdür; ,10, ,30 ve ,50 sınırları küçük, orta ve büyük ilişkiyi işaret eder. r’nin karesi açıklanan varyans oranını verir. Regresyonda modelin bütünü için R² ve ondan türetilen Cohen f² (R² / (1 − R²)) kullanılır; f² için sınırlar ,02, ,15 ve ,35’tir.

Varyans açıklama ölçüleri: η², kısmi η² ve ω²

Varyans analizinde eta kare (η²), bir faktörün açıkladığı kareler toplamının toplam kareler toplamına oranıdır. Kısmi eta kare ise paydada yalnızca ilgili faktörün ve hatanın kareler toplamını tutar; çok faktörlü tasarımlarda diğer faktörlerin payı dışarıda bırakıldığı için değeri η²’den büyük çıkar ve farklı çalışmalar arasında doğrudan karşılaştırılamaz. Omega kare (ω²), η²’nin örneklemdeki yukarı yanlılığını düzelten, popülasyon değerine daha yakın bir tahmindir; özellikle küçük örneklemlerde raporlanması önerilir. Cohen’in η² için sınırları ,01, ,06 ve ,14’tür.

Kategorik veriler: Cramér V ve odds oranı

Ki-kare testinde 2×2 tablolar için phi (φ), daha büyük tablolar için Cramér V kullanılır; her ikisi de ki-kare istatistiğinin örneklem büyüklüğüne (ve serbestlik derecesine) göre ölçeklenmiş hâlidir. 2×2 tablo için ,10, ,30 ve ,50 sınırları geçerlidir; tablo büyüdükçe bu eşikler küçülür. Odds oranı (OR), bir olayın bir grupta gerçekleşme olasılığının diğer gruba oranını verir; OR = 1 etkisizlik noktasıdır, 1’den uzaklaştıkça etki büyür. Yaygın kullanılan yaklaşık eşikler 1,5 (küçük), 2,5 (orta) ve 4 (büyük) dolayındadır, ancak bu eşikler temel oranlara duyarlıdır.

Burada önemli bir uyarı gerekiyor. Cohen bu eşikleri, alanında hiçbir referans noktası olmayan araştırmacılar için “son çare” olarak önermiştir. Eğitim müdahalelerinde d = 0,30 yıllarca süren bir programın makul çıktısı sayılırken, farmakolojik bir çalışmada aynı değer önemsiz kalabilir. Doğru referans, kendi alanınızdaki meta-analizlerin ve benzer çalışmaların bildirdiği etki dağılımıdır. Tez metninde “Cohen’e göre orta düzey” demek yerine, alanınızdaki tipik değerlerle karşılaştırma yapmak çok daha ikna edicidir.

TestEtki büyüklüğü ölçüsüKüçükOrtaBüyük
Bağımsız / bağımlı t testiCohen d, Hedges g0,200,500,80
Pearson korelasyonr,10,30,50
Tek yönlü ANOVAη², ω²,01,06,14
Çok faktörlü ANOVAKısmi η²,01,06,14
Çoklu regresyonR², f²f² = ,02f² = ,15f² = ,35
Ki-kare (2×2)φ / Cramér V,10,30,50
Lojistik regresyonOdds oranı≈ 1,5≈ 2,5≈ 4

Etki Büyüklüğü İçin Güven Aralığı

Bir etki büyüklüğü, tıpkı ortalama gibi, örneklemden hesaplanan bir tahmindir ve bir belirsizlik payı taşır. d = 0,45 tek başına ne kadar güvenilir? Bunun cevabını güven aralığı verir. 30 kişilik iki grupla elde edilen d = 0,45 için %95 güven aralığı kabaca [−0,06; 0,96] gibi geniş bir bant olabilir; aynı d değeri 200 kişilik gruplarla [0,25; 0,65] gibi dar bir aralık verir. İlk durumda etkinin sıfır olması bile veriyle uyumludur; ikinci durumda küçük-orta düzeyde bir etkiden söz etmek gerçekten mümkündür.

Güven aralığı ayrıca p değerinin ikili mantığından kurtulmanızı sağlar. Aralığın alt sınırı pratik olarak önemli sayılan eşiğin altında kalıyorsa, sonuç anlamlı olsa bile “etkinin pratik önemi belirsizdir” demek dürüst bir yorumdur. Lakens’in (2013) uygulamalı rehberi, hem d hem de η² türü ölçüler için güven aralığı hesaplama yöntemlerini adım adım açıklar ve bu konuda başvurulacak ilk kaynaklardan biridir.

SPSS, R ve G*Power ile Hesaplama; Güç Analiziyle Bağ

SPSS’in 27 ve sonraki sürümlerinde bağımsız ve bağımlı örneklem t testi iletişim kutusunda “Etki büyüklüklerini tahmin et” seçeneği bulunur; işaretlendiğinde çıktıya Cohen d ve Hedges g, güven aralıklarıyla birlikte eklenir. Tek yönlü ANOVA’da aynı sürümlerden itibaren η², ε² ve ω² doğrudan raporlanır. Genel doğrusal model (Univariate) menüsünde ise “Seçenekler” altındaki “Etki büyüklüğü tahminleri” kutusu kısmi η² verir; bu değerin klasik η² olmadığını unutmayın. Ki-kare için “Çapraz Tablolar” iletişim kutusunda “İstatistikler” altından phi ve Cramér V, 2×2 tablolarda ise risk seçeneğiyle odds oranı istenir. Daha eski sürümlerde d’yi elle hesaplamanız gerekir; ortalama farkı ve standart sapmalar çıktıda zaten vardır. SPSS uygulamasında destek almak isterseniz anket ve SPSS analizi hizmetlerimiz bu adımı kapsar.

R tarafında effectsize paketi tek bir çatı altında cohens_d(), hedges_g(), eta_squared(), omega_squared(), cramers_v() ve oddsratio() fonksiyonlarını sunar; hepsi varsayılan olarak %95 güven aralığı döndürür. Paketin interpret_d() gibi yorumlama fonksiyonları farklı eşik kümeleri arasında seçim yapmanıza izin verir, bu da alan bağımlı yorumlama için kullanışlıdır.

Etki büyüklüğünün en kritik kullanımlarından biri, çalışma başlamadan önce örneklem büyüklüğünü belirlemektir. G*Power’da a priori güç analizi yaparken yazılım sizden beklenen etki büyüklüğünü ister; bu değeri pilot çalışmadan, literatürdeki meta-analizlerden ya da “tespit etmek istediğim en küçük anlamlı etki” mantığıyla belirlersiniz. Alfa ,05 ve güç ,80 için d = 0,50’yi tespit etmek her grupta yaklaşık 64 kişi gerektirirken, d = 0,20 için bu sayı grup başına yaklaşık 394’e çıkar. Bu ilişkiyi ayrıntılı işlediğimiz güç analizi rehberine ve etki büyüklüğü girdisiyle çalışan örneklem büyüklüğü hesaplayıcımıza göz atabilirsiniz.

APA 7’ye Göre Türkçe Raporlama Örnekleri

APA 7, sonuç cümlesinde test istatistiğini, serbestlik derecesini, kesin p değerini (,001’in altındaysa p < ,001) ve etki büyüklüğünü, mümkünse güven aralığıyla birlikte ister. Türkçe tezlerde ondalık ayracı virgüldür; 1’i aşamayan istatistiklerde (p, r, η²) baştaki sıfır yazılmaz, d ve F gibi 1’i aşabilenlerde yazılır. Aşağıdaki örnekler yalnızca biçimi göstermek için kurgulanmıştır.

  • t testi: Deney grubunun son test puanları (Ort = 72,4, SS = 8,1) kontrol grubundan (Ort = 66,9, SS = 9,0) anlamlı biçimde yüksekti, t(118) = 3,52, p < ,001, d = 0,64, %95 GA [0,27; 1,01].
  • ANOVA: Öğretim yöntemi, başarı puanları üzerinde anlamlı bir etkiye sahipti, F(2, 147) = 5,84, p = ,004, η² = ,07, %95 GA [,01; ,15].
  • Korelasyon: Öz yeterlik ile akademik başarı arasında pozitif ve orta düzeyde bir ilişki bulundu, r(248) = ,31, p < ,001, %95 GA [,19; ,42].
  • Ki-kare: Cinsiyet ile program tercihi arasındaki ilişki anlamlıydı, χ²(1, N = 312) = 9,47, p = ,002, φ = ,17; kadın katılımcıların programı tercih etme olasılığı erkeklerin yaklaşık iki katıydı, OR = 2,08, %95 GA [1,30; 3,33].
  • Regresyon: Üç yordayıcıdan oluşan model, tükenmişlik puanlarındaki varyansın %24’ünü açıkladı, R² = ,24, F(3, 196) = 20,6, p < ,001, f² = ,32. İş yükü en güçlü yordayıcıydı, β = ,28, p < ,001.

Etki büyüklüğünü yalnızca bulgular bölümünde bırakmayın. Tartışma bölümünde bu değerin literatürdeki benzer çalışmalarla karşılaştırılması, “anlamlı” kelimesinin ötesine geçen asıl akademik katkıdır. Hangi etki ölçüsünü raporlayacağınız, hangi testi seçtiğinize bağlıdır; bu nedenle etki büyüklüğü kararı, test seçimiyle birlikte ve analizden önce verilmelidir.

Jüride Sık Karşılaşılan Sorular ve Hazırlık

Savunmada etki büyüklüğüyle ilgili sorular genellikle üç biçimde gelir. İlki “Bu fark anlamlı ama pratikte ne ifade ediyor?” sorusudur; cevabınız d ya da η² değerini, alanınızdaki referans değerlerle ve mümkünse ham birimle (örneğin “yaklaşık beş puanlık bir fark, bu ölçekte bir harf notuna karşılık geliyor”) bağlamalıdır. İkincisi “Örnekleminiz büyük, anlamlılık bundan mı kaynaklanıyor?” sorusudur; burada etki büyüklüğünün örneklemden bağımsız olduğunu ve güven aralığının darlığının aslında bir avantaj olduğunu açıklamanız beklenir. Üçüncüsü “Neden kısmi eta kare raporladınız, klasik eta kare ile fark ne?” gibi teknik sorulardır; bu tür sorulara hazırlanmanın en iyi yolu, seçtiğiniz her ölçünün gerekçesini tez metninde önceden yazmış olmaktır.

Bir de tersinden gelen soru vardır: “Sonuç anlamlı değil, ama etki büyüklüğü orta düzeyde; bunu nasıl yorumluyorsunuz?” Bu, çoğu zaman düşük güçlü bir çalışmanın işaretidir ve dürüst cevap, güven aralığının genişliğine işaret edip daha büyük örneklemle tekrar önermektir. Bu tür senaryoları önceden prova etmek için tez savunması hazırlığı sayfamızdaki soru listelerinden yararlanabilirsiniz.

Sık Sorulan Sorular

p değeri anlamlı çıkmadıysa etki büyüklüğü yine de raporlanır mı?

Evet, hatta özellikle raporlanmalıdır. Anlamlı olmayan bir sonuçta etki büyüklüğü ve güven aralığı, etkinin gerçekten sıfıra yakın mı olduğunu yoksa çalışmanın onu tespit edecek güce mi sahip olmadığını ayırt etmenizi sağlar. Bu bilgi, ileride yapılacak meta-analizler için de vazgeçilmezdir.

Cohen d ile Hedges g arasında hangisini seçmeliyim?

İki ölçü aynı şeyi ölçer; g yalnızca küçük örneklemlerdeki yukarı yanlılığı düzeltir. Toplam örneklem 20’nin altındaysa g’yi tercih edin; daha büyük örneklemlerde fark üçüncü ondalıkta kalır ve d yaygın kabul gördüğü için yeterlidir. Hangisini raporlarsanız raporlayın, adını açıkça yazın ve güven aralığını ekleyin.

Kısmi eta kare ile eta kare arasındaki fark tezde önemli mi?

Tek faktörlü tasarımda ikisi aynı değeri verir. Birden fazla faktör olduğunda kısmi η² diğer faktörlerin varyansını paydadan çıkardığı için daha büyük çıkar ve çalışmalar arası karşılaştırmada yanıltabilir. SPSS’in varsayılan olarak kısmi η² verdiğini bilmek ve raporda hangisini kullandığınızı açıkça belirtmek yeterlidir; mümkünse ω²’yi de ekleyin.

Küçük bir etki büyüklüğü tezi değersiz kılar mı?

Hayır. Etkinin küçüklüğü, doğru bağlamda sunulduğunda kendisi bir bulgudur; örneğin geniş kitlelere uygulanan düşük maliyetli bir müdahalede d = 0,15 toplumsal ölçekte anlamlı olabilir. Önemli olan, değeri alanınızdaki referanslarla karşılaştırmanız ve sınırlılıklar bölümünde güven aralığını dürüstçe tartışmanızdır.

Etki büyüklüğü, p değerinin cevaplayamadığı “ne kadar?” sorusunun cevabıdır ve iyi bir tezde anlamlılık testinin yanında değil, onun önünde durur. Analizinizde hangi ölçünün uygun olduğu, güven aralıklarının nasıl hesaplanacağı ya da bulguların APA 7’ye uygun biçimde nasıl yazılacağı konusunda destek isterseniz, kısa bir talep formu ile çalışmanızın yöntemini birlikte gözden geçirebiliriz.