Tez önerisi hazırlayan hemen her öğrencinin danışmanına sorduğu ilk somut soru aynıdır: “Kaç kişi gerekir?” Sorunun tek bir doğru cevabı olmadığını fark etmek, yöntem bölümünü sağlam kurmanın ilk adımıdır. Çünkü bu soru aslında iki farklı soruyu gizler. Bir evrenin özelliğini belirli bir hata payıyla tahmin etmek istiyorsanız cevap bir formülden gelir; iki grup arasındaki farkı ya da iki değişken arasındaki ilişkiyi sınamak istiyorsanız cevap güç analizinden gelir. Bu iki yaklaşım aynı çalışmada yan yana durabilir, ama birbirinin yerine geçemez. Aşağıda önce bu ayrımı netleştirecek, ardından G*Power ile a priori güç analizini adım adım yürütecek ve bulduğunuz sayıyı öneri metninde nasıl gerekçelendireceğinizi göstereceğiz. Hızlı bir ön hesap için ücretsiz örneklem büyüklüğü hesaplayıcısını kullanabilir, yazıyı ise o sayının arkasındaki mantığı kavramak için okuyabilirsiniz.
İki Soru, İki Yaklaşım: Tahmin mi, Hipotez Testi mi?
Betimsel amaçlı bir tarama çalışmasında hedef, evrendeki bir oranı ya da ortalamayı belirli bir güven düzeyinde ve belirli bir hata payıyla kestirmektir. Bu durumda klasik Cochran formülü devreye girer: n₀ = z²·p·(1−p)/e². Yüzde 95 güven düzeyi için z = 1,96, en tutucu senaryo olan p = 0,50 ve ±%5 hata payı (e = 0,05) girildiğinde n₀ = 3,8416 × 0,25 / 0,0025 ≈ 384,16 bulunur; bu sayı yukarı yuvarlanarak literatürde sık gördüğünüz 385 değerine ulaşılır. Evren büyüklüğü biliniyorsa sonlu evren düzeltmesi uygulanır: n = n₀ / (1 + (n₀ − 1)/N). Örneğin 10.000 kişilik bir evrende bu düzeltme örneklemi yaklaşık 370’e indirir. Dikkat edilirse evren yüz binlere çıksa bile sayı 385’in üzerine çıkmaz; evren büyüklüğü, yaygın kanının aksine, gereken örneklemi çok az etkiler.
Bu formülün cevapladığı soru “evrendeki oranı ne kadar hassas tahmin edebilirim” sorusudur. Oysa lisansüstü tezlerin büyük bölümü tahmin değil, hipotez testi yapar: cinsiyete göre tükenmişlik farklılaşıyor mu, öz-yeterlik iş doyumunu yorduyor mu, üç öğretim yöntemi başarıyı farklı etkiliyor mu? Bu sorularda gereken örneklem, hata payından değil, yakalamak istediğiniz etkinin büyüklüğünden ve onu kaçırma riskinizi ne kadar düşük tutmak istediğinizden belirlenir. İşte güç analizi tam olarak bunu hesaplar. Bir tez önerisinde Cochran formülüyle 385 kişi belirleyip sonra dört yordayıcılı bir regresyon ya da üç gruplu bir ANOVA raporlamak, doğru formülü yanlış soruya uygulamaktır; jüri üyeleri bu uyumsuzluğu giderek daha sık fark etmektedir.
Güç Analizinin Dört Bileşeni ve Aralarındaki Takas
Bir güç analizi dört nicelik arasındaki matematiksel ilişkiye dayanır: anlamlılık düzeyi (α), güç (1−β), etki büyüklüğü ve örneklem büyüklüğü (n). Bunlardan üçü bilindiğinde dördüncüsü hesaplanabilir. α, gerçekte fark yokken “fark var” deme riskidir ve gelenek olarak 0,05 alınır. β ise gerçekte var olan bir etkiyi kaçırma riskidir; güç bu riskin tümleyenidir ve yaygın kabul 0,80’dir, yani gerçek bir etkiyi beş denemenin dördünde yakalamayı hedeflersiniz. Etki büyüklüğü, o farkın ya da ilişkinin ne kadar büyük olduğunu standart birimlerle ifade eder. Örneklem büyüklüğü ise bu üçünün belirlediği hedefe ulaşmanın bedelidir.
Aralarındaki takas sezgisel olarak şöyle işler: küçük bir etkiyi yakalamak büyük örneklem ister, çünkü sinyal gürültüden ancak çok gözlemle ayrışır. Daha yüksek güç istemek de örneklemi büyütür; 0,80 yerine 0,95 hedeflemek t-testinde gereken sayıyı yaklaşık iki katına çıkarır. α’yı 0,01’e çekmek benzer şekilde daha çok katılımcı gerektirir. Tek yönlü hipotez, aynı etki için iki yönlüye göre daha az katılımcı ister, ancak yönü gerçekten kuramsal olarak öngörebiliyorsanız savunulabilir. Etki büyüklüğünü yorumlarken en yaygın başvuru kaynağı Cohen’in ölçütleridir; aşağıdaki tablo, G*Power’da karşınıza çıkacak beş ölçü için bu eşikleri özetler.
| Etki büyüklüğü ölçüsü | Kullanıldığı test | Küçük | Orta | Büyük |
|---|---|---|---|---|
| Cohen d | t-testleri (iki ortalama farkı) | 0,20 | 0,50 | 0,80 |
| r | Korelasyon | 0,10 | 0,30 | 0,50 |
| Cohen f | ANOVA (üç ve daha çok grup) | 0,10 | 0,25 | 0,40 |
| Cohen f² | Çoklu regresyon | 0,02 | 0,15 | 0,35 |
| Cohen w | Ki-kare testleri | 0,10 | 0,30 | 0,50 |
Bu eşiklerin Cohen tarafından davranış bilimleri için önerilmiş genel kılavuzlar olduğunu, alanınızdaki tipik etkilerin bunlardan farklı olabileceğini unutmayın. Eğitim araştırmalarında 0,25’lik bir d müdahale etkisi için hiç de küçük sayılmazken, deneysel psikolojide 0,80 sıradan olabilir.
G*Power’da Adım Adım: Dört Yaygın Senaryo
G*Power’ın arayüzü üç kararla başlar. Önce “Test family” menüsünden test ailesi seçilir: t-testleri için t tests, ANOVA ve regresyon için F tests, korelasyon için Exact ya da t tests, ki-kare için χ² tests. Sonra “Statistical test” listesinden somut test belirlenir. Üçüncü karar “Type of power analysis” kutusudur; burada veri toplamadan önce yapılan hesaplama için mutlaka A priori seçilmelidir. Bu tür, etki büyüklüğü, α ve güç girildiğinde gereken n’yi verir. Ardından “Input Parameters” bölümü doldurulur, “Calculate” tuşuna basılır ve “Output Parameters” bölümünde toplam örneklem ile gerçekleşen güç okunur. Hangi testi seçmeniz gerektiğinden emin değilseniz, önce hangi testi seçmeliyim aracıyla araştırma sorunuzu teste eşleştirmeniz, sonra G*Power’a geçmeniz daha sağlıklıdır; çünkü güç analizi, seçilen teste göre tamamen farklı sonuçlar verir.
Örnek 1: Bağımsız Örneklem t-Testi
İki grubun ortalamasını karşılaştıracaksınız. Test family: t tests; Statistical test: Means: Difference between two independent means (two groups); Type: A priori. Tails: Two; Effect size d: 0,50; α err prob: 0,05; Power: 0,80; Allocation ratio N2/N1: 1. Sonuç, grup başına 64, toplam 128 katılımcıdır. Aynı ayarlarla d = 0,20 girilirse grup başına sayı 394’e fırlar; küçük etkilerin neden pahalı olduğunu bu tek örnek gösterir.
Örnek 2: Tek Yönlü ANOVA
Üç öğretim yöntemini karşılaştırıyorsunuz. Test family: F tests; Statistical test: ANOVA: Fixed effects, omnibus, one-way; Type: A priori. Effect size f: 0,25; α: 0,05; Power: 0,80; Number of groups: 3. G*Power toplam 159 katılımcı verir, yani grup başına 53. Grup sayısı arttıkça toplam örneklem de artar; aynı f değeriyle dört grup için sayı 180’e yükselir. ANOVA sonrası çoklu karşılaştırmalar planlıyorsanız, omnibus testin gücünün ikili karşılaştırmaların gücünü garanti etmediğini de aklınızda tutun.
Örnek 3: Çoklu Doğrusal Regresyon
Dört yordayıcının bir bağımlı değişkeni ne ölçüde açıkladığını sınıyorsunuz. Test family: F tests; Statistical test: Linear multiple regression: Fixed model, R² deviation from zero; Type: A priori. Effect size f²: 0,15; α: 0,05; Power: 0,80; Number of predictors: 4. Sonuç 85 katılımcıdır. f² ile R² arasındaki dönüşüm f² = R²/(1−R²) olduğundan, 0,15’lik f² yaklaşık 0,13’lük bir R²’ye karşılık gelir; literatürde R² raporlanmışsa bu dönüşümle f² türetebilirsiniz. Belirli bir yordayıcının katkısını (R² artışını) sınayacaksanız “R² increase” seçeneğini kullanmanız gerekir ve sayı değişir.
Örnek 4: Pearson Korelasyonu
İki sürekli değişken arasındaki ilişkiyi inceliyorsunuz. Test family: Exact; Statistical test: Correlation: Bivariate normal model; Type: A priori. Tails: Two; Correlation ρ H1: 0,30; α: 0,05; Power: 0,80; Correlation ρ H0: 0. Sonuç 84 katılımcıdır. Aynı hesabı t tests ailesindeki “Correlation: Point biserial model” ile yaparsanız 82 civarı bir değer görürsünüz; iki yaklaşım arasındaki küçük fark, kullanılan dağılım modelinden kaynaklanır ve hangisini kullandığınızı raporlamanız yeterlidir.
Etki Büyüklüğünü Nereden Bulmalı?
Güç analizinin en kritik ve en çok ihmal edilen girdisi etki büyüklüğüdür; α ve güç neredeyse her zaman geleneksel değerlerini alırken etki büyüklüğü sizin araştırma bağlamınıza aittir. En sağlam kaynak, aynı değişkenleri benzer bir örneklemde inceleyen bir meta-analizin havuzlanmış etkisidir. Bu yoksa, doğrudan ilgili birkaç birincil çalışmanın raporladığı d, r ya da η² değerleri kullanılabilir; η²’den f’ye geçiş f = √(η²/(1−η²)) formülüyle yapılır. Ölçme aracı ya da müdahale yeniyse küçük bir pilot çalışma etki büyüklüğü için bir başlangıç noktası verir, ancak pilotların küçük örneklemli olduğunu ve etkiyi genellikle olduğundan büyük ya da küçük gösterebildiğini bilerek temkinli yorumlanmalıdır.
Uygulamada en sık görülen alışkanlık, “etki büyüklüğünü bilmiyorum, orta alıyorum” yaklaşımıdır. Bu tercih tamamen yanlış değildir, ama bir gerekçe değil bir varsayımdır ve öneri metninde öyle sunulmalıdır. Riski şudur: alanınızdaki gerçek etki küçükse, orta etkiye göre planlanmış 128 kişilik örneklem yalnızca yüzde 20 dolayında bir güçle çalışır ve büyük olasılıkla “anlamlı fark bulunamadı” sonucuyla biter. Bu durumda çalışma etkinin yokluğunu değil, kendi yetersizliğini göstermiş olur. Bir diğer uç ise “en küçük anlamlı etki” yaklaşımıdır: literatüre bakmak yerine, pratik olarak önemsemeye değer bulduğunuz en küçük farkı belirleyip örneklemi ona göre tasarlarsınız. Bu yaklaşım, özellikle müdahale çalışmalarında, literatürdeki şişmiş etkilere yaslanmaktan daha dürüsttür.
Yanıt Kaybı, Alt Gruplar ve Çok Değişkenli Analizler
G*Power’ın verdiği sayı, analize girecek geçerli gözlem sayısıdır; ulaşmanız gereken kişi sayısı değildir. Anket çalışmalarında eksik ya da dikkatsiz doldurulmuş formlar, boylamsal desenlerde ise izlemden ayrılma kaçınılmazdır. Bu yüzden hedef sayı, beklenen kayıp oranına göre şişirilir: n_hedef = n / (1 − kayıp oranı). Örneğin 128 geçerli veri için yüzde 20 kayıp öngörüyorsanız 160 kişiye ulaşmayı planlarsınız. Alt grup analizi yapacaksanız, gücün her bir alt grup için ayrıca sağlanması gerekir; cinsiyete göre ayrı ayrı regresyon kurmayı düşünüyorsanız 85 kişi toplamı değil, her cinsiyet için 85’i hedeflemelisiniz.
Bazı analizler için G*Power doğrudan bir modül sunmaz ve alan yazınında yerleşik başparmak kuralları devreye girer. Çoklu regresyonda yordayıcı başına en az 15–20 gözlem yaygın kabul görür; bu kural güç analizinin yerine değil, onun yanına konur ve ikisinden büyük olan alınır. Açımlayıcı faktör analizi için genellikle en az 200 katılımcı ve madde başına 5–10 kişi önerilir; 40 maddelik bir ölçek için bu, 200 ile 400 arasında bir örneklem demektir. Yapısal eşitlik modellemesinde de 200 sıklıkla alt sınır olarak anılır, ancak modelin karmaşıklığı, tahmin edilecek parametre sayısı ve verinin normalliğe uzaklığı bu sayıyı hızla yukarı çeker; SEM için Monte Carlo temelli güç simülasyonları giderek daha çok tercih edilmektedir. Bu tür çok değişkenli desenlerde örneklem kararını tek bir kurala bağlamak yerine gerekçeli bir sentez sunmak, veri analizi aşamasında sizi model uyumsuzluğu ve kestirim sorunlarından korur.
Tez Önerisinde ve Yöntem Bölümünde Raporlama
Güç analizinin öneri metninde nasıl yer alacağı, jürinin yöntem bölümüne duyacağı güveni doğrudan etkiler. Raporlanması gerekenler bellidir: kullanılan yazılım ve sürümü, hangi test için hesap yapıldığı, etki büyüklüğünün değeri ve kaynağı, α, hedeflenen güç, hipotezin yönü, ortaya çıkan örneklem ve kayıp payı için yapılan düzeltme. Aşağıdaki paragraf bir tez önerisinin yöntem bölümünde doğrudan kullanılabilecek bir örnektir:
“Gerekli örneklem büyüklüğü, veri toplanmadan önce G*Power 3.1.9.7 yazılımıyla a priori güç analizi yapılarak belirlenmiştir. Analiz, öz-yeterlik, iş yükü, yönetici desteği ve mesleki kıdemin iş doyumunu yordama gücünü sınayacak dört yordayıcılı çoklu doğrusal regresyon modeli için yürütülmüştür. Etki büyüklüğü, alanyazındaki benzer çalışmaların ortalama R² değeri olan 0,13’ten türetilen f² = 0,15 olarak alınmış; α = 0,05 ve güç (1−β) = 0,80 ölçütleri esas alınmıştır. Analiz sonucunda gerekli en küçük örneklem 85 kişi olarak hesaplanmıştır. Eksik ve geçersiz yanıtlar için yaklaşık %20 kayıp öngörülerek en az 107 katılımcıya ulaşılması hedeflenmiştir. Bu sayı, regresyon analizi için yordayıcı başına en az 15 gözlem ölçütünü de karşılamaktadır.”
Bu paragrafın gücü, sayıları değil kararları görünür kılmasından gelir. Jüri, etki büyüklüğünün nereden geldiğini, kaybın nasıl hesaba katıldığını ve başparmak kuralıyla çapraz kontrol yapıldığını tek bir okumada görür. Tezin bulgular bölümünde ise ulaşılan gerçek örneklem, planlanan sayıyla karşılaştırılarak raporlanır; hedefin altında kalındıysa bu, sınırlılıklar bölümünde açıkça belirtilmelidir.
Post-hoc Güç Analizi Neden Önerilmez?
Veri toplandıktan sonra, bulunan etki büyüklüğü ve mevcut örneklemle “gözlenen güç” hesaplamak, özellikle anlamsız sonuçları açıklamak için cazip görünür. Ancak bu hesaplama yeni bir bilgi üretmez: gözlenen güç, p değerinin doğrudan bir fonksiyonudur ve p yüksekse gözlenen güç kaçınılmaz olarak düşük çıkar. Yani “anlamlı bulamadık çünkü gücümüz düşüktü” cümlesi, aynı şeyi iki kez söylemekten ibarettir. Anlamsız bir sonucu yorumlamanın doğru yolu, etki büyüklüğünün güven aralığını raporlamaktır; aralık geniş ve sıfırı kapsıyorsa çalışmanın belirsizliği zaten görünür olur. G*Power’daki Post hoc seçeneği bu yüzden öneri aşamasında değil, olsa olsa planlanan bir sonraki çalışmanın tasarımına ışık tutmak için kullanılmalıdır.
Sık Sorulan Sorular
Evrenim çok büyükse ya da bilinmiyorsa 385 yeterli mi?
Amacınız yalnızca bir oranı ±%5 hata payıyla tahmin etmekse evet; Cochran formülü evren büyüklüğünden bağımsız olarak bu sayıyı verir ve evren büyüdükçe sayı 385’te sabitlenir. Ancak hipotez testi yapacaksanız 385 sayısı ne yeterli ne de gerekli olabilir: küçük bir etkiyi yakalamak için yetersiz, büyük bir etki için gereğinden fazla olabilir. Bu durumda kararı tahmin formülüne değil, planladığınız teste göre yapılmış güç analizine dayandırmalısınız.
Tezimde birden fazla analiz var; hangisine göre örneklem belirlemeliyim?
Her analiz için ayrı güç analizi yapılır ve en büyük örneklemi gerektiren analiz belirleyici olur. Örneğin hem 0,30 korelasyon (84 kişi) hem üç gruplu ANOVA (159 kişi) planlıyorsanız hedef 159’dur, çünkü bu sayı diğer analizlerin gücünü zaten fazlasıyla karşılar. Öneri metninde tüm hesapları kısaca verip hangisinin belirleyici olduğunu belirtmeniz yeterlidir.
G*Power’ın hesapladığı sayıya ulaşamadım; ne yapmalıyım?
Veriyi atmak gerekmez, ama dürüst olmak gerekir. Bulguları etki büyüklükleri ve güven aralıklarıyla birlikte raporlayın; sınırlılıklar bölümünde planlanan ve ulaşılan örneklem arasındaki farkı, bunun özellikle anlamsız sonuçların yorumunu nasıl kısıtladığını açıkça yazın. Post-hoc güç hesabıyla durumu “açıklamaya” çalışmak, yukarıda anlatılan nedenlerle jüride ters etki yaratabilir.
Parametrik olmayan testler için güç analizi yapılabilir mi?
Evet. G*Power, Mann-Whitney U ve Wilcoxon testleri için ayrı modüller sunar ve dağılım ailesini belirtmenizi ister. Pratik bir yaklaşım, parametrik karşılığı için hesaplanan örneklemi yaklaşık yüzde 15 artırmaktır; bu pay, parametrik olmayan testlerin normal dağılım altındaki göreli etkinliğinden türetilir ve pek çok yöntem kaynağında kabul görür. Hangi yolu seçerseniz seçin, gerekçesini bir cümleyle raporlamak yeterlidir.
Örneklem büyüklüğü, tezin başında verilen ve sonuna kadar taşınan bir karardır. Ne kadar kişi gerektiğini bilmek, hangi soruyu sorduğunuzu, hangi etkiyi aradığınızı ve onu kaçırma riskini ne ölçüde göze aldığınızı bilmek anlamına gelir. Bu yazıdaki senaryoları kendi tasarımınıza uyarlamak için ücretsiz hesaplayıcıdan bir ön değer alabilir, ardından G*Power’da testinize özgü hesabı yapıp öneri metninde yukarıdaki biçimde gerekçelendirebilirsiniz. Sayının kendisinden çok, ona nasıl ulaştığınızı anlatabilmek, yöntem bölümünüzü savunulabilir kılar.