Nicel Kullanılabilirlik Testinde Katılımcı Sayısı: 40 Nereden Çıkıyor
Nicel kullanılabilirlik testi planlarken ilk soru sayı oluyor: kaç kişi? Dolaşan cevap 40. Bu sayı keyfi değil, bir formülün çıktısı, ama formülün girdileri arasında genelde yazılmayan bir varsayım var. Girdileri değiştirdiğinde cevap 15 ile 43 arasında geziniyor.
Sayı bir formülden çıkıyor
Başarı oranı gibi ikili bir metrik ölçüyorsan yaptığın iş bir oran tahmini, ve oran tahmininin örneklem formülü belli: n = z² × p(1−p) / E². Burada z güven seviyesinin karşılığı (%95 için 1,96, %90 için 1,645), E kabul ettiğin hata payı, p ise testten çıkmasını beklediğin başarı oranı.
p bilinmiyorsa en kötü durumu alırsın, yani 0,5. %95 güven ve ±15 puan hata payıyla hesap şöyle işler: 1,96² × 0,25 / 0,15² = 42,7. Yukarı yuvarlarsan 43 kişi.
Yani konservatif varsayımla taban 43. Yaygın anlatıdaki 39 sayısı aynı formülden 0,5 varsayımıyla çıkmıyor; 39'u elde etmek için p'yi 0,65 dolaylarında almak gerekiyor, formül simetrik olduğu için 0,35 de aynı sayıyı verir. Dolayısıyla "hesap 39 dedi, bozuk oturumlara karşı 40'a yuvarlayalım" cümlesi ters yönde çalışıyor: eklenen o bir kişi güvenlik payı değil, sonuç hâlâ konservatif tabanın altında.
Tablonun söylemediği varsayım
Hesabı dolaşan tablonun her satırı için geriye doğru çalıştırınca aynı desen görünüyor.
| Güven aralığı | Hata payı | Dolaşan sayı | p = 0,5 ile |
|---|---|---|---|
| %95 | ±15 puan | 39-40 | 43 |
| %95 | ±20 puan | 21 | 24 |
| %90 | ±15 puan | 28-30 | 31 |
| %90 | ±20 puan | 15 | 17 |
Sağdaki sütunun ham değerleri 42,7 / 24,0 / 30,1 / 16,9. Soldaki sütunun dört satırı ise p ≈ 0,65 varsayımına oturuyor. Tablo, testten önce başarı oranının %65 dolaylarında olduğunu bildiğini kabul ediyor. Böyle bir bilgin varsa sorun yok, ama çoğu zaman tam olarak bunu bilmediğin için test yapıyorsun.
p'yi tahmin etmenin en sağlam yolu yeni bir anket değil, elindeki veri: aynı akışın analitikteki tamamlama oranı, hunide adım adım düşen kullanıcı sayısı, sunucu loglarındaki hata ve terk kayıtları (kullanıcıya "yapabildiniz mi" diye sorup toplanan oranları bu iş için fazla iyimser buluyorum). Ölçülmüş bir sayı varsa formüle onu koy. Yoksa 0,5'te kal ve 43'ü hedefle.
±15 puan aslında çok geniş
40 kişiyle test ettin, 28 kişi görevi tamamladı, başarı oranı %70 çıktı. Bu tahminin %95 güven aralığı yaklaşık %56 ile %84 arası. Söyleyebildiğin şey "yarısından fazlası başardı" seviyesinde kalıyor.
Bunun pratik sonucu şu: ±15 puanlık bir hata payıyla, aralarında 10 puan fark olan iki tasarımı birbirinden ayırt edemezsin. Sorun "yeni akış eskisinden iyi mi" ise mutlak oran tahmini yanlış araç. Aynı katılımcıya iki tasarımı da gösteren bir kurulum kur; o zaman ölçtüğün şey farkın kendisi olur ve farkın standart sapması kişiler arası sapmadan belirgin şekilde küçük olduğu için çok daha az kişiyle anlamlı sonuç alırsın. Testi planlamadan önce hangisini istediğine karar ver: mutlak bir sayı mı, yoksa bir karşılaştırma mı.
Süre ve memnuniyet için hesap değişir
Sürekli metriklerde formül n = (z × s / E)² halini alıyor, s standart sapma. Sıkıntı s'nin testten önce bilinmemesi; 5-8 kişilik kısa bir pilot koşu bunu tahmin etmeye yeter. Örnek: görev süresinin standart sapması 40 saniye ve ortalamayı ±15 saniye hassasiyetle bilmek istiyorsun. (1,96 × 40 / 15)² = 27,3, yani 28 kişi.
Süre verisinde ayrı bir tuzak var. Dağılım sağa çarpık; ekranda kaybolup görevi 4 dakikada bitiren tek katılımcı aritmetik ortalamayı tek başına yukarı çeker. Süre raporluyorsan geometrik ortalama ya da medyan kullan.
Bütçe 40 kişiye yetmiyorsa
Yaygın tavsiye şöyle: 20 kişiyle başla, sonuçlara bak, aralık çok genişse katılımcı ekle. İşleyişi makul görünüyor, istatistiği bozuyor. Sonucu gördükten sonra devam kararı verdiğinde durma noktan verinin kendisine bağlanıyor ve raporladığın güven aralığı artık söylediği şeyi söylemiyor.
Kuralı önceden yaz. Ya n'i baştan sabitler ve tek seferde analiz edersin, ya da "20 kişi bu ay, 20 kişi gelecek ay, analiz en sonda" diye planlar ve ara sonuca bakıp planı değiştirmezsin. Üçüncü yol da dürüst bir yol: 20 kişide kal, hata payını ±20 puan olarak yaz, bulguyu tek bir yüzde olarak değil aralık olarak raporla.
Kısa cevap
- İkili metrik, mutlak bir oran istiyorsun, önceden veri yok: 43 kişi.
- Elinde ölçülmüş bir tamamlama oranı var ve %65 civarında: 40 kişi yeter.
- Sadece büyük kırılmaları görmek istiyorsun: 20 kişi, ±20 puan, aralığı raporla.
- İki tasarımı karşılaştırıyorsun: kurulumu değiştir, örneklemi farkın sapmasından hesapla.
Sayıyı seçerken tek gerçek karar, hangi hata payıyla yaşayabileceğin. Onu belirlemeden 40 da 20 de rastgele bir sayı.