Nitel mi Nicel mi: Kullanılabilirlik Testinde Örneklem Kararı
Nitel ve nicel ayrımı yöntem tercihinden önce soru tercihidir. Nitel test “neden takılıyor” sorusuna, nicel test “kaç kişi takılıyor” sorusuna cevap verir. İkisini karıştırmanın maliyeti şurada görünür: beş kişilik bir oturumdan çıkan yüzdeyi rapora yazdığınızda elinizde ölçüm değil, süslenmiş bir izlenim olur.
Nitel testin ürettiği şey sebeptir
Katılımcı görevi yaparken sesli düşünür, araştırmacı izler ve takıldığı yerde sorar. Çıktı sayı değil gerekçedir: kullanıcı kaydet düğmesini bulamadı çünkü düğme formun altında değil sayfanın sağ üst köşesindeydi, ya da “arşivle” kelimesini “sil” sandı ve dosyasını kaybetmekten korktu. Bu tür bulgular beş kişide de çıkar, elli kişide de. Fazladan katılımcı çoğunlukla aynı sahneyi tekrar izletir.
Peki tekrar tam olarak nerede başlar? Bu sorunun cevabı sanıldığı kadar sabit değil.
“Beş kullanıcı yeter” hangi koşulda doğru
Sık tekrarlanan kural, beş katılımcının sorunların yaklaşık %85'ini ortaya çıkardığını söyler. Kuralın kendisinden çok dayandığı hesap ilgi çekici: n katılımcıyla bulunan sorun oranı 1-(1-L)^n ile ilerler. Buradaki L, tek bir katılımcının ortalamada sorunların ne kadarını tetiklediğidir. Meşhur %85, L'nin 0,31 alındığı varsayımdan geliyor.
L düşerse tablo tamamen değişir. Çok rollü, karmaşık bir kurumsal arayüzde tek kullanıcının sorunların ancak %10'una denk gelmesi olağandır. Aynı formüle koyduğunuzda beş kullanıcı %41'de kalır, %85'e çıkmak için on sekiz kullanıcı gerekir. Yani “beş kişi yeter”, ürününüz hakkında değil, katılımcı başına keşif oranı hakkında bir iddia. Basit bir kayıt formunda doğru, çok adımlı bir yönetim panelinde değil.
Sayı vermenin gizli maliyeti
Sayı üretmek kolay, sayı vermek zor. Yirmi kişilik bir testte görev başarısı %80 çıktıysa bunun %95 güven aralığı kabaca ±17 puandır, yani gerçek oran %63 ile %97 arasında bir yerdedir. Bu aralıkla “yeni tasarım eskisinden iyi” demek mümkün değil, çünkü eski tasarımın aralığı da aynı genişlikte ve ikisi fazlasıyla örtüşüyor.
O yüzden nicel testin asıl sorusu “kaç kişi çağırayım” değil, “ne kadar küçük bir farkı görmem gerekiyor”. Beş puanlık bir iyileşmeyi kanıtlamak istiyorsanız laboratuvar oturumu yetmez, canlı trafikte A/B testi gerekir. Ya da farkı büyütecek kadar cesur bir tasarım değişikliği.
Sıra meselesi
Erken aşamada tek bir sesli düşünme oturumunu, aynı hafta toplanmış yüz kişilik memnuniyet anketinden daha güvenilir bulurum. Anket puan verir ama puanın nereden geldiğini söylemez, oturum ise düzeltilecek şeyi doğrudan gösterir. Tasarım oturduktan sonra sıra tersine döner: iddia “şu değişiklik işe yaradı” olduğunda nitel bulgu tek başına kanıt sayılmaz, çünkü seçtiğiniz beş kişi hangi yönde yanılıyorsa rapor da o yöne kayar.
Aynı oturumda ikisi
İkisini ayırmak zorunda değilsiniz. Görev süresini ve tamamlama durumunu kaydedip aynı anda takılma noktalarını not alabilirsiniz. Tek kural: küçük örneklemden çıkan sayıyı yüzdeye çevirip slayta koymayın. “Sekiz kullanıcıdan beşi görevi tamamladı” dürüst bir cümledir, “%62,5 başarı oranı” aynı veriyi olduğundan emin gösterir.