Kullanılabilirlik Testinde Kaç Kullanıcı Yeterli?
Beş kullanıcı kuralı doğru, ama genelde yanlış yerde kullanılıyor. Arkasında tek bir varsayım var: her katılımcının rastgele seçilmiş bir kullanılabilirlik sorununa denk gelme olasılığı yüzde 31. O varsayım bozulduğunda beş sayısı da bozulur, ve çoğu ekip farkında olmadan onu bozar.
Beş sayısı nereden geliyor
Nielsen Norman Group'un beş kullanıcı yazısı bir sezgi değil, basit bir formül: n kullanıcıyla bulunan sorun oranı 1-(1-L)ⁿ, burada L tek bir kullanıcının ortalama sorun bulma olasılığı. L'yi 0,31 kabul edersen beş kullanıcı sorunların yüzde 84'ünü açığa çıkarır. Yuvarlanmış hali "yüzde 80" diye dolaşıyor.
Formülün can alıcı yeri L. Arayüz karmaşıksa, katılımcılar birbirine benzemiyorsa ya da görevler yüzeyin tamamını taramıyorsa L düşer. L 0,25'e indiğinde beş kullanıcıyla gördüğün oran yüzde 76, 0,20'ye indiğinde yüzde 67 olur. Aynı beş kişi, farklı sonuç.
Segmentlere bölmek kuralı geçersiz kılar
En sık yapılan hata burada. "Üç segmentim var, her birine üç kişi, toplamda dokuz kullanıcı" hesabı rahatlatıcı görünür. Ama formül toplamla değil segment içiyle çalışır: her segment kendi sorun kümesini taşıdığı için üç kişilik bir grup o kümenin 1-0,69³, yani yüzde 67'sini kapsar. Dokuz kişilik toplam, hiçbir segmentte beş kişilik güven vermez.
Doktor ve hasta gibi gerçekten ayrışan iki kitle varsa her birine beş kişi ayır. Deneyimli ve yeni kullanıcı ayrımı ise çoğu üründe bu kadar keskin değildir; aynı akıştaki takılma noktaları büyük ölçüde örtüşür. Tek havuzda beş kişiyle başla, ikinci turda yeni kullanıcı ağırlığını artır.
Keşif ile ölçüm aynı test değil
Beş kullanıcı kuralı yalnızca neyin bozuk olduğunu bulmak için geçerli. Çıktı bir sayı olacaksa geçmez.
- Başarı oranı ya da görev süresi karşılaştıracaksan 20 katılımcı alt sınır sayılır; beş kişide tek bir başarısızlık oranı yüzde 20 oynatır.
- Kart gruplamada işe yarar bir benzerlik matrisi için 15 civarı katılımcı gerekir.
- Isı haritasının turdan tura kararlı çıkması için 39 rakamı konuşulur, ki bu pratikte göz takibinin keşif aracı olmadığı anlamına gelir.
Rapora yüzde yazacaksan testi baştan nicel kurgula. Beş kişilik bir turdan çıkan "kullanıcıların yüzde 40'ı başarısız oldu" cümlesi iki kişi demektir, ve o cümleyi yazdığın anda testin bütün güvenilirliğini harcarsın.
Kullanıcı tabanının büyüklüğü hesaba girmez
Günlük bir milyon ziyaretçisi olan bir site ile yeni açılmış bir mağaza aynı sayıda katılımcıyla test edilir. Örneklem büyüklüğünü popülasyon değil, aradığın şeyin yoğunluğu belirler. Ödeme formundaki hatalı doğrulama mesajını beşinci kullanıcı da görür, beş yüz bininci de.
Fonksiyon sayısı da katılımcı sayısını büyütmez, test sayısını büyütür. Bir katılımcıya dokuz görev yüklediğinde son üç görevden topladığın şey yorgunluk verisidir. Modülleri ayır, her biri için ayrı bir beş kişilik tur kur.
Katılımcı sayısını değil tur sayısını büyüt
Bulunan sorunu düzeltmek, testi yapmaktan pahalıdır. Beş kişilik bir tur bir güne sığar; çıkan arayüz değişikliklerinin kodda karşılığı rahat iki haftayı bulur. Katılımcı bütçesini şişirmek yerine düzeltme kapasitenin kaldıracağı kadar sorun topla, çünkü on beş kişilik tek turda bulduğun uzun listenin yarısı sıraya girip bekler. Beş kişiyle üç tur yaparsan her turda hem L'yi tazelersin hem de düzelttiğin şeyin gerçekten düzeldiğini görürsün.