Konu Başlıkları
Yükleniyor...

Kullanılabilirlik Testinde Kaç Kullanıcı Yeterli?

5 mi 20 mi: Kullanılabilirlik Testinde Örneklem Büyüklüğü

Kaç kullanıcı sorusunun tek bir cevabı yok, ama iki net cevabı var: sorun bulmak istiyorsanız beş, sayı üretmek istiyorsanız beş yetmez. Sık tekrarlanan "5 kullanıcı sorunların %80'ini bulur" cümlesi bir tahmin değil, belirli varsayımlara dayanan bir formülün çıktısı. O varsayımların ne olduğunu bilmek, kaç kişiyle test yapacağınıza karar vermenin tamamı sayılır.

Beş sayısı nereden geliyor

Formül basit: bir sorunun tek bir kullanıcıda görünme olasılığı L ise, n kullanıcıda en az bir kez görünme olasılığı 1-(1-L)^n olur. Nielsen ve Landauer'in projelerden ortalayarak bulduğu L değeri 0,31. Bunu yerine koyunca beş kullanıcı için 1-(0,69)^5, yani yaklaşık %84 çıkar. On kullanıcıda oran %98'e tırmanır.

Kritik nokta L'nin bir sabit olmaması. 0,31 bir ortalama, sizin ürününüzün değeri değil. Sorunlar daha zor görünür cinstense, diyelim L=0,15, aynı formül beş kullanıcı için %56 verir. Yani "beş kullanıcı yeter" cümlesi, aslında "beş kullanıcı, kolay görünen sorunların çoğunu bulur" demek. Nadir yolları, uç senaryoları, uzun akışın ortasında bir kez patlayan durumları beş kişiyle bulamazsınız.

Formülün sustuğu varsayım: tek bir kitle

Hesap, kullanıcıların istatistiksel olarak birbirinin yerine geçebildiğini kabul eder. Arayüzünüzde günde sekiz saat çalışan bir operatörle ayda bir giren son kullanıcı varsa bu varsayım geçersiz. İki grubun takıldığı yerler örtüşmez, biri diğerinin sorununu hiç görmez.

Çözüm örneklemi büyütmek değil, bölmek. Segment başına beş kişi alın. İki belirgin kitleniz varsa on kişilik bir teste değil, beşerlik iki teste ihtiyacınız var. Sonuçları da ayrı raporlayın, ortalamayın.

Yirmi kullanıcı neyi verir, neyi vermez

Kantitatif testler için sık verilen 20 sayısı makul bir başlangıç, ama ne verdiği çoğu yazıda atlanıyor. 20 kullanıcının 18'i görevi tamamladıysa başarı oranınız %90 değil; %90 nokta tahmini, gerçek değerin bulunduğu aralık kabaca %69 ile %98 arasında (düzeltilmiş Wald yöntemiyle, %95 güvenle). Bu aralıkla bir yönetim sunumuna "başarı oranımız %90" diye girmek yanıltıcı olur.

Bu yüzden küçük örneklemli kantitatif testin işi mutlak bir sayı üretmek değil, iki şeyi karşılaştırmak. A tasarımıyla B tasarımı arasındaki farkı 20 kişiyle görebilirsiniz, çünkü aynı gürültü iki tarafta da var. Tek bir sürümün başarı oranını yayınlanabilir bir rakam olarak raporlamak istiyorsanız gereken kişi sayısı yüzlerle ölçülür.

Ortalama görev süresi yanıltıcı bir metriktir

Kaynaklarda dolaşan şu örneği düzeltmek gerekiyor: "Görev ortalama 10 dakika sürüyor, standart sapma 5 dakika, demek ki kullanıcılar 5-15 dakika arasında tamamlıyor." Ortalamanın bir standart sapma çevresi, normal dağılımda bile vakaların yaklaşık üçte ikisini kapsar, tamamını değil.

Daha ciddi sorun, görev sürelerinin normal dağılmaması. Süre dağılımı sağa çarpıktır: alt sınır var (görev bir anda bitemez), üst sınır yok (takılan kullanıcı istediği kadar uzatır). Bu yüzden birkaç yavaş kullanıcı aritmetik ortalamayı yukarı çeker. Küçük örneklemde görev süresi için geometrik ortalama kullanın, aritmetik olanı değil; çarpık dağılımda merkezi çok daha az sapmayla tahmin eder.

Uç değerleri analizden atma alışkanlığı da 20 kişilik bir testte savunulabilir değil. İki kullanıcıyı elediğinizde örneklemin onda birini attınız ve zaten geniş olan aralığı daha da genişlettiniz. Üstelik attığınız kişiler çoğu zaman en çok şey öğreteceğiniz kişiler. Süreyi hesaba katmayın, ama kaydı izleyin ve nerede takıldığını not edin.

Hangisi ne zaman

Tasarım hâlâ değişiyorsa kalitatif test yapın. Beş kişi, düşük maliyet, hızlı döngü; bulguyu ertesi gün düzeltip bir hafta sonra tekrar test edersiniz. Bu aşamada sayı üretmek boşa emek, çünkü ölçtüğünüz şey yarın duracak bir şey değil.

Kantitatif teste ancak elinizde karşılaştıracak iki sürüm ya da zaman içinde izleyeceğiniz bir eşik varsa geçin. Ölçtüğünüz metriği önceden yazın, testten sonra veriye bakıp anlamlı çıkanı seçmeyin. Görev tanımını da iki testte kelimesi kelimesine aynı tutun; ifadeyi değiştirdiğinizde ölçtüğünüz şey değişir ve karşılaştırma anlamını kaybeder.

Test senaryosunu kurarken bir uyarı: sadece ana akışı test etmek testin en yaygın kusuru. Kullanıcı formu doğru doldurduğunda her şey çalışıyordur zaten. Değerli bulgular hata durumlarında, geri dönüşlerde, yarım bırakıp devam etme denemelerinde çıkar.