Nitel Kullanılabilirlik Testinden Çıkan Oranlar Neden Yanıltır
On kişiyle yaptığınız testte yedi kişi görevi tamamladıysa raporda %70 yazar. Bu sayı yanlış değil, sadece neredeyse hiçbir şey söylemiyor: aynı veriden çıkan aralık %40 ile %89 arasında geziniyor. Nitel testin sorunu ölçüm yapmaması değil, ölçtüğü şeyin oran olmaması.
Bir katılımcı on puan eder
On kişilik bir testte her katılımcı sonucun onda biri. Yedinci kişi o sabah acelesi olduğu için görevi yarıda bıraktıysa oran %70'ten %60'a düşer, siz de raporda on puanlık bir fark görürsünüz. Bu farkın arayüzle ilgisi yok.
Oranın etrafındaki belirsizliği hesaplamak zor değil. 7/10 için %95 güven aralığı kabaca %40 ile %89 arası çıkar. Tam ortadaki bir sonuç bile kurtarmıyor: 5/10 için aralık %24 ile %76 arası, yani "yarısı başardı" cümlesi "dörtte biri de başarmış olabilir, dörtte üçü de" demekle aynı kapıya çıkıyor.
Raporu okuyan kişi bu aralığı görmüyor. %70 görüyor ve onu bir ölçüm sanıyor.
Aralığı daraltmak pahalı, hem de doğrusal değil
Güven aralığının genişliği katılımcı sayısının kareköküyle ters orantılı. On kişiden kırk kişiye çıkarsanız aralık yarıya iner, kırktan yüz altmışa çıkarsanız bir kez daha yarıya. Elli puan genişliğindeki bir aralığı on puan civarına indirmek için katılımcıyı yirmi katına çıkarmanız gerekiyor.
"Örneklemi büyütün" tavsiyesi bu yüzden havada kalıyor. Nitel testin maliyeti kişi başı moderatör zamanı, kayıt ve çözümleme olarak birikir; iki yüz kişilik moderatörlü oturum serisi artık nitel test değil, bütçesi olmayan bir anket. Sayıyı güvenilir hale getirme çabası yöntemi yöntem olmaktan çıkarıyor.
Protokol oynuyorsa güven aralığı da anlamını yitirir
Bu konuda yaygın tavsiye şudur: örneklem küçükse hiç olmazsa güven aralığı verin. İtiraz etmek gerekiyor. Güven aralığı, her denemenin aynı koşuldan bağımsız çekildiğini varsayar ve nitel testte bu varsayım baştan yok.
Moderatör bir katılımcıyı takıldığı yerde kendi başına bıraktı, diğerine "sağ üstte ne görüyorsunuz" diye sordu. İkinci kişi görevi tamamladı. Bu iki deneme aynı deneyin iki tekrarı değil. Görev metni oturumlar arasında biraz değiştiyse karşılaştırdığınız şeyin ne olduğu tamamen belirsizleşir. Böyle bir veriden hesaplanan aralık, dar ya da geniş, yanlış sorunun cevabı olur. Küçük örneklem gürültüyü büyütür, değişken protokol ise neyi ölçtüğünüzü bozar; ikincisi daha sinsi, çünkü tabloda iz bırakmıyor.
Nitel test neyi iyi yapar
Keşif. Nielsen'in meşhur "beş kullanıcı yeter" savı da oran tahmini için değil, sorun bulmak için kurulmuştu: az sayıda kişiyle çalışmak arayüzdeki tıkanıklıkların çoğunu görmeye yeter, çünkü aynı tasarım hatasına çoğu kullanıcı aynı yerde çarpar.
On kişilik testten çıkan %70'i, aynı testten çıkan "üç kişi ödeme adımında kupon alanını indirim tutarı sandı" notundan daha az güvenilir bulurum. Oran, on insanın dağılımına dair zayıf bir tahmin. Not ise gözlenmiş bir olay: üç kişide gerçekleşti, nedenini de biliyorsunuz. Tasarım kararını ikincisi yönlendirir, birincisi sadece slayta renk katar.
Oranı gerçekten istiyorsan laboratuvardan çıkacaksın
Görev başarı oranını bilmek isteyen ekibin yeri test odası değil, ürünün kendisi. Akıştaki adımlara olay kaydı koyarsın: adıma giriş, tamamlama, geri dönüş, terk. Birkaç satır iş, üçüncü parti bir araca da gerek yok. İki hafta sonra binlerce oturum birikmiş olur ve aynı oran bir iki puanlık aralıkla gelir, hem de gerçek koşulda: kötü bağlantı, yarısı dolu sepet, dikkati bölünmüş kullanıcı.
İkisi birbirinin yerine geçmiyor, sırayla çalışıyor. Kayıt nerede kan kaybettiğini söyler, nitel oturum neden olduğunu.
Rapora sayı yazacaksan payı ve paydayı birlikte yaz: on kişiden yedisi tamamladı. Yüzdeye çevirmek, elinde olmayan bir hassasiyeti ima ediyor. İki tasarımı karşılaştırırken de aynı şey geçerli. 6/10 ile 8/10 arasındaki fark, aralıklar neredeyse tamamen örtüştüğü için fark sayılmaz; o farkı savunmak istiyorsan ya katılımcı sayısını yirmi katına çıkar ya da iddiayı tasarım gerekçesine dayandır.