Kullanılabilirlik Testi Verisini Değerlendirmenin Altı Boyutu
Bir kullanılabilirlik oturumundan çıkan her cümle bulgu değildir. Katılımcının "burası kafa karıştırıcı" demesiyle üç kişinin aynı yerde takılması raporda yan yana durur, oysa biri tek bir anın izlenimi, diğeri bir örüntüdür. Altı boyut bu ikisini ayırmaya yarıyor. Asıl mesele boyutları saymak değil, hangi sırayla uygulayacağınız.
Söylediği ile yaptığı aynı veri değil
Testten iki tür kayıt çıkar: davranışsal olan, yani kullanıcının ne yaptığı; tutumsal olan, yani ne hissettiğini söylediği. İkisi çeliştiğinde tartışma kısadır, davranış kazanır. "Gayet kolaydı" diyen ama formu üç denemede gönderebilen kullanıcı size formun kolay olduğunu değil, hayal kırıklığını dile getirmekten kaçındığını anlatıyordur.
Önce geçerlilik: bu veri sayılır mı?
Altı boyutun dördü aslında bir ön elemedir. Elinizdeki gözlemin üründen mi yoksa testin kendi kurgusundan mı geldiğini sorarlar.
- Otantiklik: Katılımcı sizi memnun etme moduna girdi mi? Sesli düşünme protokolünün kendisi bile insanı normalde olmayacağı kadar dikkatli davranmaya iter; gözlediğiniz özen ürüne değil, odaya ait olabilir.
- Spontanlık: "Bu butonu bulmakta zorlandınız mı?" sorusuna gelen evet ile kullanıcının kendiliğinden "şimdi bunu nerede bulacağım" demesi aynı ağırlıkta değil. İlki çoğu zaman sizin cümlenizin yankısıdır.
- Uygunluk: Katılımcı hedef profile yakın mı, görev gerçek hayatta yapacağı bir şey mi? Kimsenin kendi isteğiyle girmeyeceği bir akışta yaşanan zorluk, ürün sorunu olmayabilir.
- Yanılgılar: Üçüncü görevde arama kutusuna giden katılımcı dördüncüde de aramaya gidiyorsa bu bir tercih değil, az önce öğrendiği yol olabilir. Peki ya görev sırasını ters çevirseydiniz, aynı bulgu yine çıkar mıydı? Çıkmayacaksa bulgu değil, sıralama etkisidir.
Sonra sinyal: tutarlılık ve tekrar
Ön elemeyi geçen gözlemler için geriye iki ölçüt kalıyor. Tutarlılık, aynı katılımcının sözüyle eylemi arasındaki uyuma bakar. Tekrar ise farklı katılımcıların aynı noktada takılıp takılmadığına.
Sıra burada kritik, çünkü tekrar tek başına yanıltıcıdır. Yönlendirici bir soruyu beş katılımcının beşine birden sorduysanız beşinden de benzer cevabı alırsınız ve elinizde kusursuz görünen, tekrar eden bir bulgu olur. Tekrarlanan şey sizin sorunuzdur. Bu yüzden tekrar, yalnızca spontanlık süzgecinden geçmiş gözlemler arasında sayıldığında bir anlam taşır. Kaynaklarda altı boyut çoğu zaman eşit ağırlıkta bir kontrol listesi gibi sunulur; değiller, dördü diğer ikisinin ön koşulu.
Tekrar sayısı sandığınızdan bulanık
Beş kişilik bir oturum setinde iki kullanıcının aynı sorunu yaşaması genelde "ciddiye al" sinyali kabul edilir. Örneklemdeki oran %40, doğru. Ama bu oranın popülasyondaki karşılığı için güven aralığı hesaplarsanız kabaca %12 ile %77 arasına yayılan bir bant çıkıyor. Yani aynı sorun bütün kullanıcıların onda birinde de olabilir, dörtte üçünde de.
Bu, beş kişiyle test yapmayın demek değil. Nitel testin işi frekans ölçmek değil, sorunun varlığını ve mekanizmasını görünür kılmak. Rapora "kullanıcıların %40'ı bu butonu bulamadı" cümlesini yazdığınız anda yöntemin veremeyeceği bir kesinliği vadetmiş olursunuz. İki kişinin neden bulamadığını yazın, kaç kişi olduğunu değil.
Kayıt olmadan bu altı boyut çalışmaz
Boyutların hepsi gözlemin bağlamına geri dönebilmeyi gerektiriyor: katılımcı bunu hangi saniyede söyledi, hemen öncesinde ne soruldu, o sırada ekranda ne vardı. Hafızadan cevaplanmaz bunlar. Oturumun sonunda herkesin aklında kalan en dramatik andır, en yaygın an değil.
Ben bulguları doğrudan kaydın zaman damgasıyla birlikte not etmeyi tercih ederim: tek satırlık gözlem, yanında 04:12 gibi bir işaret. Analiz masasında tartışma çıktığında kaydın o noktasına dönmek yarım dakika sürüyor, hafızadan tartışmak yarım saat.