Konu Başlıkları
Yükleniyor...

Kullanılabilirlik Testi: Kaç Kullanıcı Yeter, Ne Ölçülür

Kullanılabilirlik testinde katılımcı sayısı ve görev tasarımı

Kullanılabilirlik testi, kullanıcıya siteyi beğenip beğenmediğini sormak değil; bir görev verip o görevi yaparken nerede durakladığını izlemektir. Aradaki fark, testten çıkan bulgunun işe yarayıp yaramamasını belirler. İki soru kalıyor: kaç kişiyle, hangi görevle.

Test neyi gösterir, neyi göstermez

Katılımcıya "bu menü anlaşılır mı" diye sorarsanız çoğu kişi anlaşılır der. Karşısındaki insanı memnun etme eğilimi test odasında da çalışır. Aynı kişiye "geçen ayın faturasını indir" dediğinizde ise menüde üç kez yanlış sekmeye girdiğini görürsünüz. Kullanılabilirlik testi tam olarak bu açığı, beyan ile davranış arasındaki boşluğu kapatmak için var.

Dolayısıyla oturumda not alınacak şey görüş değil, davranıştır: katılımcı nerede durdu, hangi adımdan geri döndü, tıklamadan önce sesli olarak ne sordu, görevi tamamladığını nereden anladı. Memnuniyet puanı en sonda ve isteğe bağlı kalır; görev yarıda kaldıysa verilen puanın pek bir anlamı yok.

Kaç kullanıcı: beş sayısının arkasındaki hesap

Sektörde dolaşan "beş kullanıcı yeter" kuralı keyfi değil, bir formülden geliyor. Nielsen ve Landauer'ın 1993'te önerdiği modelde n katılımcıyla bulunan sorun oranı 1 - (1 - L)^n olarak yazılır; burada L, tek bir katılımcının herhangi bir sorunu ortaya çıkarma olasılığıdır. Çalışmalar genelinde L ortalama 0,31 alınır. Beş katılımcı için: 0,69 üzeri 5 yaklaşık 0,16, yani sorunların kabaca yüzde 84'ü görünür hale gelir. Altıncı katılımcının eklediği pay yüzde 5'in altına düşer, bu yüzden ekip o noktada test etmeyi bırakıp düzeltmeye geçer.

Formülün iki yerde kırıldığını bilmek, sayıyı bilmekten daha işe yarar.

Birincisi L sabit değil. 0,31 ortalama bir değer ve kolay görülen sorunları da içeriyor. Yalnızca belirli bir tarayıcıda, sepette çok ürün varken ya da uzun bir adres girildiğinde tetiklenen bir sorun için L rahatça 0,10'a iner. O zaman beş katılımcı yüzde 41'de kalır; yüzde 90'a çıkmak için 22 katılımcı gerekir. Nadir ama akışı tamamen durduran hataları kullanıcı testiyle avlamak pahalı bir yöntem, onlar hata kaydı ve otomatik testin işi.

İkincisi model tek ve homojen bir kullanıcı grubu varsayar. Panelde hem ilk kez sipariş veren müşteri hem de günde elli sipariş giren operasyon çalışanı varsa, bunlar aynı arayüzü farklı zihinsel modelle kullanır ve farklı sorunlara çarpar. Beşi ikiye bölmek iki grubu da ölçmez; her grup için beş kişi demektir bu. Beş kullanıcı kuralı, tek bir akışın tek bir kitle için yapılan ilk turunda geçerlidir.

Görev senaryosunu yazmak

Testin kalitesini büyük ölçüde senaryo metni belirler. Kötü yazılmış bir görev, katılımcıya cevabı söyleyerek sonucu baştan bozar.

  • Görevin katılımcının kendi tanıyabileceği bir bitiş hali olsun: "faturayı bilgisayarına indirdiğinde tamam de" gibi.
  • Görev metninde arayüzün kelimelerini kullanmayın. "Ayarlar'dan bildirimleri kapat" yolu söyler; "bu uygulamadan artık e-posta gelmesini istemiyorsun" söylemez.
  • Başlangıç noktasını gerçek hayata benzetin. Ziyaretçilerin çoğu ana sayfadan değil arama sonucundan içeri giriyorsa, testi de o sayfadan başlatın.
  • Yardım etmeyin. Katılımcı size soru sorduğunda soruyu not alın ve "sen nasıl yapardın" deyip bekleyin. Soru zaten bulgunun kendisi.

Her panelde tekrar eden bulgular

Nielsen'in 90'ların ortasındaki web çalışmalarından bu yana listenin başı pek değişmedi. Yoğun sayfalarda katılımcı taramayı bırakıp okumaya geçer ve yavaşlar. Arama kutusuna iki kelime yazar, sonuç gelmezse üçüncü kelimeyi denemez, geri döner. "Yapım aşamasında" yazısı ya da üç yıl önceki bir duyuru, sitenin geri kalanına duyulan güveni de düşürür.

Hız maddesi ise ölçüm tarafında dikkat ister. Yavaşlık şikâyetini katılımcının "yavaş yükleniyor" demesine bağlamam. O cümleyi not alırım, sonra aynı akışı ağ panelinde tekrar ederim. Algılanan yavaşlığın kaynağı çoğu zaman toplam yükleme süresi değil, ilk içeriğin ekrana gelmesiyle sayfanın gerçekten tıklanabilir hale gelmesi arasındaki boşluktur. Kullanıcı o boşlukta tıklar, tepki alamaz, bir daha tıklar.

Bulguları sıralarken şiddet puanı yerine basit bir ölçüt kullanın: görevi tamamen durduran bulgular ilk sırada, birden fazla katılımcıda tekrar edenler ikinci sırada, geri kalanı kayda geçsin ve beklesin. Tek katılımcının takıldığı kozmetik bir ayrıntıyı düzeltmek için harcanan gün, iki kişinin sepeti terk etmesine yol açan adımı düzeltmeyi geciktiriyorsa test ters çalışmış olur.