PURE: Kullanılabilirliği Uzman Puanıyla Ölçmek
PURE (Pragmatic Usability Rating by Experts), bir akışın zorluğunu kullanıcıya sormadan, uzmanların adım adım puanlamasıyla ölçer. Nielsen Norman Group'un önerdiği yöntemde görev adımlara bölünür, her adıma üçlü bir ölçekte zorluk puanı verilir, adım puanları toplanınca görevin skoru çıkar. Yöntemin hızı da, yanlış okunduğunda yanıltıcı olması da aynı basitlikten geliyor.
Ölçek neden üç basamak
Her adım üç değerden birini alır: 1 kullanıcının duraksamadan geçtiği adım, 2 düşünmesi ya da okuması gereken adım, 3 takıldığı, geri döndüğü veya yanlış yapmaya açık adım. Puanlar renge de çevrilir; yeşil, sarı, kırmızı.
Ölçeğin kaba olması kusur değil, yöntemin çalışma nedeni. Beş ya da yedi basamaklı bir ölçekte iki uzmanın aynı adım için aynı rakamı bulması zorlaşır, tartışma puanın kendisine kayar. Üç basamakta soru sadeleşir: bu adım kullanıcıyı durduruyor mu, durdurmuyor mu, arada mı?
Asıl zor kısım adımı bölmek
Puanlamadan önce akışın adımlara ayrılması gerekir ve yöntemin en tartışmalı yeri burası. İki uzman aynı görevi farklı sayıda adıma bölerse çıkan iki skor karşılaştırılamaz, çünkü toplamın paydası tutmuyor.
İşleyen kural şu: bir adım, kullanıcının bir karar verip bir eylemde bulunduğu birimdir. Ürün listesini kaydırmak tek adımdır, filtre panelini açıp iki seçim yapmak ayrı adımdır. Ekran sayısı adım sayısını belirlemez; tek ekranda üç karar veriliyorsa orada üç adım vardır. Değerlendirmeye başlamadan önce adım listesi yazılır, herkes aynı liste üzerinden puanlar.
Toplam skor neyi ölçmez
Adım puanları toplandığı için uzun akışlar otomatik olarak yüksek skor alır. On adımlık bir kayıt akışında her adım en kolay puanı alsa toplam 10 eder; dört adımlık bir akışta bir adım zor (3), diğerleri kolay olsa toplam 6 çıkar. Rakama bakan kişi ikinci akışı daha kullanışlı sanır, oysa kullanıcının gerçekten takıldığı yer oradadır.
Bu, yöntemin sık tekrarlanan bir iddiasıyla da çelişir: PURE anlatılırken “tıklama sayısını azaltmak kullanılabilirliği artırmaz” denir, ama toplama dayalı skor tam da adım sayısını ödüllendirir. Sonuç şu: farklı görevlerin toplam skorlarını yan yana koymayın. PURE skoru aynı görevin iki sürümü ya da aynı görevin rakipteki karşılığı için anlamlıdır. Ürünün geneline dair tek bir rakam üretmek istendiğinde yöntem elinizde bozulur, onun yerine görev bazında kırmızı adımların sayısına bakın.
Üç uzman, bir tartışma
Standart uygulama en az üç değerlendirmecinin akışı birbirinden bağımsız puanlaması, ardından farklı puan verilen adımların birlikte konuşulup tek puana bağlanmasıdır. Değerli olan kısım ikinci aşama. Uzmanların hemen anlaştığı adım zaten sorunsuzdur; asıl bilgi, birinin 1 diğerinin 3 verdiği adımda saklıdır, çünkü orada değerlendirmecilerden biri kullanıcının bilmediği bir şeyi biliyordur.
Uzlaşma oranının yüksek çıkması da tek başına yöntemin geçerliliğini kanıtlamaz. Puanlar eşit olasılıkla dağılsaydı iki kişinin üç basamaklı bir ölçekte tesadüfen aynı rakamı vermesi üç denemede bir olurdu. Anlamlı olan, uzlaşmanın tesadüfün ne kadar üstünde olduğu. PURE skorlarının SUS ve SEQ gibi kullanılabilirlik anketleriyle ilişkili çıktığına dair bulgular var, fakat bunlar yöntemi kullanıcı testinin yerine koymaz.
Prototipte puanlamanın sınırı
PURE'ün en pratik yanı kod yazılmadan, wireframe veya tıklanabilir prototip üzerinde uygulanabilmesi. Buradaki boşluğu bilerek kabul edin: prototipte bekleme yoktur, hata durumu yoktur, veri hep temizdir. Gerçek üründe kullanıcıyı en çok yoran adım çoğu zaman tasarımın karmaşık olduğu adım değil, sunucudan yanıtın geç geldiği adımdır.
Pratik çözüm: adım listesini çıkarırken ağa çıkan adımları işaretleyin, puanlamayı bitirdikten sonra o adımların gerçek yanıt sürelerine bakın. Bunun için ayrı bir araç almanıza gerek yok, mevcut log kayıtlarınız uç nokta bazında bu bilgiyi zaten tutuyor. İki saniye bekleten bir adımın kolay puan alması, ölçtüğünüz şeyin ekran tasarımı olduğunu, deneyimin tamamı olmadığını hatırlatır.
Ne zaman PURE, ne zaman kullanıcı testi
İkisi birbirinin alternatifi değil, farklı sorulara cevap veriyor. Akışın ne olduğunu biliyorsanız ve iki sürüm arasında hangisinin daha az sürtünme ürettiğini merak ediyorsanız PURE bunu bir öğleden sonrada söyler. Kullanıcıların akışı nasıl kullandığını, hangi noktada sizin öngörmediğiniz bir yola saptığını bilmiyorsanız hiçbir uzman puanı bunu üretemez, oraya kullanıcı testi gerekir. PURE'ü testin yerine değil, testte neye bakacağınızı seçmek için kullanın.