Güven Aralığı ve Hata Payı: UX Ölçümlerini Doğru Okumak
Bir kullanıcı testinde görev başarısı %79 çıktı. Bu sayı tek başına pek bir şey söylemez; asıl mesele, aynı testi başka bir gruba uygulasaydınız kaç çıkacağıdır. Güven aralığı bunun cevabıdır: ölçtüğünüz değerin etrafında, gerçek oranın büyük olasılıkla durduğu bant. Hata payı bandın yarısı, güven düzeyi ise büyük olasılık derken neyi kastettiğinizdir.
Gözlemlenen değer ile gerçek değer arasındaki mesafe
Ölçmek istediğiniz şey, ürünü kullanan herkesin davranışı. Elinizdeki şey ise o kitleden seçilmiş birkaç yüz kişinin davranışı. Aradaki farkı kapatmanın yolu yok, ama büyüklüğünü tahmin etmenin yolu var.
%79 başarı oranını 2000 kişilik bir ölçümden elde ettiyseniz, %95 güven düzeyinde hata payınız kabaca ±%1,8 olur. Yani gerçek oran büyük olasılıkla %77 ile %81 arasında bir yerdedir. Rapora %79 yazıp geçmek, aslında bilmediğiniz bir kesinliği iddia etmektir. Bandı yazın.
Bant dar olduğunda karar verebilirsiniz. Geniş olduğunda veriniz, elinizdeki soruya cevap vermiyor demektir. Bir özelliğin beğenilme oranı %50 ve hata payı ±%30 ise, o ölçüm size hiçbir şey söylemiyor: %20 de olabilir, %80 de. Böyle bir sonuçla toplantıya girmenin tek dürüst yolu, ölçümün yetersiz olduğunu söylemektir.
Aralığı ne genişletir
Üç şey belirler:
- Katılımcı sayısı. Arttıkça aralık daralır, ama düşündüğünüz hızda değil. Bir sonraki bölüm tam olarak bununla ilgili.
- Verideki değişkenlik. Görev süresi gibi metriklerde kullanıcılar birbirinden çok ayrışır; kimi 12 saniyede bitirir, kimi 4 dakikada. Bu dağılım genişledikçe aralık da genişler. Başarı/başarısızlık gibi ikili metriklerde ise değişkenlik doğrudan oranın kendisine bağlıdır ve en yüksek değerini %50 civarında alır.
- Seçtiğiniz güven düzeyi. %99 istiyorsanız daha geniş bir bandı kabul edeceksiniz. Kesinlik bedava değil.
Aralığı yarıya indirmek dört kat katılımcı ister
Kaynaklarda sıkça geçen örneklemi büyütün tavsiyesi doğru ama eksik. Hata payı katılımcı sayısının kareköküyle ters orantılı küçülür, sayının kendisiyle değil. Pratikte bunun anlamı şu: bandı yarıya indirmek için katılımcıyı ikiye değil dörde katlamanız gerekir.
%50 dolayındaki bir oranda 500 katılımcı size %95 güven düzeyinde yaklaşık ±%4,4 verir. ±%2,2'ye inmek için 2000 katılımcı toplamanız gerekir. Oradan ±%1,1'e inmek 8000 kişi demektir. Araştırma bütçesi doğrusal büyürken kazanç kareköke bağlı büyüdüğü için, bir noktadan sonra katılımcı eklemek parayı çöpe atmaktır.
Bu yüzden örneklem planını sondan başa kurun. Önce şunu sorun: hangi fark benim için karar değiştirir? Cevap %5 ise, ±%5'in altına inen bir hata payı yeterlidir ve peşinde koştuğunuz ekstra kesinliğin karşılığı yok. Cevap %1 ise, muhtemelen kullanıcı testiyle değil canlı trafikle ölçmeniz gerekiyor.
Beş kullanıcıyla oran ölçülmez
Klasik kullanılabilirlik testi 5-8 kişiyle yapılır ve bu, sorun bulmak için makul bir sayıdır. Sorun bulmak ile oran ölçmek aynı şey değil.
Beş kişinin dördü görevi tamamladığında elinizdeki sayı %80'dir. Bu oranın %95 güven aralığı kabaca %38 ile %96 arasıdır. Yani veri, ürününüzün her üç kullanıcıdan birini kaybettiği senaryoyla neredeyse kusursuz çalıştığı senaryoyu ayırt edemiyor. O %80'i slayta koymak, olmayan bir bilgiyi rapor etmektir.
Küçük örneklemlerde Wilson aralığını klasik normal yaklaşımdan çok daha güvenilir bulurum. Normal yaklaşım aynı veri için %80 ± %35 üretir, yani üst ucu %115'e taşan, tanımı gereği imkânsız bir bant. Formülün oranın 0 ile 1 arasında sıkıştığını bilmemesi küçük n'de doğrudan saçma sonuç verir; Wilson bunu hesaba katar. Tablolaştırmanız da gerekmez, iki satır kodla hesaplanır.
Niteliksel testten çıkan doğru cümle şudur: beş kullanıcıdan dördü tamamladı, tamamlayamayan kişi ödeme adımında kart formunu bulamadı. Sayı değil, gözlem taşınır.
Güven düzeyini işin riskine göre seçin
%95 varsayılandır ve çoğu ürün kararı için yerinde bir varsayılandır. Bunu değiştirmek için nedeniniz olmalı.
Erken aşama bir prototipte, birkaç gün içinde tekrar ölçeceğiniz bir metrik için %90'a inmek mantıklı: daha dar bir bant görür, hızlı karar verir, yanılırsanız bir sonraki turda düzeltirsiniz. Yanlış kararın maliyeti düşükken kesinlik için ödeme yapmanın anlamı yok.
Tersi de geçerli. Geri alınması pahalı ya da imkânsız kararlarda, örneğin ödeme akışının tamamını değiştirmek veya bir güvenlik uyarısının görünürlüğünü azaltmak gibi durumlarda %99 isteyin. Aralık genişleyecek, örneklem maliyeti artacak; karşılığında yanlış yöne sapma riskiniz beşte birine iner.
Rapora ne yazılır
Her metriğin yanında üç şey bulunsun: değerin kendisi, aralık ve kaç kişiyle ölçüldüğü. Dönüşüm %79 (±%1,8; n=2000) biçimindeki tek satır, paydaşın sayıyı ne kadar ciddiye alacağını kendi başına söyler.
İki ölçümü karşılaştırırken de aralıklara bakın. A varyantı %62, B varyantı %58 çıktıysa ve iki aralık birbirinin içine giriyorsa, ortada fark yoktur; B'yi kaldırmadan önce daha fazla veri toplayın. Aralıkları raporlamanın asıl faydası buradadır: ölçümün neyi gösterdiğini değil, neyi gösteremediğini görünür kılar.