Nicel Kullanıcı Araştırması: Yöntemler, Örneklem ve Güven Aralığı
Nicel araştırma sayı verir, kesinlik vermez. Yirmi katılımcıyla ölçtüğün %80'lik görev tamamlama oranı gerçekte %58 ile %92 arasında bir yerdedir, ve bu iki uç aynı ürünün birbirinden çok farklı iki hikâyesidir. Yöntem seçmeden önce sorulacak soru şu: elindeki katılımcı sayısı hangi büyüklükteki farkı görmene yetiyor?
Nicel yöntem hangi soruyu cevaplar
Nitel ve nicel yöntemleri "birbirini tamamlar" diye yan yana koymak alışkanlık haline geldi, ama pratikte bu bir sıra meselesi. Nitel çalışma sorunun ne olduğunu bulur, nicel çalışma o sorunun ne kadar yaygın olduğunu ve düzeltmenin işe yarayıp yaramadığını söyler. Sırayı ters çevirirsen elinde nedenini kimsenin bilmediği bir düşüş grafiği kalır.
Nicel tarafta topladığın şey dar bir küme: görev tamamlama oranı, süre, hata sayısı, dönüşüm, ölçekli anket puanı. Hepsinin ortak özelliği karşılaştırılabilir olması. Karşılaştırma yapmayacaksan sayı toplamanın anlamı yok.
"En az 40 katılımcı" tavsiyesi nereden geliyor
Bu rakam keyfi değil ama sihirli de değil. Tamamlama oranı gibi ikili bir metrikte belirsizliğin genişliği kabaca katılımcı sayısının kareköküyle daralır. Yukarıdaki örnekte 20 kişide %80 ölçtüğünde aralık 34 puan genişliğinde. Aynı oranı 60 kişide ölçersen aralık %68 ile %88'e, yani 20 puana iner. Katılımcıyı üçe katladın, belirsizliği yalnızca 1,7 kat daralttın.
Sonucu şu: küçük farkları kovalıyorsan nicel test sana yardım etmez. İki tasarımın tamamlama oranı %72 ve %80 çıktıysa ve n=20 ise, iki aralık büyük ölçüde üst üste biner. "B daha iyi" cümlesini kuramazsın. Kurarsan da ölçüme değil tercihe dayanmış olursun.
A/B testinde göremeyeceğin fark
Dönüşüm testlerinde gereken trafik, aramakta olduğun farkın karesiyle ters orantılı. %3'lük bir dönüşüm oranını %3,6'ya çıkaran bir değişikliği makul bir güçle yakalamak için varyant başına yaklaşık 13 bin ziyaretçi gerekir. Günde 500 ziyaretçi alan bir sayfada bu, yaklaşık iki aylık kesintisiz test demek.
Trafiğin buna yetmiyorsa A/B testi bir karar aracı değil, süs. O durumda daha büyük değişiklikleri test et ya da kullanılabilirlik testine dön. Erken durdurulan, "anlamlıya yaklaşıyor" diye izlenen testler ise gürültüyü bulgu diye raporlar.
Anket puanları neyi gizler
SUS'un 0-100 aralığı yüzde değil, ölçek puanı. Ortalama civarı 68 kabul edilir, dolayısıyla 72 iyi bir sonuçtur ve 72'yi "yüzde 72 memnuniyet" diye okumak yanlıştır.
NPS'in sorunu daha yapısal: 11 puanlık bir cevabı üç kutuya indirir. 0 veren de 6 veren de aynı gruba düşer, aradaki bütün bilgi silinir. Tek bir skoru sürüklemek yerine ham dağılımı sakla, hareketin nereden geldiğini ancak orada görürsün.
Kart sıralama nicel sayılır mı
Tree testing nicel: başarı oranı, doğrudan yol oranı ve süre üretir, iki bilgi mimarisini karşılaştırabilirsin. Kart sıralama ise benzerlik matrisi ve dendrogram üretse de yorumu nitel kalır. Kümeleri hangi eşikte kestiğine göre çıkan yapı değişir, o eşiği seçen sensin. Sıralamayla keşfet, tree testing'le doğrula.
Raporlarken
Tabloya tek sayı yazma, aralığı yaz. Tek sayı gördüğü anda ekipteki herkes onu kesin bir gerçek olarak sabitliyor ve bir sonraki toplantıda "%80'e çıkmıştık" cümlesi dolaşıma giriyor.
Ölçüm altyapısını da testten önce doğrula: analitik panelindeki dönüşüm sayısıyla veritabanındaki sipariş sayısı arasındaki farkı kapat, yoksa karşılaştırdığın şey iki tasarım değil, iki farklı olay tetikleme mantığı olur. Bu fark küçük görünür, sonuçları tamamen ters çevirir.