Konu Başlıkları
Yükleniyor...

Genius Tasarımcı Miti: Kullanıcı Testi Neyi Çözer, Neyi Çözmez

Tek Tasarımcıya Güvenmek ve Kullanıcı Testinin Sınırları

Ekipte yetenekli bir tasarımcının olması, arayüzün çalıştığı anlamına gelmiyor. Tasarımcı kendi kurduğu akışa, onu kafasında zaten tamamlamış biri olarak bakar; kullanıcı ise ekrana ilk kez, yarım dikkatle bakar. Kullanıcı testi tam olarak bu iki bakış arasındaki farkı ölçer. Ama her boşluğu doldurmaz ve nerede durduğunu bilmek, testin kendisi kadar işe yarar.

Sezgi neden yanılır

Bir ekranı çizen kişi onu yüzlerce kez görür, başlıkları kendi koyar, hangi adımdan sonra ne geleceğini bilir. Bu bilgi geri alınamaz. Menüdeki "Kaynaklar" başlığının altında ne olduğunu bilen biri, o başlığın anlaşılmaz olduğunu fark edemez.

Uzmanlık bunu tek başına telafi etmiyor. Deneyimli bir tasarımcı hangi kalıpların genelde işe yaradığını bilir, bu gerçek bir avantaj. Fakat "genelde" ile "bu üründe, bu kitlede" arasındaki mesafeyi yalnızca gözlem kapatır. Kullanılabilirlik testinin bütün varlık nedeni bu mesafe.

Test tam olarak ne ölçer

Yöntem kabaca şöyle işler: birine gerçek bir görev verirsiniz, mesela "hesabına kayıtlı kartı değiştir", sonra susup izlersiniz. Nerede duraklıyor, hangi butonu arıyor, hangi kelimeyi yanlış okuyor, bunları not alırsınız. Sorduğunuz soru "beğendin mi" değil, "yapabildi mi".

Ayrım kulağa ince geliyor ama pratikte en çok atlanan yer burası. Beğeni sorusu nazik cevaplar üretir. Görev ise ya tamamlanır ya tamamlanmaz, arada yorum payı kalmaz.

Kaç kişiyle

Nielsen ve Landauer'in modeli basit bir varsayıma dayanır: her katılımcı mevcut sorunların ortalama üçte birine denk gelir. Bu oranı 0,31 kabul edip n katılımcıdan sonra görülen sorun payını hesaplarsanız, 1-(1-0,31)^n ifadesi 5 kişide yaklaşık %84 verir, 15 kişide %99,6. Yani katılımcı sayısını üçe katlamak bulgunun yalnızca 15 puanını daha getiriyor.

Buradan çıkan sonuç, Nielsen'in kendi yazdığı gibi, aynı bütçeyi tek büyük test yerine birkaç küçük tura yaymak. İkinci turun değeri şurada: ilk turda bulunan sorunlar düzeltildiğinde, onların arkasında kalan ve hiç sıra gelmeyen sorunlar görünür hale gelir. Tek seferlik 15 kişilik test bu katmanı hiç açmaz. %31 de sabit bir yasa değil, arayüzün olgunluğuna göre oynar; olgun bir üründe kişi başı bulgu düşer, o zaman tur sayısı artar.

Testin yanıtlamadığı soru

Kullanıcı testine karşı en sık kurulan savunma Steve Jobs üzerinden gelir: vizyon sahibi biri varsa test niye. Buna karşılık verilen örnek de genelde Mac Cube olur, oysa Cube kullanılabilirlik yüzünden batmadı. Fiyatı ve kime satıldığı yüzünden battı.

Örneğin yanlış kullanılması meselenin sınırını da gösteriyor. Görev testi "bunu kullanabiliyor mu" sorusunu yanıtlar; "bunu satın alır mı" sorusuna hiçbir şey söylemez. İkisini aynı kefeye koyan ekip, akışı kusursuz çalışan ama kimsenin istemediği bir ürüne kolayca varır. Talep sorusu ayrı bir yerden ölçülür: fiyatlandırma denemeleri, satış verisi, ödeme adımına kadar giden gerçek bir akış.

Ölçmenin faturası

Süreç önerileri genellikle testin bedava olduğunu varsayarak yazılır. Beş kişilik moderatörlü bir tur gerçekten ucuz, yarım gün ve biraz sabır. A/B testi ise ucuz görünüp pahalı çıkar.

Gereken örneklem, ölçmek istediğiniz farkın karesiyle ters oranda büyür. Dönüşümü %5'ten %6'ya çıkaran bir değişikliği ayırt etmek için kol başına kabaca 7.500 ziyaretçi gerekir. Günde 200 ziyaretçi alan bir site bunu iki kola bölünce iki buçuk ayda toplar, ve o süre boyunca iki varyantın ikisi de canlı kalmak zorundadır. Kodda bu, aynı akışın iki ayrı yolu ve o yolların bakımı demek (küçük trafikli kurumsal sitelerde A/B testini bu yüzden fazla iddialı buluyorum). Aynı bütçe üç tur moderatörlü teste girseydi daha çok şey öğrenirdi.

Kontrol noktaları

Testi sürecin sonuna bırakmak, bulguları uygulanamaz hale getiriyor. Canlıya iki gün kalmışken öğrenilen bir navigasyon sorunu, düzeltilmek yerine not ediliyor. Erken bakılacak yerler kısa:

  • Tıklanabilir prototip, henüz kod yazılmadan
  • İlk çalışan sürüm, sınırlı bir kullanıcı grubuyla
  • Canlıya çıktıktan sonraki ilk hafta, gerçek trafikte

Bu noktalarda sorulan soru her seferinde aynı: hangi görev tamamlanamadı, nerede duraklandı.

Nerede durmalı

Testin de azalan getirisi var. İki tur üst üste yeni bulgu vermiyorsa arayüz büyük ölçüde temizlenmiş demektir, üçüncü turu zorlamanın anlamı yok. Ürün buna rağmen tutmuyorsa sorun arayüzde değildir; konumlandırmada, fiyatta ya da kimseye ulaşamayan bir tanıtımda aranır. Kullanıcı testi tasarımcının kör noktasını kapatan bir araç, ürün kararlarının tamamını üstlenen bir merci değil.