UX Araştırmalarında İç ve Dış Geçerlilik Nasıl Dengelenir?
Bir UX testinin sonucuna güvenip güvenemeyeceğin iki soruya bakar: ölçtüğün fark gerçekten tasarımdan mı geliyor, ve o fark laboratuvarın dışında da duruyor mu? Birincisi iç geçerlilik, ikincisi dış geçerlilik. Sorun şu ki ikisi aynı anda artmaz; birini yükselten düzenleme genelde diğerini aşağı çeker.
İki geçerlilik aynı yöne çekmez
İç geçerlilik gürültüyü azalttıkça artar: sessiz oda, sabit senaryo, aynı moderatör, bildirimi kapatılmış telefon. Dış geçerlilik tam tersini ister, çünkü insanlar uygulamayı sessiz odada değil metroda, tek elle, yarısı okunmuş bir bildirimin peşinden açarak kullanır. Laboratuvarı ne kadar temizlersen bulgu o kadar net çıkar ve gerçek kullanımdan o kadar uzaklaşır.
Kaynaklarda genelde “ikisini birlikte sağlayın” denir. Pratikte böyle bir seçenek yok. Her testte hangisinden ödün verdiğini bilerek karar verirsin, ve bunu rapora yazarsın.
İç geçerlilik: sırayı ve protokolü sabitle
En sık görülen hata sıra etkisi. İki tasarımı aynı katılımcıya hep aynı sırayla gösterirsen ikincisi avantajlı çıkar; kişi o noktada hem görevi hem arayüzün mantığını öğrenmiş olur. Ölçtüğün şey tasarım farkı değil, öğrenme eğrisi.
Çözüm dengeleme, ama dengelemenin bir faturası var ve tavsiyelerde bu fatura genelde yazılmaz. Tam dengeleme n koşul için n! sıra demektir: üç tasarımda 6, dörtte 24, beşte 120 sıra. Her sıraya bir katılımcı düşürmek istiyorsan dörtlü bir karşılaştırmada katılımcı sayın 24'ün katı olmak zorunda. Çoğu projede 24 kişi zaten bütçenin tamamı.
Ben bunu Latin kare ile çözerim. n koşul için n sıra üretir, her tasarım her pozisyonda tam bir kez görünür. Sıra çiftlerinin hepsini dengelemez, ama pozisyon etkisini temizler ve sekiz kişilik bir testte ulaşabileceğin en iyi denge odur. Alternatifi dengelemeyi hiç yapmamak, yani sonucu yanlış okumak.
Geri kalanı disiplin işi. Görev metinlerini yazılı tut ve kelimesi kelimesine aynı oku. Moderatör sayısını mümkünse birde tut, olmuyorsa hangi katılımcının kiminle çalıştığını kaydet; sonuçlar beklenmedik çıktığında bakacağın ilk yer orasıdır. Isınma görevini herkese uygula ve analize katma.
Dış geçerlilik: kimi, nerede test ettiğin
Katılımcı seçimi burada ortam seçiminden daha belirleyici. Testi bültenden ya da mevcut müşteri listesinden çağırdığın kişilerle yaparsan, arayüzü zaten tanıyan bir grupla çalışırsın; yeni kullanıcının ilk temas anı o oturumda hiç görünmez.
Ortam tarafında her şeyi taklit etmeye çalışma, işe yaramaz. Gerçek kullanımda en belirleyici olan tek değişkeni seç ve yalnızca onu teste sok. Saha teknisyeninin kullandığı bir mobil uygulamada bu genelde tek el ve eldivendir, bir ödeme akışında araya giren dikkat dağıtıcılar, bir yönetim panelinde ekranın gerçek boyutu. Katılımcıya kendi telefonunu kullandırmak, kurumsal test cihazından hemen her zaman daha iyi sonuç verir.
Dış geçerliliği tam sağlayamadığın durumlar olacak. O zaman bulguyu çöpe atma, sınırını yaz. “Bu sonuç masaüstünde ve dikkat dağıtıcısız bir ortamda ölçüldü” cümlesi, raporu okuyan geliştiricinin sonucu ne kadar ciddiye alacağını belirler.
Hangisi ne zaman öne geçer
İki tasarım arasında seçim yapıyorsan iç geçerlilik önce gelir: kontrollü ortam, dengelenmiş sıra, sabit görev metni. Amaç hangisinin daha iyi olduğunu bilmek, o farkın sahada ne kadar büyüdüğünü değil.
Yayındaki bir akışın çalışıp çalışmadığını soruyorsan tersi geçerli. Burada laboratuvar testi zaten yanlış araç; ürünün kendi verisi daha güvenilir cevap verir. Adım tamamlama oranını arayüze gömülü tek bir olayla ölçmek birkaç satırlık iş, ve sekiz kişilik bir oturumdan kat kat fazla kullanıcıyı kapsar.
İkisi çeliştiğinde, yani laboratuvarda net görünen fark canlı veride kaybolduğunda, şüpheyi laboratuvara yöneltirsin. Kontrollü ortamda ürettiğin fark çoğu zaman gerçektir; sadece sahadaki gürültünün yanında önemsiz kalacak kadar küçüktür.