Karıştırıcı Değişkenler: Neyi Düzeltebilirsiniz, Neyi Düzeltemezsiniz
Bir tasarım değişikliğinin etkisini ölçtüğünüzü sanırken katılımcıların dijital okuryazarlığını ölçüyor olabilirsiniz. Karıştırıcı değişken tam olarak budur: hem denediğiniz değişikliğe hem de ölçtüğünüz sonuca bağlı olan, ama ikisi arasındaki nedensel yolun üzerinde bulunmayan üçüncü bir etken. Asıl zorluk tanımda değil, elinizdeki üçüncü değişkenin hangi türden olduğunu ayırt etmekte.
Her üçüncü değişken karıştırıcı değildir
Bu konudaki tavsiyelerin çoğu tek bir cümlede toplanır: elinizdeki tüm demografik ve davranışsal değişkenleri kaydedin, sonra modele koyup etkilerini temizleyin. Kulağa temkinli geliyor, pratikte veriyi bozan bir alışkanlık. Üçüncü bir değişkenin modele girmesi ancak o değişken gerçekten karıştırıcıysa yanlılığı azaltır. Diğer iki durumda yanlılığı artırır.
Yeni ödeme akışının satın alma tamamlama oranına etkisini ölçtüğünüzü düşünün. Akış kullanıcıyı daha az adımda kasaya götürdüğü için işe yarıyor. Peki bu analizde "sayfada geçirilen süre"yi de kontrol değişkeni olarak eklerseniz ne olur? Tasarımın etkisini taşıyan mekanizmayı sabitlemiş olursunuz ve tasarımın etkisi sıfıra yaklaşır. Süre burada karıştırıcı değil, aracı değişkendir; nedensel yolun üzerindedir ve temizlenmesi gereken şey değil, ölçülen şeyin ta kendisidir.
Bir de tersi var. Analizi yalnızca görevi tamamlayabilen katılımcılar üzerinden yaparsanız, hem tasarımdan hem katılımcı becerisinden etkilenen bir değişkene göre süzme yapmış olursunuz. Bu filtre, kaynakta hiç bulunmayan bir ilişkiyi veriye sonradan sokar. Kolay tarafı yok: hangi değişkenin hangi rolde olduğunu istatistik söylemez, veriyi toplamadan önce kurduğunuz nedensellik varsayımı söyler.
Ölçmediğiniz şeyi düzeltemezsiniz
Rastgeleleştirme ile istatistiksel düzeltme genelde aynı listenin iki maddesi gibi sıralanır. Aynı güçte değiller. Rastgele atama, aklınıza gelmeyen ve hiç ölçmediğiniz karıştırıcıları da gruplar arasında beklenen değerde dengeler. Regresyon ya da ANCOVA yalnızca sütun olarak elinizde duranı düzeltir, üstelik onu da ölçüm hatası kadar eksik düzeltir.
Buradan çıkan sonuç şu: rastgeleleştirme mümkünse tasarımdaki her türlü sonradan düzeltmeden önce gelir. Sonradan düzeltme, rastgeleleştirmenin etik ya da teknik olarak mümkün olmadığı gözlemsel çalışmalar için bir teselli ödülüdür, eşdeğeri değil. Bir bakış açısı meselesi olarak sunulması yanlış.
Rastgele atama gerçekten rastgele mi
Deney tasarımında rastgeleleştirme yazıp geçmek kolay, uygulamada atamanın nerede yapıldığı sonucu değiştirir. Kovaya atamayı istemci tarafında yapan bir kuruluma güvenmem. Varyant betiği tarayıcıda çalışıyorsa, betiğin geç yüklenmesi, reklam engelleyiciye takılması ya da eski bir cihazda hata vermesi katılımcıların bir kısmını sessizce eler. Elenme her iki varyantta eşit olmaz, çünkü varyantlar aynı ağırlıkta değildir. Geriye kalan iki grup artık rastgele değildir ve hiçbir istatistiksel düzeltme bunu geri getirmez.
Neyse ki kontrolü ucuz. Gruplara düşen kullanıcı sayısının beklenen orandan sapıp sapmadığına bakın. 10.000 kullanıcılık 50/50 bir testte 5.100'e 4.900 gibi masum görünen bir dağılım bile ki-kare testinde yaklaşık 0,046 p değeri verir. Bu sapmayı gördüğünüzde metriklere bakmayı bırakıp atama katmanını incelemek gerekir, çünkü örneklem oranı bozuksa sonuçlar da bozuktur.
UX testlerinde tekrar tekrar karşılaşılanlar
Kaynak listelerdeki yaş ve deneyim farkları bilinen kalemler. Daha sinsi olan üçü şunlar:
- Yenilik etkisi. Arayüz değişikliğini ilk gören mevcut kullanıcılar farklı davranır, sonra alışırlar. İlk günlerin verisi tasarımın değil, değişimin ölçümüdür. Yeni ve mevcut kullanıcıları ayrı raporlamak bu etkiyi ayırmanın en pratik yolu.
- Kademeli yayına alma. Yeni sürüm gruplara üç güne yayılarak açılıyorsa, varyant ile haftanın günü iç içe geçer. Salı günü ölçtüğünüz fark tasarımdan mı, salıdan mı geliyor, ayıramazsınız.
- Katılımcı seçimi. Panelden gelen ve teste katılmayı kabul eden kişiler, ürünle ilgilenme düzeyi bakımından ortalama kullanıcıdan sistematik olarak ayrılır. Bu, dengeli dağılımla çözülen bir sorun değil; sonuçların kime genellenebileceğiyle ilgili bir sınırdır.
Pratikte sıralama
Karıştırıcıları kontrol etmenin yöntemleri eşdeğer seçenekler değil, net bir öncelik sırası oluşturur. Rastgeleleştirebiliyorsanız rastgeleleştirin. Rastgeleleştiremiyorsanız, hangi değişkenlerin karıştırıcı olduğunu veri gelmeden önce yazılı olarak kararlaştırın, sonra ölçün. Analiz aşamasında modele değişken ekleyip çıkarmak, hangi kombinasyonun istediğiniz sonucu verdiğini aramaya dönüşür ve bu artık kontrol değil, sonuç seçmedir.
Kontrol edilemeyen bir karıştırıcı kaldıysa, onu makalede ya da rapor notunda açıkça yazmak en dürüst hamle. Bulguyu zayıflatmaz; ne kadarına güvenilebileceğini okuyana söyler.