Between-Subjects ve Within-Subjects Tasarımı Arasında Seçim
Nicel bir kullanıcı testi kurarken verilen ilk karar, hangi katılımcının hangi koşulu göreceğidir. Between-subjects tasarımda her kişi tek bir sürümü dener, within-subjects tasarımda aynı kişi sürümlerin hepsini görür. Bu seçim örneklem büyüklüğünü, oturum süresini ve sonunda hangi istatistiği kullanabileceğinizi birlikte belirler.
Farkı somutlaştıralım
Elinizde iki ödeme akışı var: A ve B. Between-subjects kurulumda kırk kişiyi ikiye bölersiniz, yirmi kişi yalnızca A'yı, yirmi kişi yalnızca B'yi tamamlar. Elinizde iki bağımsız grubun ortalaması kalır ve bunları karşılaştırırsınız.
Within-subjects kurulumda aynı yirmi kişi hem A'yı hem B'yi tamamlar. Artık karşılaştırdığınız şey iki grup ortalaması değil, her kişinin kendi içindeki farkı: aynı kullanıcı A'da 48 saniyede, B'de 39 saniyede bitirmiştir. Veri noktası sayısı ikiye katlanır, ama her kişi iki kez oturuma girdiği için oturum süresi de öyle.
Within-subjects gücünü nereden alıyor
Kullanıcılar arasındaki hız farkı, ölçmek istediğiniz tasarım farkından genellikle çok daha büyüktür. Bir kişi arayüzü 20 saniyede tanır, bir başkası 90 saniyede; iki ödeme akışı arasındaki gerçek fark ise belki 8 saniyedir. Between-subjects tasarımda bu kişisel değişkenlik doğrudan gürültü olarak verinin içinde durur ve aradığınız 8 saniyeyi örter.
Within-subjects tasarımda her katılımcı kendi kontrolüdür. Yavaş kullanıcı her iki koşulda da yavaştır, hızlı olan her ikisinde de hızlı; farkı aldığınızda kişisel taban düşer ve geriye büyük ölçüde koşulun etkisi kalır.
Burada dikkat edilecek bir nokta var. Bu kazanç, aynı kişinin iki ölçümünün birbiriyle ne kadar ilişkili olduğuna bağlıdır. İlişki güçlüyse fark neredeyse gürültüsüz gelir. Görev her denemede farklı bir stratejiyle çözülüyorsa, yani aynı kişinin iki ölçümü birbirini tahmin etmiyorsa, within-subjects'in istatistiksel üstünlüğünün büyük kısmı erir ve geriye yalnızca katılımcı sayısındaki tasarruf kalır.
Sıra etkisi ve dengelemenin faturası
Aynı kişiye iki sürümü göstermenin bedeli, ikinci sürümü artık acemi olmayan biri olarak görmesidir. Akışı bir kez tamamlayan kullanıcı alan adlarını, buton yerlerini, hata mesajlarını tanır; ikinci ölçüm neredeyse her zaman daha hızlıdır. Bu, tasarımın değil öğrenmenin sonucudur.
Standart çözüm sırayı dengelemek: katılımcıların yarısı A'yı önce, yarısı B'yi önce görür. İki koşulda bu ucuz. Koşul sayısı arttığında ucuz olmaktan çıkıyor, çünkü tüm sıraların eşit temsil edilmesi için gereken sıra sayısı koşul sayısının faktöriyeliyle büyür.
| Koşul sayısı | Tam dengeleme için sıra sayısı | Latin karesiyle |
|---|---|---|
| 2 | 2 | 2 |
| 3 | 6 | 3 |
| 4 | 24 | 4 |
| 5 | 120 | 5 |
Dört koşullu bir testte tam dengeleme 24 farklı sıra ister ve her sıraya eşit sayıda kişi düşmesi için katılımcı sayınızın 24'ün katı olması gerekir. Latin karesi bunu koşul sayısına indirir, her koşulun her pozisyonda eşit görünmesini garanti eder, ama hangi koşulun hangisinden sonra geldiğini dengelemez (tek sayıda koşulda dengeli kare 2k sıra ister). Yani within-subjects'in "daha az katılımcı" avantajı iki koşulda gerçek, dört koşulda tersine dönmeye başlar. Kaynaklarda bu tasarımın maliyet avantajı çoğu zaman koşul sayısından bağımsızmış gibi anlatılır; değil.
Seçimin olmadığı durumlar
Bazı karşılaştırmalarda karar zaten verilmiştir. Katılımcıyı tanımlayan bir özelliği karşılaştırıyorsanız, yaş grubu, uzmanlık düzeyi, ekran okuyucu kullanıp kullanmadığı gibi, kimse iki koşulda birden olamaz; tasarım zorunlu olarak between-subjects'tir.
İkinci zorunlu durum geri alınamaz öğrenme. Onboarding akışının iki sürümünü karşılaştırıyorsanız, kullanıcı ikinci kez ilk defa karşılaşamaz. Sıra dengelemesi burada işe yaramaz, çünkü dengelenecek olan etki değil, koşulun kendisinin yok olmasıdır. Aynı şey ilk izlenim, marka algısı ve fiyat şoku ölçümleri için de geçerli.
Canlı trafikte durum değişir
Canlı sitede çalışan bir A/B testini within-subjects kurmam. Aynı ziyaretçiye iki sürümü göstermek için kalıcı bir kullanıcı kimliği, sürüm başına ayrı önbellek anahtarı ve her istekte tutarlı yönlendirme gerekir; oturum ortasında sürüm değiştiren kullanıcı sepetini, çerezini, bazen oturumunu da kaybeder. Ölçtüğünüz şey sürümler arasındaki fark olmaktan çıkar, geçişin yarattığı kesinti olur. Canlı trafik zaten bol katılımcı üretiyor, between-subjects'in en pahalı yanı orada bedava.
Laboratuvar testi ya da moderatörlü uzaktan oturum bunun tersi: katılımcı bulmak pahalı, sıra kontrolü ise sizde. Within-subjects'in mantıklı olduğu yer burası.
Karar
İki koşulunuz varsa, görev tekrarlanabiliyorsa ve katılımcı bulmak zorsa within-subjects seçin; sırayı dengeleyin, katılımcı sayısını çift tutun. Koşul sayısı üçü geçiyorsa, öğrenme geri alınamıyorsa ya da karşılaştırdığınız şey katılımcının kendi özelliğiyse between-subjects seçin ve tasarrufu katılımcı sayısından değil, oturum kısalığından bekleyin.
Her iki durumda da atamanın rastgele olması şart. Sıra dengelemesi kimin hangi sırayı göreceğini rastgele belirlemezse, dengelediğinizi sandığınız şeyi başka bir yanlılıkla değiştirmiş olursunuz.