Konu Başlıkları
Yükleniyor...

Trafik Loglarında Zipf Eğrisi: Uzun Kuyruk Gerçekten Nerede?

Zipf Dağılımı ve Site Trafiği: Kuyruğun Payı Nasıl Hesaplanır

Sayfa görüntülemelerini en çoktan en aza doğru sıraladığınızda çıkan eğri neredeyse her sitede birbirine benzer: birkaç sayfa büyük bir pay alır, binlerce sayfa teker teker kırıntı toplar. Buna Zipf dağılımı deniyor. Asıl soru eğrinin şekli değil, kuyruğun toplamda ne kadar ettiği, ve çoğu trafik analizi bu ikisini birbirine karıştırıyor.

Eğrinin şekli bir bulgu değil

Aynı eğri kelime frekanslarında, şehir nüfuslarında, kütüphane ödünç kayıtlarında da var. Loglarınızın Zipf'e uyması siteniz hakkında bir şey anlatmıyor; insanların seçim yapma biçimi hakkında bir şey anlatıyor.

Log-log grafiğinin düz çıkmasını site sağlığının kanıtı saymam. Sıralı insan verisi zaten o çizgiye oturuyor, oturmaması ilginç olurdu. Peki eğri kırılırsa? İlk üç beş sayfa beklenenin çok üstüne çıkıp arkasından dik düşüyorsa, orada bakılacak gerçek bir şey var: tek bir kampanya, bot trafiği, ya da iç linklemenin her yolu ana sayfaya bağlaması.

Kuyruk toplamın ne kadarı?

Zipf'in klasik halinde bir sayfanın görüntülenmesi sırasının tersiyle değişir: ikinci sayfa birincinin yarısı, onuncu sayfa onda biri. Toplam trafiği bulmak için harmonik toplam gerekiyor ve bu toplam logaritmik büyüdüğü için baştaki birkaç yüz sayfa şaşırtıcı derecede ağır basıyor.

100.000 sayfalık bir sitede, eğim tam 1 ise:

İlk kaç sayfaToplam görüntülemedeki payı
100%43
500%56
2.000%68

Yani sayfalarınızın yüzde yarımı trafiğin yarısından fazlasını taşıyor. "Toplam trafiğin çoğu uzun kuyruktan gelir" cümlesi bu hesapla çelişiyor, en azından eğim 1 olduğunda.

Her şey eğime bağlı

Eğim 1'in altına indiğinde, yani eğri yatıklaştığında tablo tersine dönüyor. Aynı siteyi 0,8 eğimle hesaplayın, ilk 500 sayfanın payı %56'dan %28'e düşer. Kuyruğun ağırlığı Zipf'in bir sonucu değil, sizin kendi eğiminizin sonucu. Ölçmeden hangi uca yatırım yapacağınızı bilemezsiniz.

Ölçmek için üçüncü parti araca gerek yok: sayfa başına görüntüleme sayılarını sıralayın, hem sırayı hem görüntülemeyi logaritmaya çevirin, bu iki diziye doğru uydurun. Doğrunun eğimi aradığınız sayı. Analytics dışa aktarımı ya da doğrudan erişim logları, ikisi de iş görür; sunucu loglarında bot filtresini elle kurmanız gerekir, Analytics onu kabaca kendisi yapıyor.

Bir kez girilen sorgu hedeflenemez

Arama sorgularının dağılımı da aynı eğriyi izliyor ve kuyrukta çoğu sorgu bir ya da iki kez geçiyor. Buradan "uzun kuyruk anahtar kelimelere göre optimize edin" tavsiyesi çıkmıyor. Tek seferlik bir sorguyu önceden bilemezsiniz; bilebildiğiniz an o sorgu artık tek seferlik değildir.

Kuyruk, hedeflenerek değil kapsam genişliğiyle yakalanıyor. Bir konuyu gerçekten ayrıntılı anlatan sayfa, yazarken akla gelmemiş yüzlerce soru kalıbıyla eşleşir. Bu yüzden kuyruk stratejisi anahtar kelime listesi işi değil, içeriğin derinliği işi.

Yönlendiren siteler de aynı eğri

Dış kaynaklara baktığınızda da birkaç büyük kaynağın geri kalan her şeyi gölgede bıraktığını görürsünüz. Risk de burada: eğim dikse trafiğinizin yarısı tek bir kaynağın algoritmasına bağlı demektir. Bunu ölçmenin basit bir yolu var, kaynak dağılımınızın eğimini sayfa dağılımıyla aynı yöntemle hesaplayın. Sayfalarınız yatık, kaynaklarınız dik çıkıyorsa içerikte değil dağıtımda kırılgansınız.

Kuyruktaki sayfayla ne yapılır

Kuyruk kalabalık olduğu için oradaki her sayfayı iyileştirmek diye bir şey yok. Üç durumu ayırmak işe yarıyor:

  • Gösterim alıyor, tıklama almıyor: başlık ve açıklama sorunu, en hızlı kazanç burada.
  • Ne gösterim ne tıklama: çoğu zaman birbirinin yakın kopyası olan sayfalar. Birleştirin.
  • Az ama düzenli trafik alıyor: dokunmayın, bunlar kuyruğun çalışan kısmı.

İlk gruba öncelik vermek, kuyruğu baştan sona elden geçirmeye kalkışmaktan çok daha verimli. Zaten kuyruğun tamamını tek tek iyileştirmeye çalışmak tanım gereği bitmeyen bir iştir: siz yazdıkça kuyruk uzuyor.