Konu Başlıkları
Yükleniyor...

Prototip Testlerinde Yapay Zekayla Test Verisi Üretmek

Tablo ve Grafik Prototipleri İçin Sentetik Veri Üretimi

Veri yoğun bir ekranı boş tabloyla test edemezsiniz. Katılımcı sütun başlıklarını değil, hücrelerin içindekini okur; oradaki sayılar uydurma duruyorsa görev yerine veriyi tartışmaya başlar. Dil modelleri bu sahte veriyi dakikalar içinde üretiyor, ama ürettiği şey testin ihtiyacı olan veri değil, ortalamanın verisi oluyor.

Veriden önce testin sorusunu yazın

Üretilecek veri, testte sorduğunuz soruya bağlı. "Kullanıcı en kötü performans gösteren temsilciyi bulabiliyor mu" diye soruyorsanız tabloda birinin belirgin şekilde kötü olması gerekir. "Sıralama kontrolü anlaşılıyor mu" diye soruyorsanız tersine, değerler birbirine yakın olmalı ki kullanıcı göz kararıyla halletmek yerine kontrolü kullanmak zorunda kalsın.

Bu karar verilmeden üretilen veri her zaman aynı yere düşer: ortası kalabalık, uçları temiz, hepsi birbirine benzeyen bir liste. Böyle bir tabloyla yapılan test arayüzün işini kolaylaştırır, sonuçları da olduğundan iyi gösterir.

Modelden veri değil üreteç isteyin

Tablo verisini modelden doğrudan istemiyorum, onun yerine veriyi üreten kısa bir script isterim. Gerekçesi pratik: üreteçte satır sayısını, dağılımı, tarih aralığını parametre yaparsınız ve sabit bir tohum (seed) verdiğinizde aynı veri yeniden çıkar. Aynı ekranı iki hafta sonra ikinci bir katılımcı grubuyla test ettiğinizde tablo aynı kalır, değişen tek şey tasarım olur.

İkinci gerekçe aritmetik. Modelden "12 aylık satış, tatil aylarında yükselsin, ortalama ürün fiyatı 100 TL" diye istediğinizde çıkan sayılar tek tek makul görünür, toplamları ve ortalamaları tutmaz. Tabloda bir toplam satırı varsa katılımcı bunu fark eder ve testin yarısı verinin neden yanlış olduğunu açıklamakla geçer. Üreteç yaklaşımında toplamlar hesaplanır, uydurulmaz.

Modelin asıl işe yaradığı yer metin alanları: ürün adları, kategori isimleri, destek kaydı açıklamaları. Sayıyı koda, metni modele bırakmak ikisinin de güçlü olduğu yerde çalışmak demek.

Gerçekçi veri, sınır değerleri göstermez

Dil modelinden "gerçekçi" veri istediğinizde olasılık dağılımının ortasını alırsınız. Arayüzü bozan değerler ise uçlarda durur:

  • Hücreyi iki satıra taşıran uzun unvan ya da şirket adı
  • Boş ve null değerler, özellikle grafikte çizginin kopacağı yerlerde
  • Negatif tutarlar ve parantezli gösterim
  • Yedi haneli sayıların yanında ondalıklı küçük oranlar, aynı sütunda
  • Sıfır satırlık ve tek satırlık sonuç kümeleri
  • Aynı adın iki kez geçtiği kayıtlar

Test verisini iki kümede hazırlayın: biri tipik gün, diğeri bu uç değerlerle dolu. Uç küme çoğu zaman düzen hatalarını ilk oturumda ortaya çıkarır, tipik küme ise görev akışını ölçmeye yarar. İkisini tek tabloya karıştırmak iki ölçümü de bulandırır.

Veriyi prototipe taşımak

Üretilen verinin tasarım aracına girmesi ayrı bir iş ve burada elle kopyalamak en pahalı yol. Figma tarafında Google Sheets Sync ve Table Builder gibi eklentiler bir sayfadaki satırları bileşenlere bağlar, veriyi değiştirdiğinizde tablo da değişir. Axure CSV dosyasını doğrudan repeater bileşenine alır, sıralama ve filtreleme davranışını prototipte gerçekten çalıştırır.

Grafik tarafında SVG isteyin, görsel değil. Düzenlenebilir SVG'de etiketi, rengi, bir barın yüksekliğini test sırasında dahi değiştirebilirsiniz; PNG geldiğinde her küçük değişiklik için üretim adımına geri dönersiniz.

İsimler ve regüle alanlar

Modeller sahte veri üretirken gerçek şirket ve kişi adları kullanmaya eğilimli. Bu hem katılımcının dikkatini dağıtır, hem de test ekranının bulunduğu bir sunum dosyası dışarı çıktığında açıklaması zor bir durum yaratır. Açıkça kurgu olduğu anlaşılan adlar kullanın.

Sağlık ve finans gibi alanlarda gerçek kayıtların test prototipine girmesi baştan kapalı bir kapı. Sentetik veri burada bir kolaylık değil, tek seçenek. Dağılımı gerçek veriden öğrenip kişisel bilgiyi dışarıda bırakan araçlar bu işi yapar, fakat çıktıyı alan kişinin yine kontrol etmesi gerekir: istatistiksel olarak doğru bir küme, alan bilgisi açısından saçma kayıtlar içerebilir. Bir hastanın tanı tarihinin doğum tarihinden önce olması modele tuhaf gelmez, katılımcıya gelir.