Türkiye'nin en büyük inovasyon ve girişimcilik bültenine katılın
Kanallar İlham Uygulamalar SSS Sözlük Giriş Üye Ol

Veri (DATA)

/veri · 8.YIL

Türkiye'nin En Kapsamlı Veri Topluluğu

56 içerik Katıl
#veri (data) akışına dön
@gokhancetin · 43 gün önce

a/b testi yapıyoruz ama sonuçlara güvenemiyorum, neyi yanlış yapıyoruz

Ekip olarak test kültürü kurmaya çalışıyoruz ama sonuçlar birbirini tutmuyor. Aynı testi tekrarlayınca farklı sonuç çıkıyor. Araştırdım ve yaptığımız hataları buldum, aynı tuzağa düşenler olabilir.

Erken durdurma. En büyük hatamız buydu. Teste başlıyoruz, üçüncü gün bir taraf önde görünüyor, kazandı deyip durduruyoruz. Oysa küçük örneklemde dalgalanma normal. Süreyi ve örneklem büyüklüğünü baştan belirleyip ona uymak gerekiyor.

Çok fazla metriğe bakmak. Yirmi metrik ölçerseniz, bunlardan biri tesadüfen anlamlı çıkıyor. Testten önce tek bir birincil metrik belirlemek gerekiyor. Diğerleri sadece zarar kontrolü için.

Haftanın günü etkisi. Hafta içi ve hafta sonu davranışı farklı. Testi tam haftalara yaymadan okumak yanıltıyor.

Yenilik etkisi. Değişiklik yeni olduğu için ilk günlerde ilgi çekiyor, sonra normale dönüyor. Kısa testler bu etkiyi gerçek kazanç sanıyor.

Grup kirlenmesi. Aynı kullanıcı farklı cihazlarda farklı gruba düşüyor. Tutarlı bir kimlik kullanmadan grup ataması yapmak sonuçları bozuyor.

Aynı anda birden fazla test. Testler birbirini etkiliyorsa hangisinin ne yaptığını ayıramıyorsunuz.

Düzelttikten sonra ne değişti:

Test başlamadan önce bir sayfa yazıyoruz. Hipotez ne, birincil metrik ne, ne kadar fark anlamlı sayılacak, test kaç gün sürecek, kaç kullanıcı gerekiyor.

Bu sayfayı yazmak testlerin yarısını başlamadan eledi çünkü beklenen etkinin ölçülemeyecek kadar küçük olduğunu gördük.

Bir de negatif sonuçları kaydetmeye başladık. İşe yaramayan fikirlerin listesi, işe yarayanlar kadar değerli çıktı.
0 3 yorum
Yorumlar (3)
@bberber · 41 gün önce 5
Erken durdurma hatasını çok iyi yakalamışsın, bu en yaygın ve en pahalı hata.

İnsanlar günlük sonuçlara bakınca dayanamıyor. Çözüm olarak biz test süresince sonucu kimseye göstermiyoruz. Sadece zarar kontrolü metriklerine bakılıyor.

Kulağa sert geliyor ama merakı ortadan kaldırdı ve testler düzgün tamamlanmaya başladı.

Bir de gerekli örneklem büyüklüğünü önceden hesaplamak şart. Bunu yapmadan başlayan testlerin çoğu, sonuç çıkaramayacak kadar küçük trafikle yürüyor.

İnternette ücretsiz hesaplayıcılar var, beş dakikalık iş.
@quadri · 40 gün önce 3
Negatif sonuçları kaydetme fikri çok değerli, biz de yapıyoruz ve beklenmedik faydası oldu.

Aynı fikir iki yıl arayla iki kez önerildi. Arşive bakınca daha önce denendiğini ve işe yaramadığını gördük.

O belge sayesinde aynı işi ikinci kez yapmadık.

Kaydederken şunları yazmak faydalı: fikir neydi, neden işe yarayacağını düşündük, ne oldu, tahminimiz neden yanlış çıktı.

Son soru en öğretici olanı. Yanlış varsayımları görmek, ürün anlayışını gerçekten geliştiriyor.
@gaponmychest · 37 gün önce 4
Bir noktada ayrılıyorum. Her şeyi test etmeye çalışmak da bir tuzak.

Küçük trafikli ürünlerde anlamlı test yapmak neredeyse imkânsız. İstatistiksel anlamlılığa ulaşmak için gereken kullanıcı sayısı yok.

O durumda test yapıyormuş gibi yapmak, hiç yapmamaktan kötü. Çünkü gürültüyü sinyal sanıp yanlış karar veriyorsunuz.

Küçük ürünlerde daha iyi çalışan şey, az sayıda kullanıcıyla derinlemesine görüşme. Beş kullanıcıyı izlemek, anlamsız bir testten çok daha fazla bilgi veriyor.

Test, belirli bir trafik eşiğinden sonra anlamlı bir araç.