a/b testi yapıyoruz ama sonuçlara güvenemiyorum, neyi yanlış yapıyoruz
Ekip olarak test kültürü kurmaya çalışıyoruz ama sonuçlar birbirini tutmuyor. Aynı testi tekrarlayınca farklı sonuç çıkıyor. Araştırdım ve yaptığımız hataları buldum, aynı tuzağa düşenler olabilir.
Erken durdurma. En büyük hatamız buydu. Teste başlıyoruz, üçüncü gün bir taraf önde görünüyor, kazandı deyip durduruyoruz. Oysa küçük örneklemde dalgalanma normal. Süreyi ve örneklem büyüklüğünü baştan belirleyip ona uymak gerekiyor.
Çok fazla metriğe bakmak. Yirmi metrik ölçerseniz, bunlardan biri tesadüfen anlamlı çıkıyor. Testten önce tek bir birincil metrik belirlemek gerekiyor. Diğerleri sadece zarar kontrolü için.
Haftanın günü etkisi. Hafta içi ve hafta sonu davranışı farklı. Testi tam haftalara yaymadan okumak yanıltıyor.
Yenilik etkisi. Değişiklik yeni olduğu için ilk günlerde ilgi çekiyor, sonra normale dönüyor. Kısa testler bu etkiyi gerçek kazanç sanıyor.
Grup kirlenmesi. Aynı kullanıcı farklı cihazlarda farklı gruba düşüyor. Tutarlı bir kimlik kullanmadan grup ataması yapmak sonuçları bozuyor.
Aynı anda birden fazla test. Testler birbirini etkiliyorsa hangisinin ne yaptığını ayıramıyorsunuz.
Düzelttikten sonra ne değişti:
Test başlamadan önce bir sayfa yazıyoruz. Hipotez ne, birincil metrik ne, ne kadar fark anlamlı sayılacak, test kaç gün sürecek, kaç kullanıcı gerekiyor.
Bu sayfayı yazmak testlerin yarısını başlamadan eledi çünkü beklenen etkinin ölçülemeyecek kadar küçük olduğunu gördük.
Bir de negatif sonuçları kaydetmeye başladık. İşe yaramayan fikirlerin listesi, işe yarayanlar kadar değerli çıktı.
Erken durdurma. En büyük hatamız buydu. Teste başlıyoruz, üçüncü gün bir taraf önde görünüyor, kazandı deyip durduruyoruz. Oysa küçük örneklemde dalgalanma normal. Süreyi ve örneklem büyüklüğünü baştan belirleyip ona uymak gerekiyor.
Çok fazla metriğe bakmak. Yirmi metrik ölçerseniz, bunlardan biri tesadüfen anlamlı çıkıyor. Testten önce tek bir birincil metrik belirlemek gerekiyor. Diğerleri sadece zarar kontrolü için.
Haftanın günü etkisi. Hafta içi ve hafta sonu davranışı farklı. Testi tam haftalara yaymadan okumak yanıltıyor.
Yenilik etkisi. Değişiklik yeni olduğu için ilk günlerde ilgi çekiyor, sonra normale dönüyor. Kısa testler bu etkiyi gerçek kazanç sanıyor.
Grup kirlenmesi. Aynı kullanıcı farklı cihazlarda farklı gruba düşüyor. Tutarlı bir kimlik kullanmadan grup ataması yapmak sonuçları bozuyor.
Aynı anda birden fazla test. Testler birbirini etkiliyorsa hangisinin ne yaptığını ayıramıyorsunuz.
Düzelttikten sonra ne değişti:
Test başlamadan önce bir sayfa yazıyoruz. Hipotez ne, birincil metrik ne, ne kadar fark anlamlı sayılacak, test kaç gün sürecek, kaç kullanıcı gerekiyor.
Bu sayfayı yazmak testlerin yarısını başlamadan eledi çünkü beklenen etkinin ölçülemeyecek kadar küçük olduğunu gördük.
Bir de negatif sonuçları kaydetmeye başladık. İşe yaramayan fikirlerin listesi, işe yarayanlar kadar değerli çıktı.
0 3 yorum

@gokhancetin