Ali Demirbaş
Hesaplayıcılar

A/B Test Anlamlılık Hesaplayıcısı

Kontrol ile varyant arasındaki farkın rastlantıyla açıklanabilecekten büyük olup olmadığını kontrol et.

p-değeri

0,0768

Sayılar girilip Hesapla'ya basıldığında sonuç burada görünür.

z-skoru = (Varyant oranı − Kontrol oranı) ÷ Standart hata

Örnek hesap

5.000 / 250'ye karşı 5.000 / 290 p = 0,0768

Bu sayı ne söyler

Test bir sıfır hipotezinden başlar: iki tarafın da aynı gerçek dönüşüm oranına sahip olduğu ve gördüğün farkın rastgele atamadan gelen gürültü olduğu. Z-testi, gözlenen farkın sıfırdan ne kadar uzakta olduğunu ölçer; p-değeri ise sıfır hipotezi doğruysa en az bu büyüklükte bir farkın ne kadar olası olacağını söyler.

0,05'lik bir p-değeri, varyantın %95 olasılıkla daha iyi olduğu anlamına gelmez. Bu, hipotez verilmişken veri hakkında bir ifadedir, veri verilmişken hipotez hakkında değil. Ayrıca etkinin büyüklüğü hakkında hiçbir şey söylemez.

İstatistiksel anlamlılık ve pratik anlamlılık ayrı sorulardır. Anlamlı bir 0,1 puanlık artış, uygulamanın karmaşıklığına değmeyebilir; ticari olarak anlamlı bir artış ise sadece örneklem küçük olduğu için anlamlılığa ulaşamayabilir.

Ne zaman kullanılır

Test planladığın örneklem büyüklüğüne ulaştıktan sonra, bir kez kontrol et. Veri biriktikçe kontrol etmek, sayının kaldıramayacağı şeydir.

Nerede yanıltır

Tekrar tekrar bakmak ve ilk geçişte durmak, yanlış pozitif oranını beyan edilen eşiğin çok üzerine çıkarır. Ve 'anlamlı değil', bir fark olmadığı anlamına gelmez; testin gerçekten var olan farkı görecek kadar büyük olmadığı anlamına da gelebilir.

Sık sorulan sorular

Testim anlamlı çıkmadı. Bu bir fark olmadığı anlamına mı gelir?

Anlamlı olmayan bir sonuç, kontrol ile varyant arasında anlamlı bir fark olmadığı anlamına gelebileceği gibi, örneklemin var olan farkı tespit edemeyecek kadar küçük olduğu anlamına da gelebilir; ikisi de yalnızca p-değerine bakınca aynı görünür. Testin çalıştığı trafik ve sürenin, umduğun büyüklükte bir etkiyi tespit etmek için gerçek bir şansı verip vermediğini görmek üzere örneklem büyüklüğü hesaplayıcısını kontrol et; gereken örneklem, testin gerçekte topladığından çok daha büyükse, 'anlamlı değil' gerçek bir sıfır etkiden çok, yetersiz güçle çalışan bir test anlamına gelme ihtimali daha yüksektir. Anlamlı bir sonuç ile yetersiz güçlü anlamsız bir sonuç, hesaplayıcının ikili anlamlı/anlamlı değil çıktısı ikisini bir bakışta benzer gösterse bile, simetrik sonuçlar değildir.

Bunu kontrol etmeden önce testi ne kadar süre çalıştırmalıyım?

Tespit etmeye çalıştığın etki için testin gerektirdiği örneklem büyüklüğüne ulaşacak kadar (örneklem büyüklüğü hesaplayıcısı bu sayıyı verir) ve haftanın hangi gününde olduğuna bağlı trafik örüntülerinin hiçbir tarafı çarpıtmaması için en az bir tam haftalık döngü boyunca. Önceden planlanan örneklem büyüklüğünü beklemek yerine, anlık p-değeri ilk kez 0,05'in altına düştüğü anda durmak, bir test sonucunun yanıltıcı olmasının en yaygın yollarından biridir; çünkü tekrar tekrar bakıp ilk anlamlı görünen anda durmak, gerçek yanlış pozitif oranını %5'in çok üzerine çıkarır. Test süresi tahmincisi, gereken bir örneklem büyüklüğünü mevcut trafiğe göre gerçek bir gün sayısına çevirir; bu, p-değerinin gün gün hareketini izlemekten daha güvenilir bir durma kuralıdır.

P-değeri gerçekte ne anlama gelir?

P-değeri, kontrol ve varyantın gerçekte aynı gerçek dönüşüm oranına sahip olduğu ve gözlenen farkın tek nedeninin hangi tarafa kimin atandığındaki rastgelelik olduğu varsayıldığında, gözlenenle en az aynı büyüklükte bir farkı görme olasılığıdır. Sıfır hipotezinin doğru olma olasılığı değildir ve varyantın gerçekten daha iyi olma olasılığı da değildir; ikisi de aynı sayının yaygın yanlış okumalarıdır. Örneğin 0,0768'lik bir p-değeri, kontrol ile varyant arasında gerçekten hiçbir fark olmasaydı, rastgele atamaların kabaca %7,7'sinde bu büyüklükte veya daha büyük bir farkın ortaya çıkacağı anlamına gelir. Bu, bir varsayım verildiğinde veri hakkında bir ifadedir, hangi versiyonun gerçekten daha iyi olduğuna dair bir hüküm değil.

İstatistiksel ve pratik anlamlılık arasındaki fark nedir?

İstatistiksel anlamlılık, toplanan örneklem büyüklüğü verildiğinde gözlenen farkın makul rastlantısal değişimden büyük olup olmadığını sorar. Pratik anlamlılık ise, uygulama maliyeti, karmaşıklık ve varsa ödünleşimler dikkate alındığında bu farkın işletme için önemli olacak kadar büyük olup olmadığını sorar. İkisi her iki yönde de uyuşmayabilir: küçük, ticari olarak önemsiz bir artış, yeterince büyük bir örneklemle istatistiksel anlamlılığa ulaşabilir; gerçekten büyük, değerli bir artış ise örneklem çok küçükse anlamlılığa ulaşamayabilir. İstatistiksel olarak anlamlı bir sonuç ciddiye alınması gereken bir sinyaldir, tek başına bir gönderme kararı değil; etkinin büyüklüğü ve güven aralığı, p-değerinin bir eşiği geçip geçmediği kadar önemlidir.

%95 güven, varyantın daha iyi olma olasılığının %95 olduğu anlamına mı gelir?

Bu, anlamlılık testinin en yaygın yanlış okumalarından biridir. %95 güven (0,05'in altında bir p-değeri), kontrol ile varyant gerçekten aynı dönüşüm oranına sahip olsaydı, bu büyüklükte veya daha büyük bir farkın rastlantı sonucu %5'ten az sıklıkla ortaya çıkacağı anlamına gelir. Varyantın gerçekten daha iyi olma olasılığı hakkında doğrudan hiçbir şey söylemez; bu, tamamen farklı bir türde bir hesaplama gerektirir: bir sıfır hipotezine karşı test etmek yerine bir varyantın diğerini geçme olasılığını doğrudan tahmin eden Bayesçi bir yaklaşım. Bu frekansçı test ile Bayesçi bir test, aynı soru gibi hissettiren şeye farklı görünen yanıtlar üretebilir, çünkü resmi olarak farklı soruları yanıtlarlar.

İlgili hesaplayıcılar