Kalkulator Testu z - Test A/B, Proporcje i Średnia

    Czy wersja B naprawdę konwertuje lepiej? Test z dla jednej lub dwóch proporcji i dla średniej przy znanym σ podaje wartość p, przedział ufności i wielkość efektu.

    Parametry

    Wprowadź dane do obliczeń

    Od tego zależą pola poniżej

    Ustal przed zebraniem danych

    Próg dla decyzji

    Postęp wypełniania0 / 3 pól

    💡 Wypełnij wszystkie wymagane pola, aby odblokować przycisk obliczania

    Test z dla proporcji i średniej, czyli czy różnica w liczebnościach jest prawdziwa

    Dwie wersje strony, 4 000 odwiedzin każda: wersja A sprzedała 200 razy, wersja B 250 razy. Kalkulator testu z zamienia takie liczebności na statystykę z = 2,426 i wartość p = 0,0153, więc przy progu 0,05 różnica jest istotna. Obok podaje przedział ufności dla różnicy (0,24 do 2,26 pp) i wielkość efektu, żeby było widać, czy wynik ma też znaczenie praktyczne.

    Kalkulator obsługuje trzy warianty testu. Jedna proporcja porównuje odsetek z próby z wartością deklarowaną, na przykład wynik ankiety z progiem 50 %. Dwie proporcje to klasyczny test A/B: konwersja, kliknięcia, odsetek wadliwych sztuk w dwóch partiach. Średnia przy znanym σ sprawdza średnią z próby, gdy odchylenie standardowe populacji jest znane z zewnątrz, na przykład z karty maszyny.

    Test A/B i pozostałe warianty krok po kroku

    1. Rodzaj testu - jedna proporcja, dwie proporcje albo średnia przy znanym odchyleniu. Od wyboru zależy, które pola się pokażą.
    2. Liczba sukcesów i liczebność - w teście proporcji wpisujesz liczby całkowite: ile osób kupiło i ile w ogóle weszło na stronę. Odsetek kalkulator policzy sam, więc nie trzeba go zaokrąglać.
    3. Proporcja odniesienia - tylko przy jednej proporcji. Wartość w procentach, z którą porównujesz wynik, na przykład 50 przy pytaniu, czy większość jest za.
    4. Średnia, σ, n i wartość odniesienia - tylko w wariancie dla średniej. σ musi pochodzić spoza próby. Odchylenie policzone z tych samych pomiarów oznacza test t, nie test z.
    5. Hipoteza - dwustronna, gdy interesuje Cię różnica w dowolną stronę. Prawostronna, gdy przed testem zakładałeś, że B wypadnie lepiej niż A albo próba wyżej niż odniesienie.
    6. Poziom istotności - najczęściej 0,05, przy kosztownych decyzjach 0,01.
    7. Odczytaj wyniki - statystyka z, wartość p z decyzją, wartość krytyczna, przedział albo granica ufności, h Cohena lub d Cohena oraz tabela z rachunkiem.

    Test z, test t, chi-kwadrat czy Fisher

    Test z nie jest jedynym narzędziem do tych pytań. Tabela zestawia go z trzema najbliższymi sąsiadami i pokazuje, kiedy który ma przewagę.

    Parametr Test z Test t Chi-kwadrat Test Fishera
    Daneliczebności albo średnia przy znanym σpomiary, σ z próbytabela liczebnościtabela 2 × 2
    Wielkość próbyduża, co najmniej 5-10 sukcesów i porażekdowolnaoczekiwane liczebności co najmniej 5dowolna, także bardzo mała
    Hipoteza jednostronnataktaknie wprosttak
    Kierunek i wielkość różnicyznak z, różnica w pp, h Cohenaznak t, d Cohenatylko siła związkuiloraz szans
    Kto powinien wybraćtest A/B, ankiety, kontrola jakościpomiary ciągłe bez znanego σwięcej niż dwie grupy lub kategoriemałe próby 2 × 2
    WerdyktPrzy dwóch grupach i dużych liczebnościach test z i chi-kwadrat dla tabeli 2 × 2 bez poprawki Yatesa dają tę samą wartość p, bo χ² = z². Test z mówi dodatkowo, w którą stronę idzie różnica.

    Wzór i trzy rachunki rozpisane do końca

    Każdy wariant sprowadza się do tej samej konstrukcji: różnica podzielona przez błąd standardowy.

    jedna proporcja: z = (p̂ - p₀) / √(p₀(1 - p₀) / n)
    dwie proporcje: z = (p̂B - p̂A) / √(p(1 - p)(1/nA + 1/nB)), gdzie p = (xA + xB) / (nA + nB)
    średnia: z = (x̄ - μ₀) / (σ / √n)
    1
    Test A/B konwersji. A: 200 z 4 000, czyli 5,00 %. B: 250 z 4 000, czyli 6,25 %. Proporcja łączna 450 / 8 000 = 5,63 %, błąd standardowy 0,00515, z = 0,0125 / 0,00515 = 2,426, p dwustronne 0,0153. Względnie B jest lepsza o 25,0 %, ale h Cohena wynosi tylko 0,054.
    2
    Ankieta wobec progu 50 %. 540 z 1 000 odpowiedzi na „tak”, czyli 54,00 %. Błąd standardowy przy H₀: √(0,5 × 0,5 / 1 000) = 0,01581, z = 0,04 / 0,01581 = 2,530, p = 0,0114. Przedział Wilsona 95 %: 50,90 % do 57,07 %, cały powyżej połowy.
    3
    Średnia przy znanym σ. Maszyna ma w dokumentacji σ = 2 g. Z 36 opakowań średnia wynosi 498,9 g przy deklaracji 500 g. Błąd standardowy 2 / √36 = 0,33333, z = -1,1 / 0,33333 = -3,300, p = 0,0010. Przedział 95 %: 498,2467 do 499,5533 g, więc 500 g leży poza nim.

    Sześć wyników obok siebie

    Każdy wiersz to osobne uruchomienie kalkulatora przy α = 0,05. Warto zwrócić uwagę na dwa ostatnie: mała próba z dużą różnicą i ogromna próba z różnicą prawie niewidoczną.

    Dane z p h lub d Decyzja
    A 200/4 000, B 250/4 000, dwustronnie2,4260,01530,054istotna
    Te same dane, α = 0,012,4260,01530,054nieistotna, przedział -0,08 do 2,58 pp
    Ankieta 540/1 000 wobec 50 %2,5300,01140,080istotna
    Średnia 498,9 g, σ = 2, n = 36, wobec 500 g-3,3000,0010-0,550istotna, efekt średni
    A 10/80, B 18/80, dwustronnie1,6650,09600,266nieistotna mimo różnicy 10 pp
    A 10 000/200 000, B 10 300/200 0002,1610,03070,007istotna przy różnicy 0,15 pp

    Wartość p mówi, czy różnica wystaje ponad szum, a nie czy jest duża. Przy 400 000 odwiedzin istotna okazuje się różnica 0,15 pp z h Cohena 0,007, a przy 160 osobach nieistotna jest różnica 10 pp, prawie czterdzieści razy większa w h Cohena.

    Pięć pułapek, przez które test A/B kłamie

    Hipoteza jednostronna wybrana po wyniku. A 10/80 i B 18/80 dają dwustronnie p = 0,0960, a prawostronnie 0,0480. Przełączenie po fakcie zamienia porażkę w „sukces”. Lepiej: kierunek zapisać przed zebraniem danych, a w razie wątpliwości zostać przy dwustronnej.
    Zaglądanie do wyników co godzinę. Kto sprawdza p wiele razy i kończy test przy pierwszym wyniku poniżej 0,05, dostaje fałszywe sukcesy znacznie częściej niż w 5 % przypadków. Lepiej: z góry ustalić liczbę odwiedzin i policzyć test raz, na końcu.
    Za mało sukcesów w grupie. Przy 3 z 40 w grupie A przybliżenie normalne zawodzi i kalkulator to sygnalizuje. Lepiej: sprawdzić te same dane dokładnym testem Fishera.
    σ policzone z tej samej próby. Wtedy test z zaniża wartość p przy małych próbach, bo ignoruje niepewność samego odchylenia. Lepiej: test t jednopróbowy.
    Względna zmiana zamiast różnicy. „Plus 25 %” brzmi imponująco, a to 1,25 pp. Lepiej: podawać obie liczby i przedział ufności dla różnicy.

    Pytania o test z

    Czym test z różni się od z-score?
    Z-score opisuje położenie jednej wartości względem średniej i odchylenia, bez żadnej hipotezy. Test z używa tej samej skali, ale dla różnicy między próbą a wartością odniesienia albo między dwiema grupami, i zamienia ją na wartość p. Pojedynczą wartość przeliczysz w kalkulatorze z-score.
    Ile osób potrzeba do testu A/B?
    Zależy od wyjściowej konwersji i od różnicy, którą chcesz wykryć. W przykładzie z tej strony 4 000 odwiedzin na wersję wystarczyło przy różnicy 1,25 pp i konwersji około 5 %, ale na styk. Różnica o połowę mniejsza wymaga mniej więcej czterokrotnie większej próby.
    Dlaczego przedział ufności i test mogą dać różne rozstrzygnięcia?
    W teście dwóch proporcji błąd standardowy liczy się z proporcji łącznej, bo tak wygląda świat przy hipotezie zerowej. Przedział dla różnicy liczy się z osobnych proporcji obu grup. Daleko od granicy istotności oba sposoby się zgadzają, a przy p bardzo bliskim α mogą się rozejść.
    Co oznacza h Cohena?
    To miara wielkości różnicy między dwiema proporcjami liczona z przekształcenia arcus sinus, niezależna od liczebności próby. Umowne progi to 0,2 dla efektu małego, 0,5 dla średniego i 0,8 dla dużego. Wynik poniżej 0,2 kalkulator opisuje jako efekt znikomy.
    Dlaczego przy jednej proporcji jest przedział Wilsona?
    Najprostszy przedział p̂ ± z × √(p̂(1 - p̂)/n) źle zachowuje się przy odsetkach bliskich 0 % albo 100 % i przy małych próbach, potrafi nawet wyjść poza zakres. Przedział Wilsona zawsze mieści się między 0 a 100 % i ma poziom ufności bliższy deklarowanemu.
    Skąd kalkulator bierze wartości krytyczne 1,645, 1,960 i 2,576?
    Liczy je z rozkładu normalnego standardowego, nie przepisuje z tablic. 1,645 to próg jednostronny dla α = 0,05, 1,960 dwustronny dla 0,05, a 2,576 dwustronny dla 0,01. Statystykę z gotowego raportu zamienisz na p także w kalkulatorze wartości p.

    Powiązane narzędzia

    Kalkulator Chi-kwadrat

    Test niezależności z tabeli krzyżowej i test zgodności z rozkładem, z resztami i V Craméra - Zobacz kalkulator

    Kalkulator Wielkości Próby

    Ile ankiet przy danym marginesie błędu i ile osób na grupę w teście A/B - Zobacz kalkulator

    Kalkulator Wartości p

    Wartość p i wartości krytyczne z gotowej statystyki z, t, chi-kwadrat albo F - Zobacz kalkulator

    Kalkulator Testu Fishera

    Dokładny test dla tablicy 2 × 2, gdy sukcesów w grupie jest za mało na test z - Zobacz kalkulator

    Kalkulator Testu t Jednopróbowego

    Średnia z próby wobec wartości odniesienia, gdy odchylenie liczysz z danych - Zobacz kalkulator

    Kalkulator Testu t Dwupróbowego

    Porównanie średnich dwóch grup testem Welcha, Studenta albo dla par - Zobacz kalkulator

    Kalkulator Z-score

    Wynik standaryzowany i percentyl pojedynczej wartości - Zobacz kalkulator

    Kalkulator Percentyla

    Percentyl i pozycja wartości w serii danych - Zobacz kalkulator

    Kalkulator zweryfikowany przez zespół LiczGrupa.pl

    Treść, wzory i wyniki zostały sprawdzone pod kątem poprawności i aktualności przez nasz zespół specjalistów.

    Natalia Skrzek

    Sprawdziła: Natalia Skrzek