Przedział ufności i błąd standardowy: ile daje większa próba
Przedział ufności i błąd standardowy na liczbach: 36 ankiet daje ±4,06 min, 144 ankiety ±1,98. Do tego kwartyle z szeregu rozdzielczego.

Cztery razy więcej ankiet, cztery razy dokładniejszy wynik. Brzmi rozsądnie, prawda? I jest nieprawdą.
Czterokrotnie większa próba zawęża przedział ufności tylko o połowę. Przy średnim czasie dojazdu do pracy 34 minuty i odchyleniu standardowym 12 minut ankieta wśród 36 osób daje przedział ufności 95 % od 29,94 do 38,06 minuty, czyli ±4,06. Ta sama średnia z 144 ankiet daje od 32,02 do 35,98, czyli ±1,98. Cztery razy więcej pracy, dwa razy węższy przedział. Żeby zejść do czterokrotnie węższego, trzeba by przepytać 576 osób.
Za tą różnicą stoi jedna wielkość, o której zwykle mówi się mimochodem: błąd standardowy. Ten tekst pokazuje, jak z niego powstaje przedział ufności, dlaczego pierwiastek z liczebności rządzi całą sprawą i co zrobić, gdy zamiast surowych danych masz tylko tabelkę z przedziałami.
Ile naprawdę daje czterokrotnie większa próba?
Błąd standardowy średniej liczy się jednym ilorazem: odchylenie standardowe próby dzielone przez pierwiastek z liczby obserwacji. Przy s = 12 i n = 36 to 12 / 6 = 2,00 minuty. I tu siedzi cały haczyk. Liczebność stoi pod pierwiastkiem, więc żeby błąd spadł o połowę, pierwiastek musi urosnąć dwukrotnie, a sama liczebność czterokrotnie.
Kalkulator błędu standardowego pokazuje to od razu w tabeli. Z tych samych danych:
| Liczba ankiet | Ile razy więcej | Błąd standardowy | Spadek błędu |
|---|---|---|---|
| 36 | punkt wyjścia | 2,00 min | - |
| 72 | 2 | 1,41 min | 29 % |
| 144 | 4 | 1,00 min | 50 % |
| 324 | 9 | 0,67 min | 67 % |
| 576 | 16 | 0,50 min | 75 % |
Warto popatrzeć na ostatnią kolumnę. Pierwsze podwojenie próby zbija błąd o 29 %, kolejne już tylko o następne 21 punktów. Z każdą kolejną ankietą zysk maleje. Stąd bierze się rachunek, który zna każdy, kto planował badanie: od pewnego momentu dokładanie respondentów kosztuje coraz więcej, a przedział prawie się nie zwęża.
Kalkulator ma też pole „docelowy błąd standardowy”. Wpisz tam 1, a odpowie, że potrzeba 144 obserwacji, czyli o 108 więcej niż teraz. To dokładnie ten rachunek, który warto zrobić przed rozesłaniem ankiety, a nie po nim.
Błąd standardowy a odchylenie standardowe: dwie liczby, które łatwo pomylić
Odchylenie standardowe 12 minut mówi o ludziach. Jedni dojeżdżają kwadrans, inni godzinę, a typowa odległość od średniej to mniej więcej 12 minut. Ta liczba nie zmieni się, choćby przepytać całe miasto, bo rozrzut dojazdów jest cechą populacji, a nie ankiety.
Błąd standardowy 2,00 minuty mówi o średniej. Gdyby powtórzyć ankietę na innych 36 losowo wybranych osobach, wyszłaby trochę inna średnia, może 32, może 36. Błąd standardowy opisuje typową skalę tych wahań. I to on maleje wraz z liczebnością.
Pomyłka między tymi dwiema liczbami zdarza się w pracach dyplomowych często, zwłaszcza na wykresach słupkowych z „wąsami”. Słupki z wąsami ±SE wyglądają na bardzo precyzyjne, słupki ±SD na bardzo rozstrzelone, a opisują dokładnie te same dane. Podpis pod wykresem powinien zawsze mówić, która z nich została narysowana.
Jest jeszcze drugi sposób na mniejszy błąd, o którym rzadziej się pamięta: mniejszy rozrzut. Przy odchyleniu 6 minut zamiast 12 już 36 ankiet daje błąd 1,00, tyle samo co 144 ankiety przy odchyleniu 12. W praktyce chodzi o jednorodną grupę, na przykład pracowników jednego biura zamiast mieszkańców całego powiatu. Tyle że wtedy wynik mówi też tylko o tej węższej grupie.
Skąd bierze się ±4,06 minuty w przedziale ufności?
Przedział ufności to średnia plus minus błąd standardowy pomnożony przez odpowiedni mnożnik. Przy małych próbach tym mnożnikiem jest wartość z rozkładu t-Studenta, a nie znane z podręczników 1,96.
Dla 36 obserwacji jest 35 stopni swobody, a mnożnik t dla 95 % wynosi 2,0301. Rachunek: 2,0301 × 2,00 = 4,06. Stąd przedział od 34 - 4,06 = 29,94 do 34 + 4,06 = 38,06 minuty.
Co ten przedział mówi, a czego nie? Mówi o średnim czasie dojazdu w całej populacji, z której losowano ankietowanych: metoda, która go wyznacza, trafia w prawdziwą średnią w 95 na 100 powtórzeń badania. Nie mówi, że 95 % ludzi dojeżdża między 30 a 38 minut. Pojedyncze dojazdy rozrzucają się dużo szerzej, bo odchylenie to 12 minut. To drugi, obok pomylenia SD z SE, najczęstszy błąd w interpretacji.
Poziom ufności to kolejna dźwignia, i też działa inaczej, niż się wydaje:
| Poziom ufności | Mnożnik t (df = 35) | Przedział | Połowa szerokości |
|---|---|---|---|
| 90 % | 1,690 | 30,62-37,38 | ±3,38 |
| 95 % | 2,030 | 29,94-38,06 | ±4,06 |
| 99 % | 2,724 | 28,55-39,45 | ±5,45 |
Przejście z 95 % na 99 % poszerza przedział o 34 %, z ±4,06 do ±5,45. Pewność kosztuje szerokość. Nie da się mieć jednocześnie wąskiego przedziału i wysokiej ufności bez dokładania obserwacji.
Pięć wersji tej samej ankiety, pięć różnych przedziałów
Średnia za każdym razem wynosi 34 minuty, poziom ufności 95 %. Zmienia się tylko liczba ankiet albo rozrzut odpowiedzi. Wszystkie wiersze policzone w kalkulatorze przedziału ufności.
| Wariant | Błąd standardowy | Mnożnik t | Przedział 95 % | ± |
|---|---|---|---|---|
| 9 ankiet, s = 12 | 4,00 | 2,306 | 24,78-43,22 | 9,22 |
| 36 ankiet, s = 12 | 2,00 | 2,030 | 29,94-38,06 | 4,06 |
| 36 ankiet, s = 6 | 1,00 | 2,030 | 31,97-36,03 | 2,03 |
| 144 ankiety, s = 12 | 1,00 | 1,977 | 32,02-35,98 | 1,98 |
| 576 ankiet, s = 12 | 0,50 | 1,964 | 33,02-34,98 | 0,98 |
Najciekawsze są dwie rzeczy, których w samym wzorze na pierwszy rzut oka nie widać.
Pierwsza to wiersz z 9 ankietami. Liczebność jest cztery razy mniejsza niż w wariancie bazowym, więc błąd standardowy rośnie dwukrotnie, do 4,00. A przedział rośnie więcej niż dwukrotnie, z ±4,06 do ±9,22. Dlaczego? Bo przy 8 stopniach swobody mnożnik t wynosi już 2,306, a nie 2,030. Mała próba płaci podwójnie: większym błędem i grubszymi ogonami rozkładu t.
Druga to wiersze trzeci i czwarty. Przedziały ±2,03 i ±1,98 są prawie identyczne, a za pierwszym stoi 36 ankiet, za drugim 144. Różnica pięciu setnych minuty to znowu mnożnik t: przy 143 stopniach swobody jest odrobinę mniejszy. Wniosek praktyczny? Jednorodna grupa bywa tańsza niż czterokrotnie większa próba, pod warunkiem że wnioski dotyczą tylko tej grupy.
A co z odsetkiem zamiast średniej? W tabeli z szeregu, o której za chwilę, 18 ze 100 osób dojeżdża dłużej niż 45 minut. Kalkulator przedziału ufności w trybie proporcji podaje metodą Wilsona przedział od 11,7 % do 26,7 %. Błąd standardowy proporcji to 3,84 punktu procentowego, a żeby go zmniejszyć o połowę, znowu potrzeba czterokrotnie większej próby: 400 osób. Zasada pierwiastka działa tak samo dla średnich i dla odsetków.
Gdy zamiast surowych liczb masz tylko tabelkę z przedziałami
Dane o dojazdach bardzo często przychodzą już pogrupowane: raport GUS, ankieta firmowa albo wyniki z formularza, w którym ktoś zaznaczał „15-30 minut”, a nie konkretną liczbę. Wtedy mediany i kwartyli nie da się odczytać wprost, trzeba je oszacować przez interpolację w klasie.
Tabela ze stu odpowiedzi wygląda tak: 0-15 minut: 14 osób, 15-30: 41, 30-45: 27, 45-60: 12, 60-90: 6.
Kalkulator kwartyli z szeregu rozdzielczego szuka klasy, w której liczebność skumulowana przekracza pozycję kwartyla, i interpoluje w jej środku. Dla mediany pozycja to 50. Do końca pierwszej klasy jest 14 obserwacji, do końca drugiej 55, więc mediana leży w klasie 15-30:
Q2 = 15 + (50 - 14) / 41 × 15 = 28,2 minuty.
Tak samo wychodzi Q1 = 19,0 i Q3 = 41,1, a rozstęp międzykwartylowy 22,1 minuty. Połowa ankietowanych dojeżdża więc od około 19 do 41 minut.
Teraz porównanie, które mówi o tych danych więcej niż sam kwartyl. Średnia z tej samej tabeli, liczona ze środków klas, wynosi 31,2 minuty. Mediana: 28,2. Średnia jest o 3 minuty wyżej, bo kilka bardzo długich dojazdów w klasie 60-90 minut ciągnie ją w górę, a medianę nie rusza. Przy takim rozkładzie mediana lepiej opisuje typowy dojazd niż średnia.
Kalkulator dorzuca jeszcze dwie uwagi, obie trafne. Klasy mają różną szerokość (ostatnia obejmuje 30 minut, pozostałe po 15), więc pasek w tabeli, który pokazuje same liczebności, trochę przekłamuje obraz. I druga: to oszacowanie, bo w obrębie klasy zakłada się równomierny rozkład. Przy zapisie pozycji z poprawką, k(N+1)/4, wychodzi 19,1 / 28,4 / 41,5, czyli różnica rzędu kilku dziesiątych minuty. Obie konwencje są w podręcznikach, trzeba tylko podać, której się użyło.
Ile ankiet zaplanować, zanim się je rozda?
Wszystko wyżej to rachunek po fakcie: ankiety zebrane, liczymy, jak szeroki wyszedł przedział. Rozsądniej jest odwrócić kolejność. Najpierw decyzja, z jaką dokładnością chcemy znać średnią, potem liczba ankiet.
Wzór jest ten sam, tylko przekształcony: n = (z × σ / e)², gdzie e to dopuszczalny margines błędu. Przy odchyleniu 12 minut i marginesie ±2 minuty wychodzi (1,96 × 12 / 2)² = 138,29, czyli po zaokrągleniu w górę 139 ankiet. Tyle podaje kalkulator wielkości próby. To prawie dokładnie wariant ze 144 ankietami z tabeli wyżej, który dał ±1,98.
| Margines błędu średniej | Ufność 90 % | Ufność 95 % | Ufność 99 % |
|---|---|---|---|
| ±4 min | 25 | 35 | 60 |
| ±2 min | 98 | 139 | 239 |
| ±1 min | 390 | 554 | 956 |
Ta tabela mówi to samo co wszystkie poprzednie, tylko z drugiej strony. Margines o połowę mniejszy, liczba ankiet cztery razy większa: 35, 139, 554. A przejście z 95 % na 99 % ufności to kolejne mniej więcej 72 % ankiet więcej przy każdym marginesie.
Przy odsetkach działa to podobnie, ale jest jeden haczyk. Jeśli spodziewamy się, że około 18 % osób dojeżdża dłużej niż 45 minut, i chcemy znać ten odsetek z dokładnością ±5 punktów procentowych, wystarczy 227 ankiet. Kto nie ma żadnego przypuszczenia, bierze najgorszy przypadek, czyli 50 %, i wtedy potrzeba 385. Lepiej mieć choćby zgrubny wynik z pilotażu, bo różnica to ponad półtorej setki ankiet do zebrania.
I rzecz, której żaden kalkulator liczebności nie dopowie sam: to liczba ankiet wypełnionych. Jeśli wraca co trzecia rozesłana, do 139 wypełnionych trzeba ich rozdać ponad 400.
Odpowiedź z tytułu, tym razem w liczbach
Czterokrotnie większa próba daje dwukrotnie węższy przedział ufności, nie czterokrotnie. Z 36 ankiet: ±4,06 minuty. Ze 144: ±1,98. Z 576: ±0,98.
Z tego wynikają trzy praktyczne rzeczy. Liczbę obserwacji warto policzyć przed badaniem, z docelowego błędu standardowego, a nie dokładać ankiet w ciemno. Przy małych próbach trzeba doliczyć karę za rozkład t, która przy 9 obserwacjach robi z ±8 prawie ±9,2. A gdy dane są pogrupowane w przedziały, mediana i kwartyle wciąż dają się policzyć, tylko trzeba napisać, że to oszacowanie z szeregu rozdzielczego.
No i jedno zastrzeżenie na koniec, którego żaden wzór nie załatwi. Przedział ufności opisuje niepewność wynikającą z losowania próby. Jeśli ankietę wypełnili tylko ci, którzy dojeżdżają rowerem, bo formularz wisiał przy stojaku, żaden pierwiastek z n tego nie naprawi.
Narzędzia omawiane w tym artykule
Kalkulator Błędu Standardowego Średniej
Liczy błąd standardowy średniej z serii pomiarów albo z odchylenia i liczebności, a także błąd standardowy proporcji, z tabelą spadku błędu i liczebnością potrzebną do zadanej precyzji.Kalkulator Przedziału Ufności
Wyznacza przedział ufności 90, 95 lub 99 % dla średniej z serii albo z gotowych statystyk (rozkład t) oraz dla proporcji metodą Wilsona obok Walda.Kalkulator Kwartyli z Szeregu Rozdzielczego
Szacuje Q1, medianę i Q3 z danych pogrupowanych w przedziały klasowe, z liczebnościami skumulowanymi, rachunkiem krok po kroku i wyborem konwencji kN/4 lub k(N+1)/4.Więcej narzędzi z kategorii Statystyka
Kalkulator Wielkości Próby · Kalkulator Testu t Jednopróbowego · Kalkulator Testu t Dwupróbowego · Kalkulator Wartości p · Kalkulator Testu z · Kalkulator Chi-kwadrat · Kalkulator Z-score · Kalkulator Rozstępu Międzykwartylowego · Kalkulator Percentyla · Kalkulator Mody i Dominanty · Kalkulator Współczynnika Zmienności · Kalkulator Skośności Rozkładu · Kalkulator Kurtozy · Kalkulator Korelacji Pearsona · Kalkulator Regresji Liniowej · Kalkulator Współczynnika Determinacji R² · Kalkulator Testu Fishera · Kalkulator Testu Wilcoxona
