O ile zmienia się Y, gdy X rośnie o jeden? Równanie prostej dopasowane metodą najmniejszych kwadratów, z istotnością nachylenia i prognozą z przedziałem.
Regresja liniowa: poziom ufności 90 procent
O ile zmienia się Y, gdy X rośnie o jeden? Równanie prostej dopasowane metodą najmniejszych kwadratów, z istotnością nachylenia i prognozą z przedziałem.
90 procent ma własne założenia i to one decydują o końcowej liczbie. Wyższy poziom ufności kupuje się szerokością przedziału, więc dziewięćdziesiąt dziewięć procent pewności oznacza mniej użyteczną prognozę. Ta strona otwiera kalkulator z wybraną już opcją 90 procent, więc wystarczy uzupełnić pozostałe pola. Pozostałe wartości podmień na swoje i przelicz, żeby zobaczyć różnicę.
Parametry
Wprowadź dane do obliczeń
💡 Wypełnij wszystkie wymagane pola, aby odblokować przycisk obliczania
Prosta z danych, zapisana jednym równaniem
Osiem odczytów temperatury i osiem dziennych wyników sprzedaży napojów wystarczy, żeby dostać równanie y = -31,86 + 10,71 · x. Każdy stopień więcej to średnio 10,71 sztuki więcej, prosta wyjaśnia 99,8 % zmienności sprzedaży, a przy 27 stopniach przewiduje 257,4 sztuki. Kalkulator bierze dwie serie sparowanych liczb, dopasowuje do nich prostą metodą najmniejszych kwadratów i podaje oba współczynniki z błędami, istotność nachylenia, prognozę dla wybranego X z dwoma rodzajami przedziałów oraz tabelę reszt, w której od razu widać punkty odstające.
Linia na oko i linia z rachunku
Najczęstszy sposób na trend bez kalkulatora to linijka przyłożona do pierwszego i ostatniego punktu na wykresie. Czasem wychodzi przyzwoicie. Ale nie wiadomo kiedy.
Prosta przez skrajne punkty
- zależy od dwóch obserwacji, a pozostałe nie mają żadnego wpływu,
- jeden nietypowy pomiar na końcu przestawia całą prostą,
- brak miary błędu, więc nie wiadomo, czy prognozie wolno ufać,
- nie da się sprawdzić, czy zależność nie jest przypadkowa.
Prosta z regresji
- każda para wpływa na wynik, a suma kwadratów błędów jest najmniejsza możliwa,
- błąd standardowy estymacji mówi, o ile typowo myli się prognoza,
- wartość p i przedział dla nachylenia rozstrzygają, czy trend w ogóle jest,
- przedział predykcji podaje realny rozrzut pojedynczej nowej obserwacji.
Regresja liniowa w kalkulatorze, od wklejenia danych do odczytu
- Seria X - zmienna objaśniająca, czyli ta, od której coś zależy albo którą znasz z góry: temperatura, numer miesiąca, przebieg, liczba godzin. Wartości rozdzielasz spacją, średnikiem albo nową linią, a ułamki możesz pisać z przecinkiem.
- Seria Y - zmienna objaśniana, w tej samej kolejności co X. Trzecia liczba w tym polu musi pochodzić z tej samej obserwacji co trzecia liczba w serii X, bo razem tworzą parę.
- Wartość X do prognozy - pole opcjonalne. Wpisz jedną liczbę, a dostaniesz przewidywane Y z przedziałem predykcji i przedziałem ufności. Najbezpieczniej wybierać X z zakresu danych.
- Poziom ufności - zwykle 95 %. Przy 99 % przedziały są szersze, przy 90 % węższe. Ten sam wybór wyznacza próg istotności nachylenia.
- Odczytaj wyniki - równanie, R², błąd standardowy estymacji, wartość p dla nachylenia, tabelę współczynników z przedziałami i tabelę reszt. Reszty zaznaczone na czerwono przekraczają dwa błędy standardowe i warto je sprawdzić w pierwszej kolejności.
Skąd biorą się a i b
Metoda najmniejszych kwadratów szuka prostej, dla której suma kwadratów pionowych odległości punktów od niej jest najmniejsza. Rozwiązanie ma postać zamkniętą:
a = ȳ - b · x̄
błąd estymacji s = √( Σ(y - ŷ)² / (n - 2) )
błąd nachylenia SE(b) = s / √Σ(x - x̄)²
Trzy zbiory rozpisane na wynikach kalkulatora:
O ile mniej się mylisz, licząc zamiast przykładać linijkę
Tabela porównuje sumę kwadratów błędów dwóch prostych na tych samych danych: poprowadzonej przez pierwszy i ostatni punkt oraz dopasowanej regresją. Czwarty zbiór to pierwszy zestaw z kwartetu Anscombe'a, klasyczny przykład z podręczników statystyki.
| Zbiór danych | Linia przez skrajne punkty | Regresja | Mniejszy błąd o |
|---|---|---|---|
| Temperatura i sprzedaż | 56,49 | 47,90 | 15,2 % |
| Użytkownicy w miesiącach | 140,00 | 124,76 | 10,9 % |
| Przebieg i cena auta | 26,96 | 7,87 | 70,8 % |
| Anscombe I | 15,98 | 13,76 | 13,9 % |
| Średnio w czterech zbiorach | - | - | 27,7 % |
Rozrzut jest duży, od 10,9 % do 70,8 %. Linijka radzi sobie nieźle, gdy skrajne punkty akurat leżą blisko trendu, i fatalnie, gdy oba leżą po tej samej jego stronie, jak w zbiorze aut, gdzie najtańsza i najdroższa oferta wypadają powyżej prostej z regresji. Uczciwie trzeba dodać jedno: regresja minimalizuje sumę kwadratów błędów, nie średni błąd bezwzględny. W zbiorze miesięcznym linia przez skrajne punkty myli się średnio o 3,00, a regresja o 3,16, bo kwadraty mocniej karzą jeden duży błąd niż kilka małych.
Różnica w samej prognozie bywa niewielka: dla 27 stopni linijka daje 257,65 wobec 257,4 z regresji, dla miesiąca 12 419,00 wobec 421,9, dla 100 tysięcy km 41,00 wobec 39,47. Zysk z rachunku nie polega tylko na innej liczbie. Linijka nie powie, o ile ta liczba może się mylić.
Wartości krytyczne t, z których liczą się przedziały
Przedział dla nachylenia i przedział predykcji to wynik plus minus wartość krytyczna rozkładu t Studenta razy odpowiedni błąd standardowy. Liczba stopni swobody w regresji z jedną zmienną wynosi n - 2. Kalkulator wyznacza wartość krytyczną dokładnie, tabela pokazuje, jak szybko maleje wraz z liczbą par.
| Stopnie swobody (n - 2) | 90 % | 95 % | 99 % |
|---|---|---|---|
| 1 (3 pary) | 6,314 | 12,706 | 63,657 |
| 2 | 2,920 | 4,303 | 9,925 |
| 4 | 2,132 | 2,776 | 4,604 |
| 6 | 1,943 | 2,447 | 3,707 |
| 8 | 1,860 | 2,306 | 3,355 |
| 10 | 1,812 | 2,228 | 3,169 |
| 20 | 1,725 | 2,086 | 2,845 |
| 30 | 1,697 | 2,042 | 2,750 |
| 60 | 1,671 | 2,000 | 2,660 |
| bardzo duża próba | 1,645 | 1,960 | 2,576 |
Przy trzech parach wartość krytyczna 95 % to 12,706, ponad sześć razy więcej niż 1,960 przy dużej próbie, a o tyle samo rośnie szerokość przedziału przy tym samym błędzie standardowym. Dlatego regresja policzona na kilku punktach prawie nigdy niczego nie rozstrzyga, nawet gdy prosta wygląda na wykresie przekonująco.
Zanim oprzesz decyzję na prostej
Powiązane narzędzia
Kalkulator Współczynnika Determinacji R²
Ocena dowolnej prognozy: R², skorygowane R², RMSE, MAE i pary, które najbardziej psują dopasowanie - Zobacz kalkulator
Kalkulator Z-score
Wynik standaryzowany dla wartości albo całej serii, z percentylem i wartościami z dla 90, 95 i 99 % - Zobacz kalkulator
Kalkulator Korelacji Pearsona
Siła i kierunek związku dwóch serii z wartością p i przedziałem ufności dla r - Zobacz kalkulator
Kalkulator Skośności
Asymetria rozkładu, przydatna przy ocenie, czy reszty są w miarę symetryczne - Zobacz kalkulator
Kalkulator Kurtozy
Grubość ogonów rozkładu, czyli skłonność do obserwacji odstających - Zobacz kalkulator
Kalkulator Współczynnika Zmienności
Rozrzut względem średniej, pozwala porównać zmienność serii w różnych jednostkach - Zobacz kalkulator
Kalkulator Rozstępu Międzykwartylowego
Kwartyle i granice wartości odstających w pojedynczej serii - Zobacz kalkulator
Kalkulator Funkcji Liniowej
Gdy współczynniki a i b są już znane: miejsce zerowe, wartości i wykres prostej - Zobacz kalkulator
Kalkulator Odchylenia Standardowego
Wariancja i odchylenie pojedynczej serii, czyli składniki wzoru na nachylenie - Zobacz kalkulator
Kalkulator zweryfikowany przez zespół LiczGrupa.pl
Treść, wzory i wyniki zostały sprawdzone pod kątem poprawności i aktualności przez nasz zespół specjalistów.

Sprawdziła: Natalia Skrzek