Regresja liniowa: poziom ufności 95 procent

    O ile zmienia się Y, gdy X rośnie o jeden? Równanie prostej dopasowane metodą najmniejszych kwadratów, z istotnością nachylenia i prognozą z przedziałem.

    95 procent ma własne założenia i to one decydują o końcowej liczbie. Wyższy poziom ufności kupuje się szerokością przedziału, więc dziewięćdziesiąt dziewięć procent pewności oznacza mniej użyteczną prognozę. Ta strona otwiera kalkulator z wybraną już opcją 95 procent, więc wystarczy uzupełnić pozostałe pola. Pozostałe wartości podmień na swoje i przelicz, żeby zobaczyć różnicę.

    Parametry

    Wprowadź dane do obliczeń

    To, od czego zależy wynik

    Wynik, w tej samej kolejności co X

    Zostaw puste, jeśli potrzebujesz samego równania

    Szerokość przedziałów i próg istotności

    Postęp wypełniania0 / 3 pól

    💡 Wypełnij wszystkie wymagane pola, aby odblokować przycisk obliczania

    Prosta z danych, zapisana jednym równaniem

    Osiem odczytów temperatury i osiem dziennych wyników sprzedaży napojów wystarczy, żeby dostać równanie y = -31,86 + 10,71 · x. Każdy stopień więcej to średnio 10,71 sztuki więcej, prosta wyjaśnia 99,8 % zmienności sprzedaży, a przy 27 stopniach przewiduje 257,4 sztuki. Kalkulator bierze dwie serie sparowanych liczb, dopasowuje do nich prostą metodą najmniejszych kwadratów i podaje oba współczynniki z błędami, istotność nachylenia, prognozę dla wybranego X z dwoma rodzajami przedziałów oraz tabelę reszt, w której od razu widać punkty odstające.

    Linia na oko i linia z rachunku

    Najczęstszy sposób na trend bez kalkulatora to linijka przyłożona do pierwszego i ostatniego punktu na wykresie. Czasem wychodzi przyzwoicie. Ale nie wiadomo kiedy.

    Prosta przez skrajne punkty

    • zależy od dwóch obserwacji, a pozostałe nie mają żadnego wpływu,
    • jeden nietypowy pomiar na końcu przestawia całą prostą,
    • brak miary błędu, więc nie wiadomo, czy prognozie wolno ufać,
    • nie da się sprawdzić, czy zależność nie jest przypadkowa.

    Prosta z regresji

    • każda para wpływa na wynik, a suma kwadratów błędów jest najmniejsza możliwa,
    • błąd standardowy estymacji mówi, o ile typowo myli się prognoza,
    • wartość p i przedział dla nachylenia rozstrzygają, czy trend w ogóle jest,
    • przedział predykcji podaje realny rozrzut pojedynczej nowej obserwacji.

    Regresja liniowa w kalkulatorze, od wklejenia danych do odczytu

    1. Seria X - zmienna objaśniająca, czyli ta, od której coś zależy albo którą znasz z góry: temperatura, numer miesiąca, przebieg, liczba godzin. Wartości rozdzielasz spacją, średnikiem albo nową linią, a ułamki możesz pisać z przecinkiem.
    2. Seria Y - zmienna objaśniana, w tej samej kolejności co X. Trzecia liczba w tym polu musi pochodzić z tej samej obserwacji co trzecia liczba w serii X, bo razem tworzą parę.
    3. Wartość X do prognozy - pole opcjonalne. Wpisz jedną liczbę, a dostaniesz przewidywane Y z przedziałem predykcji i przedziałem ufności. Najbezpieczniej wybierać X z zakresu danych.
    4. Poziom ufności - zwykle 95 %. Przy 99 % przedziały są szersze, przy 90 % węższe. Ten sam wybór wyznacza próg istotności nachylenia.
    5. Odczytaj wyniki - równanie, R², błąd standardowy estymacji, wartość p dla nachylenia, tabelę współczynników z przedziałami i tabelę reszt. Reszty zaznaczone na czerwono przekraczają dwa błędy standardowe i warto je sprawdzić w pierwszej kolejności.

    Skąd biorą się a i b

    Metoda najmniejszych kwadratów szuka prostej, dla której suma kwadratów pionowych odległości punktów od niej jest najmniejsza. Rozwiązanie ma postać zamkniętą:

    b = Σ(x - x̄)(y - ȳ) / Σ(x - x̄)²
    a = ȳ - b · x̄
    błąd estymacji s = √( Σ(y - ŷ)² / (n - 2) )
    błąd nachylenia SE(b) = s / √Σ(x - x̄)²

    Trzy zbiory rozpisane na wynikach kalkulatora:

    Temperatura i sprzedaż napojów, 8 dni. X: 14 17 19 22 24 26 29 31, Y: 120 150 170 205 220 250 280 300. Wynik: y = -31,86 + 10,71 · x, R² 0,998, błąd estymacji 2,825 sztuki. Prognoza dla 27 stopni: 257,4, przedział predykcji 95 % od 249,8 do 265,0.
    Przebieg i cena używanego auta, 8 ofert. X w tysiącach kilometrów: 20 45 60 80 110 130 150 180, Y w tysiącach złotych: 58 51 47 43 36 33 29 24. Wynik: y = 60,47 - 0,2100 · x, czyli każde 10 000 km obniża cenę średnio o 2,1 tysiąca złotych. Przy 100 tysiącach km prosta daje 39,47 tysiąca.
    Liczba użytkowników w kolejnych miesiącach. X: 1 do 10, Y: 210 228 251 262 290 301 330 342 368 381. Wynik: y = 190,0 + 19,33 · x, czyli średnio 19,33 użytkownika więcej co miesiąc. Prognoza dla miesiąca 12: 421,9, ale kalkulator ostrzega, że to ekstrapolacja, bo dane kończą się na miesiącu 10.

    O ile mniej się mylisz, licząc zamiast przykładać linijkę

    Tabela porównuje sumę kwadratów błędów dwóch prostych na tych samych danych: poprowadzonej przez pierwszy i ostatni punkt oraz dopasowanej regresją. Czwarty zbiór to pierwszy zestaw z kwartetu Anscombe'a, klasyczny przykład z podręczników statystyki.

    Zbiór danych Linia przez skrajne punkty Regresja Mniejszy błąd o
    Temperatura i sprzedaż56,4947,9015,2 %
    Użytkownicy w miesiącach140,00124,7610,9 %
    Przebieg i cena auta26,967,8770,8 %
    Anscombe I15,9813,7613,9 %
    Średnio w czterech zbiorach--27,7 %

    Rozrzut jest duży, od 10,9 % do 70,8 %. Linijka radzi sobie nieźle, gdy skrajne punkty akurat leżą blisko trendu, i fatalnie, gdy oba leżą po tej samej jego stronie, jak w zbiorze aut, gdzie najtańsza i najdroższa oferta wypadają powyżej prostej z regresji. Uczciwie trzeba dodać jedno: regresja minimalizuje sumę kwadratów błędów, nie średni błąd bezwzględny. W zbiorze miesięcznym linia przez skrajne punkty myli się średnio o 3,00, a regresja o 3,16, bo kwadraty mocniej karzą jeden duży błąd niż kilka małych.

    Różnica w samej prognozie bywa niewielka: dla 27 stopni linijka daje 257,65 wobec 257,4 z regresji, dla miesiąca 12 419,00 wobec 421,9, dla 100 tysięcy km 41,00 wobec 39,47. Zysk z rachunku nie polega tylko na innej liczbie. Linijka nie powie, o ile ta liczba może się mylić.

    Wartości krytyczne t, z których liczą się przedziały

    Przedział dla nachylenia i przedział predykcji to wynik plus minus wartość krytyczna rozkładu t Studenta razy odpowiedni błąd standardowy. Liczba stopni swobody w regresji z jedną zmienną wynosi n - 2. Kalkulator wyznacza wartość krytyczną dokładnie, tabela pokazuje, jak szybko maleje wraz z liczbą par.

    Stopnie swobody (n - 2) 90 % 95 % 99 %
    1 (3 pary)6,31412,70663,657
    22,9204,3039,925
    42,1322,7764,604
    61,9432,4473,707
    81,8602,3063,355
    101,8122,2283,169
    201,7252,0862,845
    301,6972,0422,750
    601,6712,0002,660
    bardzo duża próba1,6451,9602,576

    Przy trzech parach wartość krytyczna 95 % to 12,706, ponad sześć razy więcej niż 1,960 przy dużej próbie, a o tyle samo rośnie szerokość przedziału przy tym samym błędzie standardowym. Dlatego regresja policzona na kilku punktach prawie nigdy niczego nie rozstrzyga, nawet gdy prosta wygląda na wykresie przekonująco.

    Zanim oprzesz decyzję na prostej

    Czym regresja liniowa różni się od korelacji?
    Korelacja odpowiada na pytanie, jak silny jest związek, i jest symetryczna: zamiana X z Y nie zmienia wyniku. Regresja podaje równanie, czyli o ile zmienia się Y przy zmianie X, i pozwala prognozować. W regresji z jedną zmienną R² równa się kwadratowi współczynnika Pearsona, więc r = 0,8 to R² = 0,64. Samą siłę i istotność związku lepiej sprawdzić w kalkulatorze korelacji Pearsona, który podaje też przedział ufności dla r.
    Czy R² 0,67 wystarczy, żeby ufać prostej?
    Sama liczba tego nie rozstrzyga. Cztery zbiory kwartetu Anscombe'a mają niemal identyczne równanie, od y = 3,000 + 0,5001 · x do y = 3,002 + 0,4997 · x, i R² 0,666 albo 0,667, a mimo to tylko pierwszy nadaje się do prostej. Drugi jest krzywoliniowy, w trzecim jeden punkt ma resztę 3,241 i kalkulator zaznacza go na czerwono, a w czwartym nachylenie wyznacza jedna obserwacja z X równym 19. Zawsze przejrzyj tabelę reszt.
    Przedział predykcji czy przedział ufności, który podać?
    Zależy od pytania. Przedział ufności dotyczy średniego Y przy danym X, przedział predykcji pojedynczej nowej obserwacji, więc zawsze jest szerszy. W zbiorze temperatur dla 27 stopni pierwszy sięga od 254,3 do 260,5, drugi od 249,8 do 265,0. Jeśli planujesz zapas na jeden konkretny dzień, liczy się przedział predykcji.
    Czy można prognozować poza zakresem danych?
    Rachunek się wykona, ale jego wiarygodność spada z każdym krokiem od danych. Dla serii miesięcznej kalkulator poda 421,9 użytkownika w miesiącu 12 i doda ostrzeżenie, bo nic nie gwarantuje, że wzrost po miesiącu 10 dalej będzie liniowy. Przedziały nie obejmują tego ryzyka, opisują wyłącznie rozrzut wokół prostej.
    Co znaczy, że nachylenie nie jest istotne?
    Że dane nie odróżniają trendu od przypadku. Sześć par godzin nauki i wyników testu (X: 2 4 5 7 8 10, Y: 61 55 70 58 72 64) daje nachylenie 0,8095, ale wartość p wynosi 0,4950, R² tylko 0,123, a przedział dla nachylenia sięga od -2,188 do 3,807, czyli obejmuje zero. Prosta nie przewiduje tu lepiej niż sama średnia wyników.
    Ile par potrzeba do sensownej regresji?
    Technicznie wystarczą 3, bo przez dwa punkty zawsze przechodzi prosta i nie ma z czym porównać błędu. Poniżej 10 par kalkulator dopisuje ostrzeżenie, a tabela wartości krytycznych wyżej pokazuje dlaczego: przy małej próbie przedziały są bardzo szerokie. Liczba par nie zastąpi jednak rozpiętości X. Dziesięć pomiarów przy prawie tej samej temperaturze powie o trendzie mniej niż pięć rozłożonych szeroko.

    Powiązane narzędzia

    Kalkulator Współczynnika Determinacji R²

    Ocena dowolnej prognozy: R², skorygowane R², RMSE, MAE i pary, które najbardziej psują dopasowanie - Zobacz kalkulator

    Kalkulator Z-score

    Wynik standaryzowany dla wartości albo całej serii, z percentylem i wartościami z dla 90, 95 i 99 % - Zobacz kalkulator

    Kalkulator Korelacji Pearsona

    Siła i kierunek związku dwóch serii z wartością p i przedziałem ufności dla r - Zobacz kalkulator

    Kalkulator Skośności

    Asymetria rozkładu, przydatna przy ocenie, czy reszty są w miarę symetryczne - Zobacz kalkulator

    Kalkulator Kurtozy

    Grubość ogonów rozkładu, czyli skłonność do obserwacji odstających - Zobacz kalkulator

    Kalkulator Współczynnika Zmienności

    Rozrzut względem średniej, pozwala porównać zmienność serii w różnych jednostkach - Zobacz kalkulator

    Kalkulator Rozstępu Międzykwartylowego

    Kwartyle i granice wartości odstających w pojedynczej serii - Zobacz kalkulator

    Kalkulator Funkcji Liniowej

    Gdy współczynniki a i b są już znane: miejsce zerowe, wartości i wykres prostej - Zobacz kalkulator

    Kalkulator Odchylenia Standardowego

    Wariancja i odchylenie pojedynczej serii, czyli składniki wzoru na nachylenie - Zobacz kalkulator

    Kalkulator zweryfikowany przez zespół LiczGrupa.pl

    Treść, wzory i wyniki zostały sprawdzone pod kątem poprawności i aktualności przez nasz zespół specjalistów.

    Natalia Skrzek

    Sprawdziła: Natalia Skrzek