Alphadi Tab - Przegląd narzędzia

Analiza regresji

Analiza regresji jest używana do graficznego i obliczeniowego opisu związku między dwiema zmiennymi ilościami. Odpowiada na pytanie, czy, w jakim kierunku i z jakim modelem zmienną zależną można opisać za pomocą zmiennej niezależnej.

Każdy punkt na diagramie reprezentuje parę wartości z zmiennej niezależnej (x) i zmiennej zależnej (y). Dodatkowo obliczany jest model regresji, który matematycznie opisuje przebieg danych.

Analiza regresji jest szczególnie przydatna do:

  • badania czynników wpływających na zmienną zależną
  • ciągłych pomiarów (np. czas, temperatura, ilość, lepkość)
  • opisu i oceny związku za pomocą modelu regresji

W dziale rozwoju nowych sosów pomidorowych badane jest, jak czas gotowania wpływa na lepkość produktu. W tym celu w kilku seriach testowych produkowane są sosy pomidorowe o różnych czasach gotowania. Dla każdej serii testowej mierzony i rejestrowany jest czas gotowania oraz wynikająca z niego lepkość jako para wartości. Analiza regresji jest używana do zbadania, który model opisuje związek między czasem gotowania a lepkością w danych pomiarowych.

Podstawowy związek jest znany zawodowo: Dłuższe gotowanie odparowuje wodę, co zazwyczaj skutkuje wyższą lepkością sosu pomidorowego.

 

Download Możesz pobrać dane tutaj: TomatoSauce_CookingTimeViscosity.xlsx

 

 

Interpretacja wyników:

Wykres rozrzutu pokazuje wyraźny pozytywny związek między czasem gotowania a lepkością. W miarę wydłużania się czasu gotowania, lepkość sosu pomidorowego wzrasta. Równanie regresji opisuje ten związek za pomocą modelu liniowego. Model pokazuje, o ile średnio wzrasta lepkość, gdy czas gotowania się wydłuża.

Podsumowanie modelu pokazuje wysoką wartość R-kwadrat. Zatem model wyjaśnia dużą część zmienności lepkości. Skorygowana wartość R-kwadrat jest również bliska wartości R-kwadrat, co czyni model liniowy wiarygodnym dla tego przykładu. Analiza wariancji pokazuje małą wartość p. Sugeruje to, że związek między czasem gotowania a lepkością jest statystycznie istotny.

Wykresy resztowe wydają się ogólnie nieznaczące. Na wykresie reszt vs. dopasowanie punkty rozpraszają się głównie losowo wokół 0. Wykres prawdopodobieństwa i histogram nie pokazują silnych odchyleń od przybliżonego rozkładu normalnego. W szeregach czasowych reszt nie jest widoczny wyraźny trend.

Ogólnie rzecz biorąc, model regresji liniowej dobrze opisuje związek między czasem gotowania a lepkością w tym przykładzie.

 

Objaśnienia wyników:

Wynik analizy regresji składa się z wykresu rozrzutu z linią regresji, równania regresji, podsumowania modelu, analizy wariancji oraz opcjonalnie wykresów resztowych.

Wykres rozrzutu pokazuje zmierzone wartości jako punkty. Linia regresji opisuje obliczony związek między zmienną niezależną x a zmienną zależną y.

Równanie regresji opisuje ten związek matematycznie. Może być używane do oszacowania zmiennej zależnej w rozważanym zakresie danych.

Podsumowanie modelu pokazuje metryki jakości modelu. S opisuje typowe odchylenie zmierzonych wartości od linii regresji. R-kwadrat pokazuje, jaki procent zmienności jest wyjaśniany przez model. R-kwadrat (adj.) to skorygowana wartość R-kwadrat i uwzględnia liczbę terminów modelu.

Analiza wariancji pokazuje, jak zmienność danych jest rozdzielona na regresję, błąd i całkowitą zmienność. Wartość p pomaga ocenić, czy związek jest statystycznie wykrywalny.

Wykresy resztowe pokazują odchylenia między zmierzonymi wartościami a wartościami modelowymi. Reszty powinny rozpraszać się jak najbardziej losowo wokół 0. Zauważalne wzorce mogą wskazywać, że model nie w pełni opisuje wszystkie związki.

Wykres prawdopodobieństwa reszt
Wykres prawdopodobieństwa pokazuje, czy reszty są w przybliżeniu rozkładem normalnym.
  • Punkty powinny leżeć w przybliżeniu na prostej linii.
  • Silne krzywizny lub wzorce w kształcie litery S przemawiają przeciwko rozkładowi normalnemu.
  • Pojedyncze odległe punkty mogą wskazywać na wartości odstające.
Dlaczego to jest ważne?
Przybliżony rozkład normalny reszt jest ważny przy interpretacji metryk, takich jak wartości p lub przedziały ufności.
Reszt vs. Dopasowanie
Ten wykres pokazuje reszty w odniesieniu do obliczonych wartości modelu.
  • Punkty powinny rozpraszać się losowo wokół linii zerowej.
  • Krzywa sugeruje, że model liniowy nie opisuje odpowiednio krzywizny.
  • Kształt lejka sugeruje, że zmienność nie jest stała.
  • Pojedyncze odległe punkty mogą być wartościami odstającymi.
Dlaczego to jest ważne?
Wykres pokazuje, czy model pasuje równie dobrze w całym zakresie wartości.
Histogram reszt
Histogram pokazuje rozkład reszt.
  • Rozkład powinien być w przybliżeniu symetryczny wokół 0.
  • Silnie skośny rozkład może wskazywać na wartości odstające lub nieodpowiedni model.
  • Wiele szczytów może wskazywać, że różne grupy lub stany procesu zostały zmieszane.
Dlaczego to jest ważne?
Histogram uzupełnia wykres prawdopodobieństwa i pomaga wizualnie ocenić rozkład odchyleń.
Szereg czasowy reszt
Szereg czasowy reszt pokazuje reszty w kolejności punktów danych.
  • Punkty powinny losowo oscylować wokół 0.
  • Rosnący lub malejący trend wskazuje na zmianę czasową.
  • Powtarzające się wzorce mogą wskazywać na cykle, partie lub zmiany procesu.
  • Długie sekwencje tylko pozytywnych lub tylko negatywnych reszt pokazują, że model systematycznie przeszacowuje lub niedoszacowuje pewne obszary.
Dlaczego to jest ważne?
Wykres pokazuje, czy kolejność pomiarów ma znaczenie. Jest to szczególnie ważne dla danych procesowych lub czasowych.

W analizie regresji możesz wybrać różne modele i wyniki:

Wybór w narzędziu Typ modelu Ogólne równanie
Liniowy Wielomian stopnia 1 y = a₀ + a₁x
Kwadratowy Wielomian stopnia 2 y = a₀ + a₁x + a₂x²
Sześcienny Wielomian stopnia 3 y = a₀ + a₁x + a₂x² + a₃x³
Wielomian stopnia 4 Wielomian stopnia 4 y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴
Wielomian stopnia 5 Wielomian stopnia 5 y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ + a₅x⁵
Wielomian stopnia 6 Wielomian stopnia 6 y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ + a₅x⁵ + a₆x⁶

Obowiązuje następujące:

  • y = zmienna docelowa
  • x = zmienna wpływająca
  • a₀ = punkt przecięcia
  • a₁ do a₆ = współczynniki modelu

Przygotowanie

  1. Zdefiniuj zmienną docelową (y) (np. lepkość sosu pomidorowego)
  2. Zdefiniuj zmienną wpływającą (x) (np. czas gotowania)
  3. Upewnij się, że obie zmienne są ilościowymi pomiarami
  4. Zbierz dane

AlphadiTab Użyj w AlphadiTab

  1. Wybierz narzędzie Analiza regresji w Fazie pomiaru
  2. Wybierz kolumnę czasu gotowania dla Danych X
  3. Wybierz kolumnę lepkości dla Danych Y
  4. Wybierz pożądany model dla Regresji, np. liniowy lub wielomianowy stopnia 2
  5. Opcjonalnie: Wyświetl wykresy reszt
  6. Potwierdź za pomocą Aktualizuj

Interpretacja

  1. Sprawdź, czy widoczny jest związek między osiami x i y
  2. Oceń, czy model regresji sensownie opisuje trend
  3. Oceń metryki modelu, takie jak S, R-kwadrat i R-kwadrat (adj)
  4. Zbadaj reszty, aby zidentyfikować anomalie lub systematyczne wzorce

Ogólne rozważania

  1. Czy punkty są uporządkowane czy rozmieszczone losowo?
  2. Czy można rozpoznać trend punktów?
  3. Czy wybrany model regresji pasuje do trendu?
  4. Czy relacja jest pozytywna czy negatywna?
  5. Jeśli trend jest zakrzywiony: Czy wyższy stopień wielomianu ma sens techniczny?
  6. Czy rozproszenie punktów wokół modelu jest małe czy duże?

Uwaga: Dobry model regresji niekoniecznie oznacza, że jedna zmienna jest przyczyną drugiej.

Zmienne ilościowe
Dane muszą być dostępne jako zmienne ilościowe, co oznacza, że mogą być liczone lub mierzone.
Dlaczego to jest ważne?
Analiza regresji oblicza odchylenia i składowe wariancji. Do tego potrzebne są wartości liczbowe.
Wystarczająco różne wartości x
Dla wybranego modelu regresji musi być dostępnych wystarczająco wiele różnych wartości x.
Dlaczego to jest ważne?
  • Im wyższy stopień wielomianu, tym więcej różnych wartości x jest potrzebnych do dostosowania modelu.
  • Przy zbyt małej liczbie różnych wartości x model regresji nie może być wiarygodnie obliczony ani interpretowany.
Kiedy rozważana jest tylko jedna zmienna i nie ma potrzeby modelowania relacji
Histogram lub wykres pudełkowy
Kiedy badany jest wpływ czynnika nominalnego
Test hipotezy
Kiedy skupiamy się na rozwoju czasowym
Wykres szeregów czasowych
Kiedy relacja ma być początkowo sprawdzona wizualnie
Diagram korelacji lub wykres punktowy

W rozwoju nowego komponentu badane jest, jak czas chłodzenia po obróbce cieplnej wpływa na twardość materiału. Podejrzewa się, że dłuższy czas chłodzenia prowadzi do niższej twardości materiału.

 

Download Możesz pobrać dane tutaj: MaterialHardnessCoolingTime.xlsx

Interpretacja

Analiza regresji pokazuje negatywną korelację: W miarę wydłużania się czasu chłodzenia, twardość materiału maleje. Jednakże, wykresy reszt powinny być krytycznie zbadane. Na wykresie Reszty vs. Dopasowanie, reszty nie są równomiernie losowo rozłożone, ale pokazują powtarzający się wzór. Szereg czasowy reszt również wydaje się regularny, a nie losowy. To wyraźnie pokazuje, że choć dane wykazują wyraźny trend, reszty nie wydają się być losowymi odchyleniami pomiarowymi. Model opisuje korelację, ale nie powinien być interpretowany jako idealny przykład dla niepozornych reszt.

W produkcji cecha jakościowa jest mierzona w linii, np. ilość napełnienia. W zapewnieniu jakości ta sama cecha jest sprawdzana ponownie za pomocą oddzielnego przyrządu pomiarowego. Aby zbadać, czy pomiary z produkcji i zapewnienia jakości są ze sobą zgodne, oba pomiary są rejestrowane jako para wartości i przedstawiane w analizie regresji.

Download Możesz pobrać dane tutaj: QAProductionWeight.xlsx

Interpretacja

Analiza regresji pokazuje wyraźną pozytywną korelację między pomiarem produkcyjnym a pomiarem zapewnienia jakości. Jednak wykresy reszt wskazują na systematyczne odchylenie. Na wykresie Reszty vs. Dopasowane widoczny jest zakrzywiony wzór: reszty nie rozpraszają się losowo wokół 0, ale zmieniają się w zakresie pomiarowym. Szereg czasowy reszt również pokazuje zauważalny trend. Sugeruje to, że prosty model liniowy nie w pełni opisuje relację. W praktyce należy sprawdzić, czy istnieje zakres pomiarowy lub efekt kalibracji.

W produkcji bada się, jak częstotliwość konserwacji wpływa na nieplanowane przestoje maszyn. Zakłada się, że regularna konserwacja zmniejsza nieplanowane przestoje, ale efekt ten maleje powyżej pewnej częstotliwości konserwacji. Dla kilku maszyn rejestrowana i dokumentowana jest liczba konserwacji na miesiąc oraz nieplanowane przestoje w tym samym okresie jako pary wartości. Analiza regresji jest używana do sprawdzenia, czy istnieje korelacja i czy można zaobserwować efekt nasycenia.

Download Możesz pobrać dane tutaj: Downtimes_Maintenance.xlsx

Interpretacja

Analiza regresji pokazuje, że wraz ze wzrostem częstotliwości konserwacji, nieplanowane przestoje początkowo znacznie się zmniejszają. Od częstotliwości konserwacji wynoszącej około 4–5 konserwacji miesięcznie, efekt się wyrównuje. Model sześcienny wyraźnie przedstawia tę malejącą użyteczność krańcową i bardzo dobrze opisuje zmierzone wartości. W tej reprezentacji celowo nie pokazano wykresów reszt, więc interpretacja opiera się na przebiegu modelu i tabelach wyników.

W serwisie IT bada się, czy wiek zgłoszenia ma wpływ na czas przetwarzania. Podejrzewa się, że starsze zgłoszenia są często bardziej złożone lub były wielokrotnie eskalowane, co powoduje dłuższe czasy przetwarzania. Dla kilku zgłoszeń rejestrowany i dokumentowany jest wiek zgłoszenia w momencie przetwarzania oraz rzeczywisty czas przetwarzania jako pary wartości. Analiza regresji jest używana do sprawdzenia, czy istnieje korelacja między wiekiem zgłoszenia a czasem przetwarzania.

Download Możesz pobrać dane tutaj: ProcessingTimeITTickets_Age.xlsx

Interpretacja

Analiza regresji pokazuje dużą dyspersję czasów przetwarzania w różnych wiekach zgłoszeń. Model liniowy wyjaśnia tylko niewielką część dyspersji; wartość p regresji nie jest wystarczająco znacząca, aby wyprowadzić wyraźny związek liniowy. Reszty nie dostarczają wyraźnych wskazówek, że model liniowy znacząco wyjaśnia dyspersję. Dlatego sam wiek zgłoszenia nie jest odpowiednim predyktorem czasu przetwarzania.

W sprzedaży oferty sprzedażowe są tworzone dla klientów. Należy zbadać, czy czas trwania procesu oferty ma wpływ na wskaźnik sprzedaży. Dla kilku ofert rejestrowany i dokumentowany jest czas trwania oferty (czas od utworzenia oferty do decyzji) oraz wynikający z tego wskaźnik sprzedaży jako pary wartości. Analiza regresji jest używana do sprawdzenia, czy można rozpoznać związek między czasem trwania oferty a wskaźnikiem sprzedaży.

Download Możesz pobrać dane tutaj: Sales_ConversionRateQuoteDuration.xlsx

Interpretacja

Analiza regresji pokazuje związek między czasem trwania oferty a wskaźnikiem sprzedaży. Trend nie jest liniowy; dlatego użyto modelu kwadratowego. Model regresji opisuje trend w kształcie litery U: Przy średnich czasach trwania ofert wskaźnik sprzedaży jest niższy, przy bardzo krótkich i dłuższych czasach trwania ofert wyższy. Metryki modelu pokazują wyjaśnialny związek, ale reszty nadal wykazują rozproszenie. Dlatego model powinien być profesjonalnie zrecenzowany i nie powinien być używany bez kontekstu do prognoz poza obserwowanym zakresem. Diagram ilustruje, że związek między czasem trwania oferty a wskaźnikiem sprzedaży nie może być sensownie opisany prostą linią.

W logistyce zamówienia klientów są przetwarzane przez wiele centrów logistycznych. Należy zbadać, czy ilość dostawy ma wpływ na czas dostawy. Dla kilku zamówień ilość dostawy i rzeczywisty czas dostawy są rejestrowane i dokumentowane jako pary wartości. Za pomocą analizy regresji sprawdza się, czy można rozpoznać związek między ilością dostawy a czasem dostawy.

Download Możesz pobrać dane tutaj: Logistics_DeliveryTimeDeliveryQuantity.xlsx

Interpretacja

Analiza regresji pokazuje jedynie słabą do umiarkowanej korelację między czasem dostawy a ilością dostawy. Reszty rozpraszają się znacznie wokół linii zerowej. W diagramie reszt vs. dopasowanie można rozpoznać pojedyncze większe odchylenia; rozproszenie wydaje się ogólnie znaczące. Szereg czasowy reszt również wykazuje trend wzrostowy. Może to wskazywać, że kolejność danych lub inne czynniki wpływające odgrywają rolę. Dlatego sama ilość dostawy tylko częściowo wyjaśnia czas dostawy.

W zakupach bada się, czy długość czasu realizacji zamówienia ma wpływ na terminowość dostaw. Podejrzewa się, że dłuższe czasy realizacji poprawiają planowanie, a tym samym zwiększają wskaźnik dostaw na czas. Dla kilku zamówień rejestrowane i dokumentowane są czasy realizacji (czas między zamówieniem a planowaną datą dostawy) oraz rzeczywisty wskaźnik dostaw na czas jako pary wartości. Analiza regresji jest używana do sprawdzenia, czy można dostrzec związek między czasem realizacji a wskaźnikiem dostaw na czas.

Download Możesz pobrać dane tutaj: Procurement_OnTimeDeliveriesOrderTiming.xlsx

Interpretacja

Analiza regresji pokazuje pozytywny liniowy związek między czasem realizacji a wskaźnikiem dostaw na czas. W miarę wzrostu czasu realizacji, wskaźnik dostaw na czas rośnie. Punkty są blisko linii regresji. Podsumowanie modelu pokazuje wysoką wyjaśnioną wariancję, a analiza wariancji wskazuje na statystycznie istotny model. W tej reprezentacji celowo nie pokazano wykresów reszt, ponieważ liniowy związek jest już wyraźnie widoczny w głównym diagramie i w tabelach wyników.

W planowaniu produkcji prognozy są dostosowywane za pomocą współczynnika korekty, aby zrekompensować systematyczne przeszacowanie lub niedoszacowanie. Należy zbadać, jak poziom zastosowanego współczynnika korekty wpływa na pozostałe odchylenie prognozy. Dla kilku prognoz rejestrowane i dokumentowane są użyty współczynnik korekty oraz rzeczywiste odchylenie prognozy jako pary wartości. Analiza regresji jest używana do sprawdzenia, czy można dostrzec związek między współczynnikiem korekty a odchyleniem prognozy.

Pobierz Możesz pobrać dane tutaj: PlanningDeviation_CorrectionFactor.xlsx

Interpretacja

Analiza regresji pokazuje wyraźny negatywny związek między współczynnikiem korekty a odchyleniem prognozy. Jednak wykresy reszt pokazują, że odchylenia nie są całkowicie losowo rozłożone. Na wykresie Reszty vs. Dopasowanie można rozpoznać lekką strukturę, a w szeregach czasowych reszt występują przyległe obszary z dodatnimi lub ujemnymi resztami. Model opisuje podstawowy związek, ale reszty sugerują, że inne czynniki wpływające lub efekty systematyczne mogą odgrywać rolę.

Analiza regresji
Metoda opisu związku między zmienną niezależną a zmienną zależną za pomocą modelu matematycznego.
Model regresji
Funkcja matematyczna, która najlepiej opisuje trend danych.
Zmienna niezależna (x)
Zmienna, której wpływ na inną zmienną jest badany.
Zmienna zależna (y)
Zmienna, która ma być opisana lub przewidziana przez zmienną niezależną.
Para wartości
Powiązane pomiary zmiennych niezależnych i zależnych.
Związek liniowy
Związek, w którym wartości w przybliżeniu układają się wzdłuż prostej linii.
Związek nieliniowy
Związek, którego trendu nie można opisać prostą linią.
Resztki
Odchylenie między wartością zmierzoną a wartością obliczoną modelu.
S
Typowy rozmiar odchyleń między wartościami zmierzonymi a wartościami modelu.
R-Kwadrat
Współczynnik determinacji; wskazuje, jaka część wariancji jest wyjaśniona przez model.
R-Kwadrat (adj)
Skorygowany współczynnik determinacji; dodatkowo uwzględnia liczbę terminów modelu.
ANOVA
Analiza wariancji w celu rozłożenia wariancji na części wyjaśnione i niewyjaśnione.
Kauzalność
Związek przyczynowo-skutkowy między dwiema zmiennymi, który nie może być wyprowadzony wyłącznie z analizy regresji.

Do obliczeń używany jest model regresji.

y = a₀ + a₁x
Liniowy model (1. rzędu)
y = a₀ + a₁x + a₂x²
Kwadratowy model (2. rzędu)
y = a₀ + a₁x + a₂x² + a₃x³
Sześcienny model (3. rzędu)
y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴
Wielomian 4. rzędu
y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ + a₅x⁵
Wielomian 5. rzędu
y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ + a₅x⁵ + a₆x⁶
Wielomian 6. rzędu
Koszyk
Analiza regresji Niemiecki Analiza regresji Angielski Analiza regresji Hiszpański Analiza regresji Włoski Analiza regresji Francuski Analiza regresji Polski Analiza regresji Portugalski