Analiza regresji jest używana do graficznego i obliczeniowego opisu związku między dwiema zmiennymi ilościami. Odpowiada na pytanie, czy, w jakim kierunku i z jakim modelem zmienną zależną można opisać za pomocą zmiennej niezależnej.
Każdy punkt na diagramie reprezentuje parę wartości z zmiennej niezależnej (x) i zmiennej zależnej (y). Dodatkowo obliczany jest model regresji, który matematycznie opisuje przebieg danych.
Analiza regresji jest szczególnie przydatna do:
- badania czynników wpływających na zmienną zależną
- ciągłych pomiarów (np. czas, temperatura, ilość, lepkość)
- opisu i oceny związku za pomocą modelu regresji
W dziale rozwoju nowych sosów pomidorowych badane jest, jak czas gotowania wpływa na lepkość produktu. W tym celu w kilku seriach testowych produkowane są sosy pomidorowe o różnych czasach gotowania. Dla każdej serii testowej mierzony i rejestrowany jest czas gotowania oraz wynikająca z niego lepkość jako para wartości. Analiza regresji jest używana do zbadania, który model opisuje związek między czasem gotowania a lepkością w danych pomiarowych.
Podstawowy związek jest znany zawodowo: Dłuższe gotowanie odparowuje wodę, co zazwyczaj skutkuje wyższą lepkością sosu pomidorowego.
Możesz pobrać dane tutaj: TomatoSauce_CookingTimeViscosity.xlsx
Interpretacja wyników:
Wykres rozrzutu pokazuje wyraźny pozytywny związek między czasem gotowania a lepkością. W miarę wydłużania się czasu gotowania, lepkość sosu pomidorowego wzrasta. Równanie regresji opisuje ten związek za pomocą modelu liniowego. Model pokazuje, o ile średnio wzrasta lepkość, gdy czas gotowania się wydłuża.
Podsumowanie modelu pokazuje wysoką wartość R-kwadrat. Zatem model wyjaśnia dużą część zmienności lepkości. Skorygowana wartość R-kwadrat jest również bliska wartości R-kwadrat, co czyni model liniowy wiarygodnym dla tego przykładu. Analiza wariancji pokazuje małą wartość p. Sugeruje to, że związek między czasem gotowania a lepkością jest statystycznie istotny.
Wykresy resztowe wydają się ogólnie nieznaczące. Na wykresie reszt vs. dopasowanie punkty rozpraszają się głównie losowo wokół 0. Wykres prawdopodobieństwa i histogram nie pokazują silnych odchyleń od przybliżonego rozkładu normalnego. W szeregach czasowych reszt nie jest widoczny wyraźny trend.
Ogólnie rzecz biorąc, model regresji liniowej dobrze opisuje związek między czasem gotowania a lepkością w tym przykładzie.
Objaśnienia wyników:
Wynik analizy regresji składa się z wykresu rozrzutu z linią regresji, równania regresji, podsumowania modelu, analizy wariancji oraz opcjonalnie wykresów resztowych.
Wykres rozrzutu pokazuje zmierzone wartości jako punkty. Linia regresji opisuje obliczony związek między zmienną niezależną x a zmienną zależną y.
Równanie regresji opisuje ten związek matematycznie. Może być używane do oszacowania zmiennej zależnej w rozważanym zakresie danych.
Podsumowanie modelu pokazuje metryki jakości modelu. S opisuje typowe odchylenie zmierzonych wartości od linii regresji. R-kwadrat pokazuje, jaki procent zmienności jest wyjaśniany przez model. R-kwadrat (adj.) to skorygowana wartość R-kwadrat i uwzględnia liczbę terminów modelu.
Analiza wariancji pokazuje, jak zmienność danych jest rozdzielona na regresję, błąd i całkowitą zmienność. Wartość p pomaga ocenić, czy związek jest statystycznie wykrywalny.
Wykresy resztowe pokazują odchylenia między zmierzonymi wartościami a wartościami modelowymi. Reszty powinny rozpraszać się jak najbardziej losowo wokół 0. Zauważalne wzorce mogą wskazywać, że model nie w pełni opisuje wszystkie związki.
- Punkty powinny leżeć w przybliżeniu na prostej linii.
- Silne krzywizny lub wzorce w kształcie litery S przemawiają przeciwko rozkładowi normalnemu.
- Pojedyncze odległe punkty mogą wskazywać na wartości odstające.
- Punkty powinny rozpraszać się losowo wokół linii zerowej.
- Krzywa sugeruje, że model liniowy nie opisuje odpowiednio krzywizny.
- Kształt lejka sugeruje, że zmienność nie jest stała.
- Pojedyncze odległe punkty mogą być wartościami odstającymi.
- Rozkład powinien być w przybliżeniu symetryczny wokół 0.
- Silnie skośny rozkład może wskazywać na wartości odstające lub nieodpowiedni model.
- Wiele szczytów może wskazywać, że różne grupy lub stany procesu zostały zmieszane.
- Punkty powinny losowo oscylować wokół 0.
- Rosnący lub malejący trend wskazuje na zmianę czasową.
- Powtarzające się wzorce mogą wskazywać na cykle, partie lub zmiany procesu.
- Długie sekwencje tylko pozytywnych lub tylko negatywnych reszt pokazują, że model systematycznie przeszacowuje lub niedoszacowuje pewne obszary.
W analizie regresji możesz wybrać różne modele i wyniki:
| Wybór w narzędziu | Typ modelu | Ogólne równanie |
|---|---|---|
| Liniowy | Wielomian stopnia 1 | y = a₀ + a₁x |
| Kwadratowy | Wielomian stopnia 2 | y = a₀ + a₁x + a₂x² |
| Sześcienny | Wielomian stopnia 3 | y = a₀ + a₁x + a₂x² + a₃x³ |
| Wielomian stopnia 4 | Wielomian stopnia 4 | y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ |
| Wielomian stopnia 5 | Wielomian stopnia 5 | y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ + a₅x⁵ |
| Wielomian stopnia 6 | Wielomian stopnia 6 | y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ + a₅x⁵ + a₆x⁶ |
Obowiązuje następujące:
- y = zmienna docelowa
- x = zmienna wpływająca
- a₀ = punkt przecięcia
- a₁ do a₆ = współczynniki modelu
Przygotowanie
- Zdefiniuj zmienną docelową (y) (np. lepkość sosu pomidorowego)
- Zdefiniuj zmienną wpływającą (x) (np. czas gotowania)
- Upewnij się, że obie zmienne są ilościowymi pomiarami
- Zbierz dane
Użyj w AlphadiTab
- Wybierz narzędzie Analiza regresji w Fazie pomiaru
- Wybierz kolumnę czasu gotowania dla Danych X
- Wybierz kolumnę lepkości dla Danych Y
- Wybierz pożądany model dla Regresji, np. liniowy lub wielomianowy stopnia 2
- Opcjonalnie: Wyświetl wykresy reszt
- Potwierdź za pomocą Aktualizuj
Interpretacja
- Sprawdź, czy widoczny jest związek między osiami x i y
- Oceń, czy model regresji sensownie opisuje trend
- Oceń metryki modelu, takie jak S, R-kwadrat i R-kwadrat (adj)
- Zbadaj reszty, aby zidentyfikować anomalie lub systematyczne wzorce
Ogólne rozważania
- Czy punkty są uporządkowane czy rozmieszczone losowo?
- Czy można rozpoznać trend punktów?
- Czy wybrany model regresji pasuje do trendu?
- Czy relacja jest pozytywna czy negatywna?
- Jeśli trend jest zakrzywiony: Czy wyższy stopień wielomianu ma sens techniczny?
- Czy rozproszenie punktów wokół modelu jest małe czy duże?
Uwaga: Dobry model regresji niekoniecznie oznacza, że jedna zmienna jest przyczyną drugiej.
- Im wyższy stopień wielomianu, tym więcej różnych wartości x jest potrzebnych do dostosowania modelu.
- Przy zbyt małej liczbie różnych wartości x model regresji nie może być wiarygodnie obliczony ani interpretowany.
W rozwoju nowego komponentu badane jest, jak czas chłodzenia po obróbce cieplnej wpływa na twardość materiału. Podejrzewa się, że dłuższy czas chłodzenia prowadzi do niższej twardości materiału.
Możesz pobrać dane tutaj: MaterialHardnessCoolingTime.xlsx
Interpretacja
Analiza regresji pokazuje negatywną korelację: W miarę wydłużania się czasu chłodzenia, twardość materiału maleje. Jednakże, wykresy reszt powinny być krytycznie zbadane. Na wykresie Reszty vs. Dopasowanie, reszty nie są równomiernie losowo rozłożone, ale pokazują powtarzający się wzór. Szereg czasowy reszt również wydaje się regularny, a nie losowy. To wyraźnie pokazuje, że choć dane wykazują wyraźny trend, reszty nie wydają się być losowymi odchyleniami pomiarowymi. Model opisuje korelację, ale nie powinien być interpretowany jako idealny przykład dla niepozornych reszt.
W produkcji cecha jakościowa jest mierzona w linii, np. ilość napełnienia. W zapewnieniu jakości ta sama cecha jest sprawdzana ponownie za pomocą oddzielnego przyrządu pomiarowego. Aby zbadać, czy pomiary z produkcji i zapewnienia jakości są ze sobą zgodne, oba pomiary są rejestrowane jako para wartości i przedstawiane w analizie regresji.
Możesz pobrać dane tutaj: QAProductionWeight.xlsx
Interpretacja
Analiza regresji pokazuje wyraźną pozytywną korelację między pomiarem produkcyjnym a pomiarem zapewnienia jakości. Jednak wykresy reszt wskazują na systematyczne odchylenie. Na wykresie Reszty vs. Dopasowane widoczny jest zakrzywiony wzór: reszty nie rozpraszają się losowo wokół 0, ale zmieniają się w zakresie pomiarowym. Szereg czasowy reszt również pokazuje zauważalny trend. Sugeruje to, że prosty model liniowy nie w pełni opisuje relację. W praktyce należy sprawdzić, czy istnieje zakres pomiarowy lub efekt kalibracji.
W produkcji bada się, jak częstotliwość konserwacji wpływa na nieplanowane przestoje maszyn. Zakłada się, że regularna konserwacja zmniejsza nieplanowane przestoje, ale efekt ten maleje powyżej pewnej częstotliwości konserwacji. Dla kilku maszyn rejestrowana i dokumentowana jest liczba konserwacji na miesiąc oraz nieplanowane przestoje w tym samym okresie jako pary wartości. Analiza regresji jest używana do sprawdzenia, czy istnieje korelacja i czy można zaobserwować efekt nasycenia.
Możesz pobrać dane tutaj: Downtimes_Maintenance.xlsx
Interpretacja
Analiza regresji pokazuje, że wraz ze wzrostem częstotliwości konserwacji, nieplanowane przestoje początkowo znacznie się zmniejszają. Od częstotliwości konserwacji wynoszącej około 4–5 konserwacji miesięcznie, efekt się wyrównuje. Model sześcienny wyraźnie przedstawia tę malejącą użyteczność krańcową i bardzo dobrze opisuje zmierzone wartości. W tej reprezentacji celowo nie pokazano wykresów reszt, więc interpretacja opiera się na przebiegu modelu i tabelach wyników.
W serwisie IT bada się, czy wiek zgłoszenia ma wpływ na czas przetwarzania. Podejrzewa się, że starsze zgłoszenia są często bardziej złożone lub były wielokrotnie eskalowane, co powoduje dłuższe czasy przetwarzania. Dla kilku zgłoszeń rejestrowany i dokumentowany jest wiek zgłoszenia w momencie przetwarzania oraz rzeczywisty czas przetwarzania jako pary wartości. Analiza regresji jest używana do sprawdzenia, czy istnieje korelacja między wiekiem zgłoszenia a czasem przetwarzania.
Możesz pobrać dane tutaj: ProcessingTimeITTickets_Age.xlsx
Interpretacja
Analiza regresji pokazuje dużą dyspersję czasów przetwarzania w różnych wiekach zgłoszeń. Model liniowy wyjaśnia tylko niewielką część dyspersji; wartość p regresji nie jest wystarczająco znacząca, aby wyprowadzić wyraźny związek liniowy. Reszty nie dostarczają wyraźnych wskazówek, że model liniowy znacząco wyjaśnia dyspersję. Dlatego sam wiek zgłoszenia nie jest odpowiednim predyktorem czasu przetwarzania.
W sprzedaży oferty sprzedażowe są tworzone dla klientów. Należy zbadać, czy czas trwania procesu oferty ma wpływ na wskaźnik sprzedaży. Dla kilku ofert rejestrowany i dokumentowany jest czas trwania oferty (czas od utworzenia oferty do decyzji) oraz wynikający z tego wskaźnik sprzedaży jako pary wartości. Analiza regresji jest używana do sprawdzenia, czy można rozpoznać związek między czasem trwania oferty a wskaźnikiem sprzedaży.
Możesz pobrać dane tutaj: Sales_ConversionRateQuoteDuration.xlsx
Interpretacja
Analiza regresji pokazuje związek między czasem trwania oferty a wskaźnikiem sprzedaży. Trend nie jest liniowy; dlatego użyto modelu kwadratowego. Model regresji opisuje trend w kształcie litery U: Przy średnich czasach trwania ofert wskaźnik sprzedaży jest niższy, przy bardzo krótkich i dłuższych czasach trwania ofert wyższy. Metryki modelu pokazują wyjaśnialny związek, ale reszty nadal wykazują rozproszenie. Dlatego model powinien być profesjonalnie zrecenzowany i nie powinien być używany bez kontekstu do prognoz poza obserwowanym zakresem. Diagram ilustruje, że związek między czasem trwania oferty a wskaźnikiem sprzedaży nie może być sensownie opisany prostą linią.
W logistyce zamówienia klientów są przetwarzane przez wiele centrów logistycznych. Należy zbadać, czy ilość dostawy ma wpływ na czas dostawy. Dla kilku zamówień ilość dostawy i rzeczywisty czas dostawy są rejestrowane i dokumentowane jako pary wartości. Za pomocą analizy regresji sprawdza się, czy można rozpoznać związek między ilością dostawy a czasem dostawy.
Możesz pobrać dane tutaj: Logistics_DeliveryTimeDeliveryQuantity.xlsx
Interpretacja
Analiza regresji pokazuje jedynie słabą do umiarkowanej korelację między czasem dostawy a ilością dostawy. Reszty rozpraszają się znacznie wokół linii zerowej. W diagramie reszt vs. dopasowanie można rozpoznać pojedyncze większe odchylenia; rozproszenie wydaje się ogólnie znaczące. Szereg czasowy reszt również wykazuje trend wzrostowy. Może to wskazywać, że kolejność danych lub inne czynniki wpływające odgrywają rolę. Dlatego sama ilość dostawy tylko częściowo wyjaśnia czas dostawy.
W zakupach bada się, czy długość czasu realizacji zamówienia ma wpływ na terminowość dostaw. Podejrzewa się, że dłuższe czasy realizacji poprawiają planowanie, a tym samym zwiększają wskaźnik dostaw na czas. Dla kilku zamówień rejestrowane i dokumentowane są czasy realizacji (czas między zamówieniem a planowaną datą dostawy) oraz rzeczywisty wskaźnik dostaw na czas jako pary wartości. Analiza regresji jest używana do sprawdzenia, czy można dostrzec związek między czasem realizacji a wskaźnikiem dostaw na czas.
Możesz pobrać dane tutaj: Procurement_OnTimeDeliveriesOrderTiming.xlsx
Interpretacja
Analiza regresji pokazuje pozytywny liniowy związek między czasem realizacji a wskaźnikiem dostaw na czas. W miarę wzrostu czasu realizacji, wskaźnik dostaw na czas rośnie. Punkty są blisko linii regresji. Podsumowanie modelu pokazuje wysoką wyjaśnioną wariancję, a analiza wariancji wskazuje na statystycznie istotny model. W tej reprezentacji celowo nie pokazano wykresów reszt, ponieważ liniowy związek jest już wyraźnie widoczny w głównym diagramie i w tabelach wyników.
W planowaniu produkcji prognozy są dostosowywane za pomocą współczynnika korekty, aby zrekompensować systematyczne przeszacowanie lub niedoszacowanie. Należy zbadać, jak poziom zastosowanego współczynnika korekty wpływa na pozostałe odchylenie prognozy. Dla kilku prognoz rejestrowane i dokumentowane są użyty współczynnik korekty oraz rzeczywiste odchylenie prognozy jako pary wartości. Analiza regresji jest używana do sprawdzenia, czy można dostrzec związek między współczynnikiem korekty a odchyleniem prognozy.
Możesz pobrać dane tutaj: PlanningDeviation_CorrectionFactor.xlsx
Interpretacja
Analiza regresji pokazuje wyraźny negatywny związek między współczynnikiem korekty a odchyleniem prognozy. Jednak wykresy reszt pokazują, że odchylenia nie są całkowicie losowo rozłożone. Na wykresie Reszty vs. Dopasowanie można rozpoznać lekką strukturę, a w szeregach czasowych reszt występują przyległe obszary z dodatnimi lub ujemnymi resztami. Model opisuje podstawowy związek, ale reszty sugerują, że inne czynniki wpływające lub efekty systematyczne mogą odgrywać rolę.
Do obliczeń używany jest model regresji.