L'analisi di regressione viene utilizzata per la descrizione grafica e computazionale della relazione tra due quantità variabili. Risponde alla domanda se, in quale direzione e con quale modello una variabile target possa essere descritta da una variabile influente.
Ogni punto nel diagramma rappresenta una coppia di valori da una variabile influente (x) e una variabile target (y). Inoltre, viene calcolato un modello di regressione che descrive matematicamente l'andamento dei dati.
L'analisi di regressione è particolarmente adatta per:
- l'indagine dei fattori influenti su una variabile target
- le misurazioni continue (ad es., tempo, temperatura, quantità, viscosità)
- la descrizione e valutazione di una relazione con un modello di regressione
Nel reparto di sviluppo per nuove salse di pomodoro, si sta indagando su come il tempo di cottura influisca sulla viscosità del prodotto. A tal fine, vengono prodotte salse di pomodoro con diversi tempi di cottura in diverse serie di test. Per ogni serie di test, il tempo di cottura e la viscosità risultante vengono misurati e registrati come coppia di valori. L'analisi di regressione viene utilizzata per indagare quale modello descrive la relazione tra tempo di cottura e viscosità nei dati di misurazione.
La relazione di base è nota professionalmente: una cottura più lunga evapora l'acqua, il che generalmente comporta una maggiore viscosità della salsa di pomodoro.
Puoi scaricare i dati qui: TomatoSauce_CookingTimeViscosity.xlsx
Interpretazione dei risultati:
Il grafico a dispersione mostra una chiara relazione positiva tra tempo di cottura e viscosità. All'aumentare del tempo di cottura, aumenta la viscosità della salsa di pomodoro. L'equazione di regressione descrive questa relazione attraverso un modello lineare. Il modello mostra di quanto aumenta in media la viscosità quando aumenta il tempo di cottura.
Il sommario del modello mostra un alto R-quadrato. Pertanto, il modello spiega gran parte della variazione nella viscosità. L'R-quadrato aggiustato è anche vicino all'R-quadrato, rendendo il modello lineare plausibile per questo esempio. L'analisi della varianza mostra un piccolo valore p. Questo suggerisce che la relazione tra tempo di cottura e viscosità è statisticamente significativa.
I grafici dei residui appaiono complessivamente non notevoli. Nel grafico dei residui vs. fit, i punti si disperdono principalmente in modo casuale intorno a 0. Il grafico di probabilità e l'istogramma non mostrano forti deviazioni da una distribuzione approssimativamente normale. Non è visibile alcuna tendenza chiara nella serie temporale dei residui.
Nel complesso, il modello di regressione lineare descrive bene la relazione tra tempo di cottura e viscosità in questo esempio.
Spiegazioni dei risultati:
L'output dell'analisi di regressione consiste nel grafico a dispersione con linea di regressione, l'equazione di regressione, il sommario del modello, l'analisi della varianza e, facoltativamente, i grafici dei residui.
Il grafico a dispersione mostra i valori misurati come punti. La linea di regressione descrive la relazione calcolata tra la variabile indipendente x e la variabile dipendente y.
L'equazione di regressione descrive matematicamente questa relazione. Può essere utilizzata per stimare la variabile dipendente all'interno dell'intervallo di dati considerato.
Il sommario del modello mostra metriche per la qualità del modello. S descrive la deviazione tipica dei valori misurati dalla linea di regressione. L'R-quadrato mostra quale proporzione della variazione è spiegata dal modello. L'R-quadrato (adj.) è l'R-quadrato aggiustato e tiene conto del numero di termini del modello.
L'analisi della varianza mostra come la variazione dei dati è distribuita tra regressione, errore e variazione totale. Il valore p aiuta a valutare se la relazione è statisticamente rilevabile.
I grafici dei residui mostrano le deviazioni tra i valori misurati e i valori del modello. I residui dovrebbero disperdersi il più casualmente possibile intorno a 0. Schemi evidenti possono indicare che il modello non descrive completamente tutte le relazioni.
- I punti dovrebbero trovarsi approssimativamente su una linea retta.
- Forti curvature o schemi a forma di S contrastano con una distribuzione normale.
- Punti individuali distanti possono indicare outlier.
- I punti dovrebbero disperdersi casualmente intorno alla linea zero.
- Una curva suggerisce che un modello lineare non descrive adeguatamente la curvatura.
- Una forma a imbuto suggerisce che la variazione non è costante.
- Punti individuali distanti possono essere outlier.
- La distribuzione dovrebbe essere approssimativamente simmetrica intorno a 0.
- Una distribuzione fortemente asimmetrica può indicare outlier o un modello non adatto.
- Picchi multipli possono indicare che sono stati mescolati gruppi o stati di processo diversi.
- I punti dovrebbero fluttuare casualmente intorno a 0.
- Una tendenza crescente o decrescente indica un cambiamento temporale.
- Schemi ricorrenti possono indicare cicli, lotti o cambiamenti di processo.
- Lunghe sequenze di soli residui positivi o negativi mostrano che il modello sovrastima o sottostima sistematicamente certe aree.
Nell'analisi di regressione, puoi selezionare vari modelli e output:
| Selezione nello Strumento | Tipo di Modello | Equazione Generale |
|---|---|---|
| Lineare | Polinomiale di grado 1 | y = a₀ + a₁x |
| Quadratico | Polinomiale di grado 2 | y = a₀ + a₁x + a₂x² |
| Cubico | Polinomiale di grado 3 | y = a₀ + a₁x + a₂x² + a₃x³ |
| Polinomiale di grado 4 | Polinomiale di grado 4 | y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ |
| Polinomiale di grado 5 | Polinomiale di grado 5 | y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ + a₅x⁵ |
| Polinomiale di grado 6 | Polinomiale di grado 6 | y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ + a₅x⁵ + a₆x⁶ |
Il seguente si applica:
- y = variabile target
- x = variabile influente
- a₀ = intercetta
- a₁ a a₆ = coefficienti del modello
Preparazione
- Definire la variabile target (y) (ad es., viscosità della salsa di pomodoro)
- Definire la variabile influente (x) (ad es., tempo di cottura)
- Assicurarsi che entrambe le variabili siano misurazioni quantitative
- Raccogliere i dati
Utilizzo in AlphadiTab
- Selezionare lo strumento Analisi di Regressione nella Fase di Misura
- Selezionare la colonna del tempo di cottura per Dati X
- Selezionare la colonna della viscosità per Dati Y
- Selezionare il modello desiderato per la Regressione, ad es., lineare o polinomiale di grado 2
- Opzionale: Visualizzare i grafici dei residui
- Confermare con Aggiorna
Interpretazione
- Verificare se è evidente una relazione tra gli assi x e y
- Valutare se il modello di regressione descrive il trend in modo sensato
- Valutare le metriche del modello come S, R-quadrato e R-quadrato (adj)
- Esaminare i residui per identificare anomalie o schemi sistematici
Considerazione generale
- I punti sono ordinati o distribuiti casualmente?
- È riconoscibile una tendenza dei punti?
- Il modello di regressione scelto si adatta alla tendenza?
- Il rapporto è positivo o negativo?
- Se la tendenza è curva: un grado polinomiale più alto è tecnicamente significativo?
- La dispersione dei punti attorno al modello è piccola o grande?
Nota: Un buon modello di regressione non significa necessariamente che una variabile sia la causa dell'altra.
- Quanto più alto è il grado del polinomio, tanto più sono necessari valori x diversi per poter adattare il modello.
- Con troppo pochi valori x diversi, il modello di regressione non può essere calcolato o interpretato in modo affidabile.
Nello sviluppo di un nuovo componente, si sta indagando su come il tempo di raffreddamento dopo il trattamento termico influisca sulla durezza del materiale. Si sospetta che un tempo di raffreddamento più lungo porti a una minore durezza del materiale.
Puoi scaricare i dati qui: MaterialHardnessCoolingTime.xlsx
Interpretazione
L'analisi di regressione mostra una correlazione negativa: all'aumentare del tempo di raffreddamento, la durezza del materiale diminuisce. Tuttavia, i grafici dei residui dovrebbero essere esaminati criticamente. Nel grafico Residui vs. Fit, i residui non sono distribuiti in modo casuale uniforme ma mostrano un modello ricorrente. Anche la serie temporale dei residui appare regolare e non casuale. Questo rende chiaro che, sebbene i dati mostrino una tendenza chiara, i residui non appaiono come deviazioni di misura casuali. Il modello descrive la correlazione ma non dovrebbe essere interpretato come un esempio ideale per residui non appariscenti.
In produzione, una caratteristica di qualità viene misurata in linea, ad esempio, la quantità di riempimento. Nell'assicurazione della qualità, la stessa caratteristica viene controllata nuovamente con uno strumento di misura separato. Per verificare se le misurazioni della produzione e dell'assicurazione della qualità sono coerenti tra loro, entrambe le misurazioni vengono registrate come coppia di valori e presentate in un'analisi di regressione.
Puoi scaricare i dati qui: QAProductionWeight.xlsx
Interpretazione
L'analisi di regressione mostra una chiara correlazione positiva tra la misurazione della produzione e quella dell'assicurazione della qualità. Tuttavia, i grafici dei residui indicano una deviazione sistematica. Nel grafico Residui vs. Fitted, è visibile un pattern curvo: i residui non si disperdono casualmente intorno a 0 ma cambiano lungo l'intervallo di misurazione. Anche la serie temporale dei residui mostra una tendenza evidente. Questo suggerisce che un semplice modello lineare non descrive completamente la relazione. In pratica, dovrebbe essere verificato se esiste un intervallo di misurazione o un effetto di calibrazione.
In produzione, viene esaminato come la frequenza di manutenzione influisca sul tempo di inattività non pianificato delle macchine. Si presume che la manutenzione regolare riduca i tempi di inattività non pianificati, ma questo effetto diminuisce oltre una certa frequenza di manutenzione. Per diverse macchine, il numero di manutenzioni al mese e il tempo di inattività non pianificato nello stesso periodo vengono registrati e documentati come coppie di valori. L'analisi di regressione viene utilizzata per verificare se esiste una correlazione e se si può osservare un effetto di saturazione.
Puoi scaricare i dati qui: Downtimes_Maintenance.xlsx
Interpretazione
L'analisi di regressione mostra che con l'aumentare della frequenza di manutenzione, il tempo di inattività non pianificato inizialmente diminuisce in modo significativo. Da una frequenza di manutenzione di circa 4–5 manutenzioni al mese, l'effetto si stabilizza. Il modello cubico rappresenta visibilmente questa utilità marginale decrescente e descrive molto bene i valori misurati. In questa rappresentazione, i grafici residui non sono stati deliberatamente visualizzati, quindi l'interpretazione si basa sull'andamento del modello e sulle tabelle dei risultati.
Nel service desk IT, si indaga se l'età di un ticket abbia un impatto sul tempo di elaborazione. Si sospetta che i ticket più vecchi siano spesso più complessi o siano stati escalati più volte, causando così tempi di elaborazione più lunghi. Per diversi ticket, l'età del ticket al momento dell'elaborazione e il tempo di elaborazione effettivo sono registrati e documentati come coppie di valori. L'analisi di regressione viene utilizzata per verificare se esiste una correlazione tra l'età del ticket e il tempo di elaborazione.
Puoi scaricare i dati qui: ProcessingTimeITTickets_Age.xlsx
Interpretazione
L'analisi di regressione mostra una forte dispersione dei tempi di elaborazione su tutte le età dei ticket. Il modello lineare spiega solo una piccola parte della dispersione; il p-value della regressione non è sufficientemente significativo per derivare una chiara relazione lineare. I residui non forniscono un'indicazione chiara che il modello lineare spieghi la dispersione in modo significativo. Pertanto, l'età del ticket da sola non è un predittore adatto per il tempo di elaborazione.
Nelle vendite, le offerte di vendita sono create per i clienti. Si dovrebbe indagare se la durata del processo di offerta abbia un impatto sul tasso di vendita. Per diverse offerte, la durata dell'offerta (tempo dalla creazione dell'offerta alla decisione) e il tasso di vendita risultante sono registrati e documentati come coppie di valori. L'analisi di regressione viene utilizzata per verificare se è riconoscibile una connessione tra la durata dell'offerta e il tasso di vendita.
Puoi scaricare i dati qui: Sales_ConversionRateQuoteDuration.xlsx
Interpretazione
L'analisi di regressione mostra la connessione tra la durata dell'offerta e il tasso di vendita. La tendenza non è lineare; pertanto, è stato utilizzato un modello quadratico. Il modello di regressione descrive una tendenza a forma di U: a durate medie dell'offerta, il tasso di vendita è più basso, a durate molto brevi e più lunghe dell'offerta è più alto. Le metriche del modello mostrano una connessione spiegabile, ma i residui mostrano ancora dispersione. Pertanto, il modello dovrebbe essere rivisto professionalmente e non utilizzato senza contesto per previsioni al di fuori dell'intervallo osservato. Il diagramma illustra che la connessione tra la durata dell'offerta e il tasso di vendita non può essere descritta in modo significativo da una semplice linea.
Nella logistica, gli ordini dei clienti vengono elaborati attraverso più centri logistici. Dovrebbe essere verificato se la quantità di consegna ha un impatto sul tempo di consegna. Per diversi ordini, la quantità di consegna e il tempo di consegna effettivo vengono registrati e documentati come coppie di valori. Utilizzando l'analisi di regressione, si verifica se è riconoscibile una connessione tra quantità di consegna e tempo di consegna.
Puoi scaricare i dati qui: Logistics_DeliveryTimeDeliveryQuantity.xlsx
Interpretazione
L'analisi di regressione mostra solo una correlazione debole o moderata tra tempo di consegna e quantità di consegna. I residui si disperdono significativamente attorno alla linea zero. Nel diagramma residui vs. adattamento, sono riconoscibili singole deviazioni maggiori; la dispersione appare significativa nel complesso. La serie temporale dei residui mostra anche una tendenza al rialzo. Questo può indicare che l'ordine dei dati o altri fattori influenti giocano un ruolo. Pertanto, la quantità di consegna da sola spiega solo parzialmente il tempo di consegna.
Nell'acquisto, si esamina se la lunghezza del tempo di consegna dell'ordine abbia un impatto sulla consegna puntuale. Si sospetta che tempi di consegna più lunghi migliorino la pianificazione e quindi aumentino il tasso di consegna puntuale. Per diversi ordini, il tempo di consegna (tempo tra l'ordine e la data di consegna pianificata) e il tasso effettivo di consegna puntuale sono registrati e documentati come coppie di valori. L'analisi di regressione viene utilizzata per verificare se è discernibile una relazione tra il tempo di consegna e il tasso di consegna puntuale.
Puoi scaricare i dati qui: Procurement_OnTimeDeliveriesOrderTiming.xlsx
Interpretazione
L'analisi di regressione mostra una relazione lineare positiva tra il tempo di consegna e il tasso di consegna puntuale. All'aumentare del tempo di consegna, il tasso di consegna puntuale aumenta. I punti sono vicini alla linea di regressione. Il riepilogo del modello mostra una varianza spiegata elevata e l'analisi della varianza indica un modello statisticamente significativo. In questa rappresentazione, i grafici dei residui non sono stati deliberatamente visualizzati, poiché la relazione lineare è già chiaramente visibile nel diagramma principale e nelle tabelle dei risultati.
Nella pianificazione della produzione, le previsioni vengono regolate utilizzando un fattore di correzione per compensare le sovrastime o sottostime sistematiche. Si dovrebbe esaminare come il livello del fattore di correzione applicato influisce sulla deviazione della previsione rimanente. Per diverse previsioni, il fattore di correzione utilizzato e la deviazione effettiva della previsione vengono registrati e documentati come coppie di valori. L'analisi di regressione viene utilizzata per verificare se è discernibile una relazione tra il fattore di correzione e la deviazione della previsione.
Puoi scaricare i dati qui: PlanningDeviation_CorrectionFactor.xlsx
Interpretazione
L'analisi di regressione mostra una chiara relazione negativa tra il fattore di correzione e la deviazione della previsione. Tuttavia, i grafici dei residui mostrano che le deviazioni non sono completamente distribuite in modo casuale. Nel grafico Residui vs. Fit, è riconoscibile una leggera struttura, e nella serie temporale dei residui, ci sono aree contigue con residui positivi o negativi. Il modello descrive la relazione fondamentale, ma i residui suggeriscono che altri fattori influenti o effetti sistematici potrebbero giocare un ruolo.
Per il calcolo, viene utilizzato un modello di regressione.