A análise de regressão é usada para a descrição gráfica e computacional da relação entre duas quantidades variáveis. Ela responde à questão de se, em que direção e com qual modelo uma variável alvo pode ser descrita por uma variável de influência.
Cada ponto no diagrama representa um par de valores de uma variável de influência (x) e uma variável alvo (y). Além disso, um modelo de regressão é calculado que descreve matematicamente o curso dos dados.
A análise de regressão é particularmente adequada para:
- a investigação de fatores de influência sobre uma variável alvo
- medições contínuas (por exemplo, tempo, temperatura, quantidade, viscosidade)
- a descrição e avaliação de uma relação com um modelo de regressão
No departamento de desenvolvimento de novos molhos de tomate, está sendo investigado como o tempo de cozimento afeta a viscosidade do produto. Para este propósito, molhos de tomate com diferentes tempos de cozimento são produzidos em várias séries de teste. Para cada série de teste, o tempo de cozimento e a viscosidade resultante são medidos e registrados como um par de valores. A análise de regressão é usada para investigar qual modelo descreve a relação entre o tempo de cozimento e a viscosidade nos dados de medição.
A relação básica é conhecida profissionalmente: Cozinhar por mais tempo evapora a água, o que geralmente resulta em uma viscosidade mais alta do molho de tomate.
Você pode baixar os dados aqui: TomatoSauce_CookingTimeViscosity.xlsx
Interpretação dos resultados:
O gráfico de dispersão mostra uma clara relação positiva entre o tempo de cozimento e a viscosidade. À medida que o tempo de cozimento aumenta, a viscosidade do molho de tomate aumenta. A equação de regressão descreve essa relação através de um modelo linear. O modelo mostra quanto a viscosidade aumenta em média quando o tempo de cozimento aumenta.
O resumo do modelo mostra um alto R-quadrado. Assim, o modelo explica grande parte da variação na viscosidade. O R-quadrado ajustado também está próximo do R-quadrado, tornando o modelo linear plausível para este exemplo. A análise de variância mostra um pequeno valor p. Isso sugere que a relação entre o tempo de cozimento e a viscosidade é estatisticamente significativa.
OS gráficos de resíduos parecem, no geral, não notáveis. No gráfico de resíduos vs. ajuste, os pontos se dispersam principalmente de forma aleatória em torno de 0. O gráfico de probabilidade e o histograma não mostram fortes desvios de uma distribuição aproximadamente normal. Nenhuma tendência clara é visível na série temporal dos resíduos.
Em geral, o modelo de regressão linear descreve bem a relação entre o tempo de cozimento e a viscosidade neste exemplo.
Explicações dos resultados:
O resultado da análise de regressão consiste no gráfico de dispersão com linha de regressão, a equação de regressão, o resumo do modelo, a análise de variância e, opcionalmente, os gráficos de resíduos.
O gráfico de dispersão mostra os valores medidos como pontos. A linha de regressão descreve a relação calculada entre a variável independente x e a variável dependente y.
A equação de regressão descreve essa relação matematicamente. Ela pode ser usada para estimar a variável dependente dentro do intervalo de dados considerado.
O resumo do modelo mostra métricas para a qualidade do modelo. S descreve o desvio típico dos valores medidos em relação à linha de regressão. O R-quadrado mostra qual proporção da variação é explicada pelo modelo. O R-quadrado (ajustado) é o R-quadrado ajustado e leva em conta o número de termos do modelo.
A análise de variância mostra como a variação dos dados é distribuída sobre a regressão, erro e variação total. O valor p ajuda a avaliar se a relação é estatisticamente detectável.
OS gráficos de resíduos mostram os desvios entre os valores medidos e os valores do modelo. Os resíduos devem se dispersar o mais aleatoriamente possível em torno de 0. Padrões notáveis podem indicar que o modelo não descreve completamente todas as relações.
- OS pontos devem estar aproximadamente em uma linha reta.
- Curvaturas fortes ou padrões em forma de S argumentam contra uma distribuição normal.
- Pontos individuais distantes podem indicar outliers.
- OS pontos devem se dispersar aleatoriamente em torno da linha zero.
- Uma curva sugere que um modelo linear não descreve adequadamente a curvatura.
- Uma forma de funil sugere que a variação não é constante.
- Pontos individuais distantes podem ser outliers.
- A distribuição deve ser aproximadamente simétrica em torno de 0.
- Uma distribuição fortemente assimétrica pode indicar outliers ou um modelo inadequado.
- Vários picos podem indicar que diferentes grupos ou estados de processo foram misturados.
- OS pontos devem flutuar aleatoriamente em torno de 0.
- Uma tendência crescente ou decrescente indica uma mudança temporal.
- Padrões recorrentes podem indicar ciclos, lotes ou mudanças de processo.
- Sequências longas de apenas resíduos positivos ou apenas negativos mostram que o modelo superestima ou subestima sistematicamente certas áreas.
Na análise de regressão, você pode selecionar vários modelos e saídas:
| Seleção na Ferramenta | Tipo de Modelo | Equação Geral |
|---|---|---|
| Linear | Polinômio de grau 1 | y = a₀ + a₁x |
| Quadrático | Polinômio de grau 2 | y = a₀ + a₁x + a₂x² |
| Cúbico | Polinômio de grau 3 | y = a₀ + a₁x + a₂x² + a₃x³ |
| Polinômio de grau 4 | Polinômio de grau 4 | y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ |
| Polinômio de grau 5 | Polinômio de grau 5 | y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ + a₅x⁵ |
| Polinômio de grau 6 | Polinômio de grau 6 | y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ + a₅x⁵ + a₆x⁶ |
O seguinte se aplica:
- y = variável alvo
- x = variável de influência
- a₀ = intercepto
- a₁ a a₆ = coeficientes do modelo
Preparação
- Defina a variável alvo (y) (por exemplo, viscosidade do molho de tomate)
- Defina a variável influente (x) (por exemplo, tempo de cozimento)
- Garanta que ambas as variáveis sejam medições quantitativas
- Colete dados
Usar no AlphadiTab
- Selecione a ferramenta Análise de Regressão na Fase de Medição
- Selecione a coluna de tempo de cozimento para Dados X
- Selecione a coluna de viscosidade para Dados Y
- Selecione o modelo desejado para Regressão, por exemplo, linear ou polinomial de grau 2
- Opcional: Exibir gráficos de resíduos
- Confirme com Atualizar
Interpretação
- Verifique se uma relação entre os eixos x e y é aparente
- Avalie se o modelo de regressão descreve a tendência de forma sensata
- Avalie métricas do modelo, como S, R-quadrado e R-quadrado (ajustado)
- Examine os resíduos para identificar anomalias ou padrões sistemáticos
Consideração geral
- OS pontos estão ordenados ou distribuídos aleatoriamente?
- É reconhecível uma tendência dos pontos?
- O modelo de regressão escolhido se ajusta à tendência?
- A relação é positiva ou negativa?
- Se a tendência é curva: Um grau polinomial mais alto é tecnicamente significativo?
- A dispersão dos pontos em torno do modelo é pequena ou grande?
Nota: Um bom modelo de regressão não significa necessariamente que uma variável seja a causa da outra.
- Quanto maior o grau do polinômio, mais valores x diferentes são necessários para poder ajustar o modelo.
- Com poucos valores x diferentes, o modelo de regressão não pode ser calculado ou interpretado de forma confiável.
No desenvolvimento de um novo componente, está sendo investigado como o tempo de resfriamento após o tratamento térmico afeta a dureza do material. Suspeita-se que um tempo de resfriamento mais longo leva a uma dureza menor do material.
Você pode baixar os dados aqui: MaterialHardnessCoolingTime.xlsx
Interpretação
A análise de regressão mostra uma correlação negativa: à medida que o tempo de resfriamento aumenta, a dureza do material diminui. No entanto, os gráficos de resíduos devem ser examinados criticamente. No gráfico de Resíduos vs. Ajuste, os resíduos não estão distribuídos de forma aleatória uniforme, mas mostram um padrão recorrente. A série temporal dos resíduos também parece regular e não aleatória. Isso deixa claro que, embora os dados mostrem uma tendência clara, os resíduos não aparecem como desvios de medição aleatórios. O modelo descreve a correlação, mas não deve ser interpretado como um exemplo ideal para resíduos discretos.
Na produção, uma característica de qualidade é medida em linha, por exemplo, a quantidade de enchimento. Na garantia de qualidade, a mesma característica é verificada novamente com um instrumento de medição separado. Para investigar se as medições da produção e da garantia de qualidade são consistentes entre si, ambas as medições são registradas como um par de valores e apresentadas em uma análise de regressão.
Você pode baixar os dados aqui: QAProductionWeight.xlsx
Interpretação
A análise de regressão mostra uma clara correlação positiva entre a medição de produção e a medição de garantia de qualidade. No entanto, os gráficos de resíduos indicam um desvio sistemático. No gráfico de Resíduos vs. Ajustados, um padrão curvo é visível: os resíduos não se dispersam aleatoriamente em torno de 0, mas mudam ao longo do intervalo de medição. A série temporal de resíduos também mostra uma tendência notável. Isso sugere que um modelo linear simples não descreve completamente a relação. Na prática, deve-se verificar se há um intervalo de medição ou efeito de calibração.
Na produção, é examinado como a frequência de manutenção afeta o tempo de inatividade não planejado das máquinas. Assume-se que a manutenção regular reduz os tempos de inatividade não planejados, mas esse efeito diminui além de uma certa frequência de manutenção. Para várias máquinas, o número de manutenções por mês e o tempo de inatividade não planejado no mesmo período são registrados e documentados como pares de valores. A análise de regressão é usada para verificar se há uma correlação e se um efeito de saturação pode ser observado.
Você pode baixar os dados aqui: Downtimes_Maintenance.xlsx
Interpretação
A análise de regressão mostra que, com o aumento da frequência de manutenção, o tempo de inatividade não planejado inicialmente diminui significativamente. A partir de uma frequência de manutenção de cerca de 4–5 manutenções por mês, o efeito se estabiliza. O modelo cúbico representa visivelmente essa utilidade marginal decrescente e descreve muito bem os valores medidos. Nesta representação, os gráficos residuais foram deliberadamente não exibidos, então a interpretação é baseada na progressão do modelo e nas tabelas de resultados.
No service desk de TI, é investigado se a idade de um ticket tem impacto no tempo de processamento. Suspeita-se que tickets mais antigos são frequentemente mais complexos ou foram escalados várias vezes, causando assim tempos de processamento mais longos. Para vários tickets, a idade do ticket no momento do processamento e o tempo de processamento real são registrados e documentados como pares de valores. A análise de regressão é usada para verificar se há uma correlação entre a idade do ticket e o tempo de processamento.
Você pode baixar os dados aqui: ProcessingTimeITTickets_Age.xlsx
Interpretação
A análise de regressão mostra uma forte dispersão dos tempos de processamento em todas as idades dos tickets. O modelo linear explica apenas uma pequena parte da dispersão; o valor p da regressão não é significativo o suficiente para derivar uma relação linear clara. Os resíduos não fornecem uma indicação clara de que o modelo linear explica a dispersão de forma significativa. Portanto, a idade do ticket sozinha não é um preditor adequado para o tempo de processamento.
Nas vendas, ofertas de vendas são criadas para os clientes. Deve-se investigar se a duração do processo de oferta tem impacto na taxa de vendas. Para várias ofertas, a duração da oferta (tempo desde a criação da oferta até a decisão) e a taxa de vendas resultante são registradas e documentadas como pares de valores. A análise de regressão é usada para verificar se é reconhecível uma conexão entre a duração da oferta e a taxa de vendas.
Você pode baixar os dados aqui: Sales_ConversionRateQuoteDuration.xlsx
Interpretação
A análise de regressão mostra a conexão entre a duração da oferta e a taxa de vendas. A tendência não é linear; portanto, um modelo quadrático foi utilizado. O modelo de regressão descreve uma tendência em forma de U: em durações de oferta médias, a taxa de vendas é menor, em durações de oferta muito curtas e mais longas, é maior. As métricas do modelo mostram uma conexão explicável, mas os resíduos ainda mostram dispersão. Portanto, o modelo deve ser revisado profissionalmente e não deve ser usado sem contexto para previsões fora do intervalo observado. O diagrama ilustra que a conexão entre a duração da oferta e a taxa de vendas não pode ser descrita de forma significativa por uma linha simples.
Na logística, os pedidos dos clientes são processados através de vários centros de logística. Deve-se investigar se a quantidade de entrega tem impacto no tempo de entrega. Para vários pedidos, a quantidade de entrega e o tempo de entrega real são registrados e documentados como pares de valores. Usando análise de regressão, verifica-se se uma conexão entre a quantidade de entrega e o tempo de entrega é reconhecível.
Você pode baixar os dados aqui: Logistics_DeliveryTimeDeliveryQuantity.xlsx
Interpretação
A análise de regressão mostra apenas uma correlação fraca a moderada entre o tempo de entrega e a quantidade de entrega. Os resíduos se dispersam significativamente em torno da linha zero. No diagrama de resíduos vs. ajuste, desvios individuais maiores são reconhecíveis; a dispersão parece significativa no geral. A série temporal dos resíduos também mostra uma tendência ascendente. Isso pode indicar que a ordem dos dados ou outros fatores influentes desempenham um papel. Portanto, a quantidade de entrega sozinha explica apenas parcialmente o tempo de entrega.
Na compra, é examinado se a duração do tempo de espera do pedido tem impacto na entrega pontual. Suspeita-se que tempos de espera mais longos melhoram o planejamento e, assim, aumentam a taxa de entrega pontual. Para vários pedidos, o tempo de espera (tempo entre o pedido e a data de entrega planejada) e a taxa real de entrega pontual são registrados e documentados como pares de valores. A análise de regressão é usada para verificar se uma relação entre o tempo de espera e a taxa de entrega pontual é discernível.
Você pode baixar os dados aqui: Procurement_OnTimeDeliveriesOrderTiming.xlsx
Interpretação
A análise de regressão mostra uma relação linear positiva entre o tempo de espera e a taxa de entrega pontual. À medida que o tempo de espera aumenta, a taxa de entrega pontual sobe. Os pontos estão próximos da linha de regressão. O resumo do modelo mostra uma alta variância explicada, e a análise de variância indica um modelo estatisticamente significativo. Nesta representação, os gráficos de resíduos não foram exibidos deliberadamente, pois a relação linear já é claramente visível no diagrama principal e nas tabelas de resultados.
No planejamento de produção, as previsões são ajustadas usando um fator de correção para compensar a superestimação ou subestimação sistemática. Deve-se examinar como o nível do fator de correção aplicado afeta o desvio de previsão restante. Para várias previsões, o fator de correção utilizado e o desvio de previsão real são registrados e documentados como pares de valores. A análise de regressão é usada para verificar se uma relação entre o fator de correção e o desvio de previsão é discernível.
Você pode baixar os dados aqui: PlanningDeviation_CorrectionFactor.xlsx
Interpretação
A análise de regressão mostra uma clara relação negativa entre o fator de correção e o desvio de previsão. No entanto, os gráficos de resíduos mostram que os desvios não estão completamente distribuídos aleatoriamente. No gráfico de Resíduos vs. Ajuste, uma leve estrutura é reconhecível, e na série temporal de resíduos, há áreas contíguas com resíduos positivos ou negativos. O modelo descreve a relação fundamental, mas os resíduos sugerem que outros fatores de influência ou efeitos sistemáticos podem desempenhar um papel.
Para o cálculo, é utilizado um modelo de regressão.