Alphadi Tab - Visão geral da ferramenta

Análise de regressão

A análise de regressão é usada para a descrição gráfica e computacional da relação entre duas quantidades variáveis. Ela responde à questão de se, em que direção e com qual modelo uma variável alvo pode ser descrita por uma variável de influência.

Cada ponto no diagrama representa um par de valores de uma variável de influência (x) e uma variável alvo (y). Além disso, um modelo de regressão é calculado que descreve matematicamente o curso dos dados.

A análise de regressão é particularmente adequada para:

  • a investigação de fatores de influência sobre uma variável alvo
  • medições contínuas (por exemplo, tempo, temperatura, quantidade, viscosidade)
  • a descrição e avaliação de uma relação com um modelo de regressão

No departamento de desenvolvimento de novos molhos de tomate, está sendo investigado como o tempo de cozimento afeta a viscosidade do produto. Para este propósito, molhos de tomate com diferentes tempos de cozimento são produzidos em várias séries de teste. Para cada série de teste, o tempo de cozimento e a viscosidade resultante são medidos e registrados como um par de valores. A análise de regressão é usada para investigar qual modelo descreve a relação entre o tempo de cozimento e a viscosidade nos dados de medição.

A relação básica é conhecida profissionalmente: Cozinhar por mais tempo evapora a água, o que geralmente resulta em uma viscosidade mais alta do molho de tomate.

 

Download Você pode baixar os dados aqui: TomatoSauce_CookingTimeViscosity.xlsx

 

 

Interpretação dos resultados:

O gráfico de dispersão mostra uma clara relação positiva entre o tempo de cozimento e a viscosidade. À medida que o tempo de cozimento aumenta, a viscosidade do molho de tomate aumenta. A equação de regressão descreve essa relação através de um modelo linear. O modelo mostra quanto a viscosidade aumenta em média quando o tempo de cozimento aumenta.

O resumo do modelo mostra um alto R-quadrado. Assim, o modelo explica grande parte da variação na viscosidade. O R-quadrado ajustado também está próximo do R-quadrado, tornando o modelo linear plausível para este exemplo. A análise de variância mostra um pequeno valor p. Isso sugere que a relação entre o tempo de cozimento e a viscosidade é estatisticamente significativa.

OS gráficos de resíduos parecem, no geral, não notáveis. No gráfico de resíduos vs. ajuste, os pontos se dispersam principalmente de forma aleatória em torno de 0. O gráfico de probabilidade e o histograma não mostram fortes desvios de uma distribuição aproximadamente normal. Nenhuma tendência clara é visível na série temporal dos resíduos.

Em geral, o modelo de regressão linear descreve bem a relação entre o tempo de cozimento e a viscosidade neste exemplo.

 

Explicações dos resultados:

O resultado da análise de regressão consiste no gráfico de dispersão com linha de regressão, a equação de regressão, o resumo do modelo, a análise de variância e, opcionalmente, os gráficos de resíduos.

O gráfico de dispersão mostra os valores medidos como pontos. A linha de regressão descreve a relação calculada entre a variável independente x e a variável dependente y.

A equação de regressão descreve essa relação matematicamente. Ela pode ser usada para estimar a variável dependente dentro do intervalo de dados considerado.

O resumo do modelo mostra métricas para a qualidade do modelo. S descreve o desvio típico dos valores medidos em relação à linha de regressão. O R-quadrado mostra qual proporção da variação é explicada pelo modelo. O R-quadrado (ajustado) é o R-quadrado ajustado e leva em conta o número de termos do modelo.

A análise de variância mostra como a variação dos dados é distribuída sobre a regressão, erro e variação total. O valor p ajuda a avaliar se a relação é estatisticamente detectável.

OS gráficos de resíduos mostram os desvios entre os valores medidos e os valores do modelo. Os resíduos devem se dispersar o mais aleatoriamente possível em torno de 0. Padrões notáveis podem indicar que o modelo não descreve completamente todas as relações.

Gráfico de probabilidade dos resíduos
O gráfico de probabilidade mostra se os resíduos são aproximadamente distribuídos normalmente.
  • OS pontos devem estar aproximadamente em uma linha reta.
  • Curvaturas fortes ou padrões em forma de S argumentam contra uma distribuição normal.
  • Pontos individuais distantes podem indicar outliers.
Por que isso é importante?
Uma distribuição aproximadamente normal dos resíduos é importante ao interpretar métricas como valores p ou intervalos de confiança.
Resíduos vs. Ajuste
Este gráfico mostra os resíduos em relação aos valores calculados do modelo.
  • OS pontos devem se dispersar aleatoriamente em torno da linha zero.
  • Uma curva sugere que um modelo linear não descreve adequadamente a curvatura.
  • Uma forma de funil sugere que a variação não é constante.
  • Pontos individuais distantes podem ser outliers.
Por que isso é importante?
O gráfico mostra se o modelo se ajusta igualmente bem em toda a faixa de valores.
Histograma dos resíduos
O histograma mostra a distribuição dos resíduos.
  • A distribuição deve ser aproximadamente simétrica em torno de 0.
  • Uma distribuição fortemente assimétrica pode indicar outliers ou um modelo inadequado.
  • Vários picos podem indicar que diferentes grupos ou estados de processo foram misturados.
Por que isso é importante?
O histograma complementa o gráfico de probabilidade e ajuda a avaliar visualmente a distribuição dos desvios.
Série temporal dos resíduos
A série temporal dos resíduos mostra os resíduos na ordem dos pontos de dados.
  • OS pontos devem flutuar aleatoriamente em torno de 0.
  • Uma tendência crescente ou decrescente indica uma mudança temporal.
  • Padrões recorrentes podem indicar ciclos, lotes ou mudanças de processo.
  • Sequências longas de apenas resíduos positivos ou apenas negativos mostram que o modelo superestima ou subestima sistematicamente certas áreas.
Por que isso é importante?
O gráfico mostra se a ordem das medições importa. Isso é especialmente importante para dados de processo ou temporais.

Na análise de regressão, você pode selecionar vários modelos e saídas:

Seleção na Ferramenta Tipo de Modelo Equação Geral
Linear Polinômio de grau 1 y = a₀ + a₁x
Quadrático Polinômio de grau 2 y = a₀ + a₁x + a₂x²
Cúbico Polinômio de grau 3 y = a₀ + a₁x + a₂x² + a₃x³
Polinômio de grau 4 Polinômio de grau 4 y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴
Polinômio de grau 5 Polinômio de grau 5 y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ + a₅x⁵
Polinômio de grau 6 Polinômio de grau 6 y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ + a₅x⁵ + a₆x⁶

O seguinte se aplica:

  • y = variável alvo
  • x = variável de influência
  • a₀ = intercepto
  • a₁ a a₆ = coeficientes do modelo

Preparação

  1. Defina a variável alvo (y) (por exemplo, viscosidade do molho de tomate)
  2. Defina a variável influente (x) (por exemplo, tempo de cozimento)
  3. Garanta que ambas as variáveis sejam medições quantitativas
  4. Colete dados

AlphadiTab Usar no AlphadiTab

  1. Selecione a ferramenta Análise de Regressão na Fase de Medição
  2. Selecione a coluna de tempo de cozimento para Dados X
  3. Selecione a coluna de viscosidade para Dados Y
  4. Selecione o modelo desejado para Regressão, por exemplo, linear ou polinomial de grau 2
  5. Opcional: Exibir gráficos de resíduos
  6. Confirme com Atualizar

Interpretação

  1. Verifique se uma relação entre os eixos x e y é aparente
  2. Avalie se o modelo de regressão descreve a tendência de forma sensata
  3. Avalie métricas do modelo, como S, R-quadrado e R-quadrado (ajustado)
  4. Examine os resíduos para identificar anomalias ou padrões sistemáticos

Consideração geral

  1. OS pontos estão ordenados ou distribuídos aleatoriamente?
  2. É reconhecível uma tendência dos pontos?
  3. O modelo de regressão escolhido se ajusta à tendência?
  4. A relação é positiva ou negativa?
  5. Se a tendência é curva: Um grau polinomial mais alto é tecnicamente significativo?
  6. A dispersão dos pontos em torno do modelo é pequena ou grande?

Nota: Um bom modelo de regressão não significa necessariamente que uma variável seja a causa da outra.

Variáveis Quantitativas
OS dados devem estar disponíveis como variáveis quantitativas, o que significa que podem ser contados ou medidos.
Por que isso é importante?
A análise de regressão calcula desvios e componentes de variância. São necessários valores numéricos para isso.
X-Valores Suficientemente Diferentes
Para o modelo de regressão escolhido, deve haver um número suficiente de valores x diferentes disponíveis.
Por que isso é importante?
  • Quanto maior o grau do polinômio, mais valores x diferentes são necessários para poder ajustar o modelo.
  • Com poucos valores x diferentes, o modelo de regressão não pode ser calculado ou interpretado de forma confiável.
Quando apenas uma única variável é considerada e nenhuma relação deve ser modelada
Histograma ou Boxplot
Quando a influência de um fator nominal deve ser examinada
Teste de Hipótese
Quando o foco está em desenvolvimentos temporais
Gráfico de Série Temporal
Quando uma relação deve ser inicialmente verificada visualmente
Diagrama de Correlação ou Gráfico de Dispersão

No desenvolvimento de um novo componente, está sendo investigado como o tempo de resfriamento após o tratamento térmico afeta a dureza do material. Suspeita-se que um tempo de resfriamento mais longo leva a uma dureza menor do material.

 

Download Você pode baixar os dados aqui: MaterialHardnessCoolingTime.xlsx

Interpretação

A análise de regressão mostra uma correlação negativa: à medida que o tempo de resfriamento aumenta, a dureza do material diminui. No entanto, os gráficos de resíduos devem ser examinados criticamente. No gráfico de Resíduos vs. Ajuste, os resíduos não estão distribuídos de forma aleatória uniforme, mas mostram um padrão recorrente. A série temporal dos resíduos também parece regular e não aleatória. Isso deixa claro que, embora os dados mostrem uma tendência clara, os resíduos não aparecem como desvios de medição aleatórios. O modelo descreve a correlação, mas não deve ser interpretado como um exemplo ideal para resíduos discretos.

Na produção, uma característica de qualidade é medida em linha, por exemplo, a quantidade de enchimento. Na garantia de qualidade, a mesma característica é verificada novamente com um instrumento de medição separado. Para investigar se as medições da produção e da garantia de qualidade são consistentes entre si, ambas as medições são registradas como um par de valores e apresentadas em uma análise de regressão.

Download Você pode baixar os dados aqui: QAProductionWeight.xlsx

Interpretação

A análise de regressão mostra uma clara correlação positiva entre a medição de produção e a medição de garantia de qualidade. No entanto, os gráficos de resíduos indicam um desvio sistemático. No gráfico de Resíduos vs. Ajustados, um padrão curvo é visível: os resíduos não se dispersam aleatoriamente em torno de 0, mas mudam ao longo do intervalo de medição. A série temporal de resíduos também mostra uma tendência notável. Isso sugere que um modelo linear simples não descreve completamente a relação. Na prática, deve-se verificar se há um intervalo de medição ou efeito de calibração.

Na produção, é examinado como a frequência de manutenção afeta o tempo de inatividade não planejado das máquinas. Assume-se que a manutenção regular reduz os tempos de inatividade não planejados, mas esse efeito diminui além de uma certa frequência de manutenção. Para várias máquinas, o número de manutenções por mês e o tempo de inatividade não planejado no mesmo período são registrados e documentados como pares de valores. A análise de regressão é usada para verificar se há uma correlação e se um efeito de saturação pode ser observado.

Download Você pode baixar os dados aqui: Downtimes_Maintenance.xlsx

Interpretação

A análise de regressão mostra que, com o aumento da frequência de manutenção, o tempo de inatividade não planejado inicialmente diminui significativamente. A partir de uma frequência de manutenção de cerca de 4–5 manutenções por mês, o efeito se estabiliza. O modelo cúbico representa visivelmente essa utilidade marginal decrescente e descreve muito bem os valores medidos. Nesta representação, os gráficos residuais foram deliberadamente não exibidos, então a interpretação é baseada na progressão do modelo e nas tabelas de resultados.

No service desk de TI, é investigado se a idade de um ticket tem impacto no tempo de processamento. Suspeita-se que tickets mais antigos são frequentemente mais complexos ou foram escalados várias vezes, causando assim tempos de processamento mais longos. Para vários tickets, a idade do ticket no momento do processamento e o tempo de processamento real são registrados e documentados como pares de valores. A análise de regressão é usada para verificar se há uma correlação entre a idade do ticket e o tempo de processamento.

Download Você pode baixar os dados aqui: ProcessingTimeITTickets_Age.xlsx

Interpretação

A análise de regressão mostra uma forte dispersão dos tempos de processamento em todas as idades dos tickets. O modelo linear explica apenas uma pequena parte da dispersão; o valor p da regressão não é significativo o suficiente para derivar uma relação linear clara. Os resíduos não fornecem uma indicação clara de que o modelo linear explica a dispersão de forma significativa. Portanto, a idade do ticket sozinha não é um preditor adequado para o tempo de processamento.

Nas vendas, ofertas de vendas são criadas para os clientes. Deve-se investigar se a duração do processo de oferta tem impacto na taxa de vendas. Para várias ofertas, a duração da oferta (tempo desde a criação da oferta até a decisão) e a taxa de vendas resultante são registradas e documentadas como pares de valores. A análise de regressão é usada para verificar se é reconhecível uma conexão entre a duração da oferta e a taxa de vendas.

Download Você pode baixar os dados aqui: Sales_ConversionRateQuoteDuration.xlsx

Interpretação

A análise de regressão mostra a conexão entre a duração da oferta e a taxa de vendas. A tendência não é linear; portanto, um modelo quadrático foi utilizado. O modelo de regressão descreve uma tendência em forma de U: em durações de oferta médias, a taxa de vendas é menor, em durações de oferta muito curtas e mais longas, é maior. As métricas do modelo mostram uma conexão explicável, mas os resíduos ainda mostram dispersão. Portanto, o modelo deve ser revisado profissionalmente e não deve ser usado sem contexto para previsões fora do intervalo observado. O diagrama ilustra que a conexão entre a duração da oferta e a taxa de vendas não pode ser descrita de forma significativa por uma linha simples.

Na logística, os pedidos dos clientes são processados através de vários centros de logística. Deve-se investigar se a quantidade de entrega tem impacto no tempo de entrega. Para vários pedidos, a quantidade de entrega e o tempo de entrega real são registrados e documentados como pares de valores. Usando análise de regressão, verifica-se se uma conexão entre a quantidade de entrega e o tempo de entrega é reconhecível.

Download Você pode baixar os dados aqui: Logistics_DeliveryTimeDeliveryQuantity.xlsx

Interpretação

A análise de regressão mostra apenas uma correlação fraca a moderada entre o tempo de entrega e a quantidade de entrega. Os resíduos se dispersam significativamente em torno da linha zero. No diagrama de resíduos vs. ajuste, desvios individuais maiores são reconhecíveis; a dispersão parece significativa no geral. A série temporal dos resíduos também mostra uma tendência ascendente. Isso pode indicar que a ordem dos dados ou outros fatores influentes desempenham um papel. Portanto, a quantidade de entrega sozinha explica apenas parcialmente o tempo de entrega.

Na compra, é examinado se a duração do tempo de espera do pedido tem impacto na entrega pontual. Suspeita-se que tempos de espera mais longos melhoram o planejamento e, assim, aumentam a taxa de entrega pontual. Para vários pedidos, o tempo de espera (tempo entre o pedido e a data de entrega planejada) e a taxa real de entrega pontual são registrados e documentados como pares de valores. A análise de regressão é usada para verificar se uma relação entre o tempo de espera e a taxa de entrega pontual é discernível.

Download Você pode baixar os dados aqui: Procurement_OnTimeDeliveriesOrderTiming.xlsx

Interpretação

A análise de regressão mostra uma relação linear positiva entre o tempo de espera e a taxa de entrega pontual. À medida que o tempo de espera aumenta, a taxa de entrega pontual sobe. Os pontos estão próximos da linha de regressão. O resumo do modelo mostra uma alta variância explicada, e a análise de variância indica um modelo estatisticamente significativo. Nesta representação, os gráficos de resíduos não foram exibidos deliberadamente, pois a relação linear já é claramente visível no diagrama principal e nas tabelas de resultados.

No planejamento de produção, as previsões são ajustadas usando um fator de correção para compensar a superestimação ou subestimação sistemática. Deve-se examinar como o nível do fator de correção aplicado afeta o desvio de previsão restante. Para várias previsões, o fator de correção utilizado e o desvio de previsão real são registrados e documentados como pares de valores. A análise de regressão é usada para verificar se uma relação entre o fator de correção e o desvio de previsão é discernível.

Download Você pode baixar os dados aqui: PlanningDeviation_CorrectionFactor.xlsx

Interpretação

A análise de regressão mostra uma clara relação negativa entre o fator de correção e o desvio de previsão. No entanto, os gráficos de resíduos mostram que os desvios não estão completamente distribuídos aleatoriamente. No gráfico de Resíduos vs. Ajuste, uma leve estrutura é reconhecível, e na série temporal de resíduos, há áreas contíguas com resíduos positivos ou negativos. O modelo descreve a relação fundamental, mas os resíduos sugerem que outros fatores de influência ou efeitos sistemáticos podem desempenhar um papel.

Análise de Regressão
Método para descrever uma relação entre uma variável independente e uma variável dependente através de um modelo matemático.
Modelo de Regressão
Função matemática que melhor descreve a tendência dos dados.
Variável Independente (x)
Variável cuja influência sobre outra variável está sendo investigada.
Variável Dependente (y)
Variável que deve ser descrita ou prevista pela variável independente.
Par de Valores
Medições associadas de variáveis independentes e dependentes.
Relação Linear
Relação onde os valores se alinham aproximadamente ao longo de uma linha reta.
Relação Não-linear
Relação onde a tendência não pode ser descrita por uma linha reta.
Residual
Desvio entre o valor medido e o valor calculado pelo modelo.
S
Tamanho típico dos desvios entre os valores medidos e os valores do modelo.
R-Quadrado
Coefficient de determinação; indica qual proporção da variância é explicada pelo modelo.
R-Quadrado (ajustado)
Coefficient de determinação ajustado; considera adicionalmente o número de termos do modelo.
ANOVA
Análise de variância para decompor a variância em partes explicadas e não explicadas.
Causalidade
Relação de causa e efeito entre duas variáveis que não pode ser derivada apenas de uma análise de regressão.

Para o cálculo, é utilizado um modelo de regressão.

y = a₀ + a₁x
Modelo linear (1ª ordem)
y = a₀ + a₁x + a₂x²
Modelo quadrático (2ª ordem)
y = a₀ + a₁x + a₂x² + a₃x³
Modelo cúbico (3ª ordem)
y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴
Polinômio de 4ª ordem
y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ + a₅x⁵
Polinômio de 5ª ordem
y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ + a₅x⁵ + a₆x⁶
Polinômio de 6ª ordem
Carrinho
Análise de regressão Alemão Análise de regressão Inglês Análise de regressão Espanhol Análise de regressão Italiano Análise de regressão Francês Análise de regressão Polaco Análise de regressão Português