Alphadi Tab - Aperçu de l'outil

Analyse de régression

L'analyse de régression est utilisée pour la description graphique et computationnelle de la relation entre deux quantités variables. Elle répond à la question de savoir si, dans quelle direction et avec quel modèle une variable cible peut être décrite par une variable d'influence.

Chaque point du diagramme représente une paire de valeurs d'une variable d'influence (x) et d'une variable cible (y). De plus, un modèle de régression est calculé qui décrit mathématiquement le cours des données.

L'analyse de régression est particulièrement adaptée pour :

  • l'étude des facteurs d'influence sur une variable cible
  • les mesures continues (par exemple, temps, température, quantité, viscosité)
  • la description et l'évaluation d'une relation avec un modèle de régression

Dans le département de développement de nouvelles sauces tomates, on étudie comment le temps de cuisson affecte la viscosité du produit. À cette fin, des sauces tomates avec différents temps de cuisson sont produites dans plusieurs séries de tests. Pour chaque série de tests, le temps de cuisson et la viscosité résultante sont mesurés et enregistrés comme une paire de valeurs. Une analyse de régression est utilisée pour étudier quel modèle décrit la relation entre le temps de cuisson et la viscosité dans les données de mesure.

La relation de base est connue professionnellement : une cuisson plus longue évapore l'eau, ce qui entraîne généralement une viscosité plus élevée de la sauce tomate.

 

Download Vous pouvez télécharger les données ici : TomatoSauce_CookingTimeViscosity.xlsx

 

 

Interprétation des résultats :

Le nuage de points montre une relation positive claire entre le temps de cuisson et la viscosité. À mesure que le temps de cuisson augmente, la viscosité de la sauce tomate augmente. L'équation de régression décrit cette relation à travers un modèle linéaire. Le modèle montre de combien la viscosité augmente en moyenne lorsque le temps de cuisson augmente.

Le résumé du modèle montre un R-carré élevé. Ainsi, le modèle explique une grande partie de la variation de la viscosité. Le R-carré ajusté est également proche du R-carré, rendant le modèle linéaire plausible pour cet exemple. L'analyse de variance montre une petite valeur p. Cela suggère que la relation entre le temps de cuisson et la viscosité est statistiquement significative.

Les graphiques des résidus apparaissent globalement peu remarquables. Dans le graphique des résidus vs. ajustement, les points se dispersent principalement de manière aléatoire autour de 0. Le graphique de probabilité et l'histogramme ne montrent pas de fortes déviations par rapport à une distribution approximativement normale. Aucune tendance claire n'est visible dans la série chronologique des résidus.

Dans l'ensemble, le modèle de régression linéaire décrit bien la relation entre le temps de cuisson et la viscosité dans cet exemple.

 

Explications des résultats :

La sortie de l'analyse de régression se compose du nuage de points avec la ligne de régression, de l'équation de régression, du résumé du modèle, de l'analyse de variance et éventuellement des graphiques des résidus.

Le nuage de points montre les valeurs mesurées sous forme de points. La ligne de régression décrit la relation calculée entre la variable indépendante x et la variable dépendante y.

L'équation de régression décrit cette relation mathématiquement. Elle peut être utilisée pour estimer la variable dépendante dans la plage de données considérée.

Le résumé du modèle montre des métriques pour la qualité du modèle. S décrit la déviation typique des valeurs mesurées par rapport à la ligne de régression. Le R-carré montre quelle proportion de la variation est expliquée par le modèle. Le R-carré (ajusté) est le R-carré ajusté et prend en compte le nombre de termes du modèle.

L'analyse de variance montre comment la variation des données est répartie sur la régression, l'erreur et la variation totale. La valeur p aide à évaluer si la relation est statistiquement détectable.

Les graphiques des résidus montrent les déviations entre les valeurs mesurées et les valeurs du modèle. Les résidus devraient se disperser de manière aussi aléatoire que possible autour de 0. Des motifs remarquables peuvent indiquer que le modèle ne décrit pas complètement toutes les relations.

Graphique de probabilité des résidus
Le graphique de probabilité montre si les résidus sont approximativement distribués normalement.
  • Les points devraient se situer approximativement sur une ligne droite.
  • Des courbures fortes ou des motifs en forme de S plaident contre une distribution normale.
  • Des points individuels éloignés peuvent indiquer des valeurs aberrantes.
Pourquoi est-ce important ?
Une distribution normale approximative des résidus est importante lors de l'interprétation de métriques telles que les valeurs p ou les intervalles de confiance.
Résidus vs. Ajustement
Ce graphique montre les résidus par rapport aux valeurs du modèle calculées.
  • Les points devraient se disperser aléatoirement autour de la ligne zéro.
  • Une courbe suggère qu'un modèle linéaire ne décrit pas adéquatement la courbure.
  • Une forme d'entonnoir suggère que la variation n'est pas constante.
  • Des points individuels éloignés peuvent être des valeurs aberrantes.
Pourquoi est-ce important ?
Le graphique montre si le modèle s'adapte également bien sur toute la plage de valeurs.
Histogramme des résidus
L'histogramme montre la distribution des résidus.
  • La distribution devrait être approximativement symétrique autour de 0.
  • Une distribution fortement asymétrique peut indiquer des valeurs aberrantes ou un modèle inadapté.
  • Des pics multiples peuvent indiquer que différents groupes ou états de processus ont été mélangés.
Pourquoi est-ce important ?
L'histogramme complète le graphique de probabilité et aide à évaluer visuellement la distribution des déviations.
Série chronologique des résidus
La série chronologique des résidus montre les résidus dans l'ordre des points de données.
  • Les points devraient fluctuer aléatoirement autour de 0.
  • Une tendance croissante ou décroissante indique un changement temporel.
  • Des motifs récurrents peuvent indiquer des cycles, des lots ou des changements de processus.
  • De longues séquences de résidus uniquement positifs ou uniquement négatifs montrent que le modèle surestime ou sous-estime systématiquement certaines zones.
Pourquoi est-ce important ?
Le graphique montre si l'ordre des mesures est important. Cela est particulièrement important pour les données de processus ou de temps.

Dans l'analyse de régression, vous pouvez sélectionner divers modèles et sorties :

Sélection dans l'outil Type de modèle Équation générale
Linéaire Polynôme de degré 1 y = a₀ + a₁x
Quadratique Polynôme de degré 2 y = a₀ + a₁x + a₂x²
Cubique Polynôme de degré 3 y = a₀ + a₁x + a₂x² + a₃x³
Polynôme de degré 4 Polynôme de degré 4 y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴
Polynôme de degré 5 Polynôme de degré 5 y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ + a₅x⁵
Polynôme de degré 6 Polynôme de degré 6 y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ + a₅x⁵ + a₆x⁶

Ce qui suit s'applique :

  • y = variable cible
  • x = variable influente
  • a₀ = intercept
  • a₁ à a₆ = coefficients du modèle

Préparation

  1. Définir la variable cible (y) (par exemple, la viscosité de la sauce tomate)
  2. Définir la variable influente (x) (par exemple, le temps de cuisson)
  3. Assurez-vous que les deux variables sont des mesures quantitatives
  4. Collecter des données

AlphadiTab Utiliser dans AlphadiTab

  1. Sélectionnez l'outil Analyse de régression dans la Phase de mesure
  2. Sélectionnez la colonne du temps de cuisson pour Données X
  3. Sélectionnez la colonne de viscosité pour Données Y
  4. Sélectionnez le modèle souhaité pour la Régression, par exemple, linéaire ou polynomial de degré 2
  5. Optionnel : Afficher les graphiques des résidus
  6. Confirmer avec Mettre à jour

Interprétation

  1. Vérifiez si une relation entre les axes x et y est apparente
  2. Évaluer si le modèle de régression décrit la tendance de manière sensée
  3. Evaluer les métriques du modèle telles que S, R-carré et R-carré (ajusté)
  4. Examiner les résidus pour identifier des anomalies ou des motifs systématiques

Considération générale

  1. Les points sont-ils ordonnés ou distribués aléatoirement?
  2. Une tendance des points est-elle reconnaissable?
  3. Le modèle de régression choisi correspond-il à la tendance?
  4. La relation est-elle positive ou négative?
  5. Si la tendance est courbée : Un degré polynomial plus élevé est-il techniquement significatif?
  6. La dispersion des points autour du modèle est-elle petite ou grande?

Note : Un bon modèle de régression ne signifie pas nécessairement qu'une variable est la cause de l'autre.

Variables quantitatives
Les données doivent être disponibles sous forme de variables quantitatives, ce qui signifie qu'elles peuvent être comptées ou mesurées.
Pourquoi est-ce important ?
L'analyse de régression calcule les écarts et les composantes de variance. Des valeurs numériques sont nécessaires pour cela.
Valeurs x suffisamment différentes
Pour le modèle de régression choisi, il doit y avoir suffisamment de valeurs x différentes disponibles.
Pourquoi est-ce important ?
  • Plus le degré du polynôme est élevé, plus il faut de valeurs x différentes pour pouvoir ajuster le modèle.
  • Avec trop peu de valeurs x différentes, le modèle de régression ne peut pas être calculé ou interprété de manière fiable.
Lorsqu'une seule variable est considérée et qu'aucune relation n'est à modéliser
Histogramme ou Boîte à moustaches
Lorsque l'influence d'un facteur nominal doit être examinée
Test d'hypothèse
Lorsque l'accent est mis sur les évolutions temporelles
Graphique de séries temporelles
Lorsqu'une relation doit être vérifiée visuellement au départ
Diagramme de corrélation ou Nuage de points

Dans le développement d'un nouveau composant, il est étudié comment le temps de refroidissement après traitement thermique affecte la dureté du matériau. On soupçonne qu'un temps de refroidissement plus long entraîne une dureté du matériau plus faible.

 

Download Vous pouvez télécharger les données ici : MaterialHardnessCoolingTime.xlsx

Interprétation

L'analyse de régression montre une corrélation négative : à mesure que le temps de refroidissement augmente, la dureté du matériau diminue. Cependant, les graphiques des résidus doivent être examinés de manière critique. Dans le graphique Résidus vs Ajustement, les résidus ne sont pas distribués de manière aléatoire mais montrent un schéma récurrent. La série chronologique des résidus semble également régulière et non aléatoire. Cela montre clairement que bien que les données montrent une tendance claire, les résidus ne semblent pas être des écarts de mesure aléatoires. Le modèle décrit la corrélation mais ne doit pas être interprété comme un exemple idéal de résidus discrets.

En production, une caractéristique de qualité est mesurée en ligne, par exemple, la quantité de remplissage. Dans l'assurance qualité, la même caractéristique est vérifiée à nouveau avec un instrument de mesure distinct. Pour étudier si les mesures de production et d'assurance qualité sont cohérentes entre elles, les deux mesures sont enregistrées sous forme de paire de valeurs et présentées dans une analyse de régression.

Download Vous pouvez télécharger les données ici : QAProductionWeight.xlsx

Interprétation

L'analyse de régression montre une corrélation positive claire entre la mesure de production et la mesure d'assurance qualité. Cependant, les graphiques des résidus indiquent une déviation systématique. Dans le graphique Résidus vs. Ajustés, un motif courbé est visible : les résidus ne se dispersent pas aléatoirement autour de 0 mais changent sur la plage de mesure. La série chronologique des résidus montre également une tendance notable. Cela suggère qu'un modèle linéaire simple ne décrit pas entièrement la relation. En pratique, il devrait être vérifié s'il existe une plage de mesure ou un effet de calibration.

En production, il est examiné comment la fréquence de maintenance affecte le temps d'arrêt imprévu des machines. On suppose qu'une maintenance régulière réduit les temps d'arrêt imprévus, mais cet effet diminue au-delà d'une certaine fréquence de maintenance. Pour plusieurs machines, le nombre de maintenances par mois et le temps d'arrêt imprévu pendant la même période sont enregistrés et documentés sous forme de paires de valeurs. Une analyse de régression est utilisée pour vérifier s'il existe une corrélation et si un effet de saturation peut être observé.

Télécharger Vous pouvez télécharger les données ici : Downtimes_Maintenance.xlsx

Interprétation

L'analyse de régression montre qu'avec l'augmentation de la fréquence de maintenance, le temps d'arrêt imprévu diminue initialement de manière significative. À partir d'une fréquence de maintenance d'environ 4–5 maintenances par mois, l'effet se stabilise. Le modèle cubique représente visiblement cette utilité marginale décroissante et décrit très bien les valeurs mesurées. Dans cette représentation, les graphiques résiduels n'ont délibérément pas été affichés, donc l'interprétation est basée sur la progression du modèle et les tableaux de résultats.

Au service d'assistance informatique, il est étudié si l'âge d'un ticket a un impact sur le temps de traitement. On soupçonne que les tickets plus anciens sont souvent plus complexes ou ont été escaladés plusieurs fois, ce qui entraîne des temps de traitement plus longs. Pour plusieurs tickets, l'âge du ticket au moment du traitement et le temps de traitement réel sont enregistrés et documentés sous forme de paires de valeurs. Une analyse de régression est utilisée pour vérifier s'il existe une corrélation entre l'âge du ticket et le temps de traitement.

Download Vous pouvez télécharger les données ici : ProcessingTimeITTickets_Age.xlsx

Interprétation

L'analyse de régression montre une forte dispersion des temps de traitement pour tous les âges de tickets. Le modèle linéaire n'explique qu'une petite partie de la dispersion ; la valeur p de la régression n'est pas suffisamment significative pour en déduire une relation linéaire claire. Les résidus ne fournissent pas d'indication claire que le modèle linéaire explique la dispersion de manière significative. Par conséquent, l'âge du ticket seul n'est pas un prédicteur approprié pour le temps de traitement.

Dans les ventes, des offres commerciales sont créées pour les clients. Il convient d'examiner si la durée du processus d'offre a un impact sur le taux de vente. Pour plusieurs offres, la durée de l'offre (temps entre la création de l'offre et la décision) et le taux de vente résultant sont enregistrés et documentés sous forme de paires de valeurs. Une analyse de régression est utilisée pour vérifier si une connexion entre la durée de l'offre et le taux de vente est reconnaissable.

Télécharger Vous pouvez télécharger les données ici : Sales_ConversionRateQuoteDuration.xlsx

Interprétation

L'analyse de régression montre la connexion entre la durée de l'offre et le taux de vente. La tendance n'est pas linéaire ; par conséquent, un modèle quadratique a été utilisé. Le modèle de régression décrit une tendance en forme de U : pour des durées d'offre moyennes, le taux de vente est plus bas, pour des durées d'offre très courtes et plus longues, il est plus élevé. Les métriques du modèle montrent une connexion explicable, mais les résidus montrent encore une dispersion. Par conséquent, le modèle doit être examiné professionnellement et ne doit pas être utilisé sans contexte pour des prévisions en dehors de la plage observée. Le diagramme illustre que la connexion entre la durée de l'offre et le taux de vente ne peut pas être décrite de manière significative par une simple ligne.

Dans la logistique, les commandes des clients sont traitées à travers plusieurs centres logistiques. Il convient d'examiner si la quantité de livraison a un impact sur le délai de livraison. Pour plusieurs commandes, la quantité de livraison et le délai de livraison réel sont enregistrés et documentés sous forme de paires de valeurs. À l'aide d'une analyse de régression, il est vérifié si une relation entre la quantité de livraison et le délai de livraison est reconnaissable.

Download Vous pouvez télécharger les données ici : Logistics_DeliveryTimeDeliveryQuantity.xlsx

Interprétation

L'analyse de régression montre seulement une corrélation faible à modérée entre le délai de livraison et la quantité de livraison. Les résidus se dispersent de manière significative autour de la ligne zéro. Dans le diagramme des résidus vs. ajustement, des écarts individuels plus importants sont reconnaissables ; la dispersion semble significative dans l'ensemble. La série chronologique des résidus montre également une tendance à la hausse. Cela peut indiquer que l'ordre des données ou d'autres facteurs influents jouent un rôle. Par conséquent, la quantité de livraison seule n'explique que partiellement le délai de livraison.

Dans les achats, on examine si la durée du délai de commande a un impact sur la livraison à temps. On soupçonne que des délais plus longs améliorent la planification et augmentent ainsi le taux de livraison à temps. Pour plusieurs commandes, le délai (temps entre la commande et la date de livraison prévue) et le taux de livraison à temps réel sont enregistrés et documentés sous forme de paires de valeurs. Une analyse de régression est utilisée pour vérifier si une relation entre le délai et le taux de livraison à temps est discernable.

Download Vous pouvez télécharger les données ici : Procurement_OnTimeDeliveriesOrderTiming.xlsx

Interprétation

L'analyse de régression montre une relation linéaire positive entre le délai et le taux de livraison à temps. À mesure que le délai augmente, le taux de livraison à temps augmente. Les points sont proches de la ligne de régression. Le résumé du modèle montre une variance expliquée élevée, et l'analyse de variance indique un modèle statistiquement significatif. Dans cette représentation, les graphiques résiduels n'ont pas été délibérément affichés, car la relation linéaire est déjà clairement visible dans le diagramme principal et dans les tableaux de résultats.

Dans la planification de la production, les prévisions sont ajustées à l'aide d'un facteur de correction pour compenser les sur- ou sous-prévisions systématiques. Il convient d'examiner comment le niveau du facteur de correction appliqué affecte la déviation de prévision restante. Pour plusieurs prévisions, le facteur de correction utilisé et la déviation de prévision réelle sont enregistrés et documentés sous forme de paires de valeurs. Une analyse de régression est utilisée pour vérifier si une relation entre le facteur de correction et la déviation de prévision est discernable.

Download Vous pouvez télécharger les données ici : PlanningDeviation_CorrectionFactor.xlsx

Interprétation

L'analyse de régression montre une relation négative claire entre le facteur de correction et la déviation de prévision. Cependant, les graphiques des résidus montrent que les déviations ne sont pas complètement distribuées de manière aléatoire. Dans le graphique Résidus vs. Ajustement, une légère structure est reconnaissable, et dans la série temporelle des résidus, il y a des zones contiguës avec des résidus positifs ou négatifs. Le modèle décrit la relation fondamentale, mais les résidus suggèrent que d'autres facteurs d'influence ou effets systématiques peuvent jouer un rôle.

Analyse de régression
Méthode pour décrire une relation entre une variable indépendante et une variable dépendante à travers un modèle mathématique.
Modèle de régression
Fonction mathématique qui décrit le mieux la tendance des données.
Variable indépendante (x)
Variable dont l'influence sur une autre variable est étudiée.
Variable dépendante (y)
Variable qui doit être décrite ou prédite par la variable indépendante.
Paire de valeurs
Mesures associées des variables indépendantes et dépendantes.
Relation linéaire
Relation où les valeurs s'alignent approximativement le long d'une ligne droite.
Relation non linéaire
Relation où la tendance ne peut pas être décrite par une ligne droite.
Résidu
Déviation entre la valeur mesurée et la valeur calculée du modèle.
S
Taille typique des déviations entre les valeurs mesurées et les valeurs du modèle.
R-carré
Coefficient de détermination ; indique quelle proportion de la variance est expliquée par le modèle.
R-carré (ajusté)
Coefficient de détermination ajusté ; prend également en compte le nombre de termes du modèle.
ANOVA
Analyse de la variance pour décomposer la variance en parties expliquées et inexpliquées.
Causalité
Relation de cause à effet entre deux variables qui ne peut pas être dérivée d'une analyse de régression seule.

Pour le calcul, un modèle de régression est utilisé.

y = a₀ + a₁x
Modèle linéaire (1er ordre)
y = a₀ + a₁x + a₂x²
Modèle quadratique (2e ordre)
y = a₀ + a₁x + a₂x² + a₃x³
Modèle cubique (3e ordre)
y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴
Polynôme 4e ordre
y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ + a₅x⁵
Polynôme 5e ordre
y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ + a₅x⁵ + a₆x⁶
Polynôme 6e ordre
Panier
Analyse de régression Allemand Analyse de régression Anglais Analyse de régression Espagnol Analyse de régression Italien Analyse de régression Français Analyse de régression Polonais Analyse de régression Portugais