L'analyse de régression est utilisée pour la description graphique et computationnelle de la relation entre deux quantités variables. Elle répond à la question de savoir si, dans quelle direction et avec quel modèle une variable cible peut être décrite par une variable d'influence.
Chaque point du diagramme représente une paire de valeurs d'une variable d'influence (x) et d'une variable cible (y). De plus, un modèle de régression est calculé qui décrit mathématiquement le cours des données.
L'analyse de régression est particulièrement adaptée pour :
- l'étude des facteurs d'influence sur une variable cible
- les mesures continues (par exemple, temps, température, quantité, viscosité)
- la description et l'évaluation d'une relation avec un modèle de régression
Dans le département de développement de nouvelles sauces tomates, on étudie comment le temps de cuisson affecte la viscosité du produit. À cette fin, des sauces tomates avec différents temps de cuisson sont produites dans plusieurs séries de tests. Pour chaque série de tests, le temps de cuisson et la viscosité résultante sont mesurés et enregistrés comme une paire de valeurs. Une analyse de régression est utilisée pour étudier quel modèle décrit la relation entre le temps de cuisson et la viscosité dans les données de mesure.
La relation de base est connue professionnellement : une cuisson plus longue évapore l'eau, ce qui entraîne généralement une viscosité plus élevée de la sauce tomate.
Vous pouvez télécharger les données ici : TomatoSauce_CookingTimeViscosity.xlsx
Interprétation des résultats :
Le nuage de points montre une relation positive claire entre le temps de cuisson et la viscosité. À mesure que le temps de cuisson augmente, la viscosité de la sauce tomate augmente. L'équation de régression décrit cette relation à travers un modèle linéaire. Le modèle montre de combien la viscosité augmente en moyenne lorsque le temps de cuisson augmente.
Le résumé du modèle montre un R-carré élevé. Ainsi, le modèle explique une grande partie de la variation de la viscosité. Le R-carré ajusté est également proche du R-carré, rendant le modèle linéaire plausible pour cet exemple. L'analyse de variance montre une petite valeur p. Cela suggère que la relation entre le temps de cuisson et la viscosité est statistiquement significative.
Les graphiques des résidus apparaissent globalement peu remarquables. Dans le graphique des résidus vs. ajustement, les points se dispersent principalement de manière aléatoire autour de 0. Le graphique de probabilité et l'histogramme ne montrent pas de fortes déviations par rapport à une distribution approximativement normale. Aucune tendance claire n'est visible dans la série chronologique des résidus.
Dans l'ensemble, le modèle de régression linéaire décrit bien la relation entre le temps de cuisson et la viscosité dans cet exemple.
Explications des résultats :
La sortie de l'analyse de régression se compose du nuage de points avec la ligne de régression, de l'équation de régression, du résumé du modèle, de l'analyse de variance et éventuellement des graphiques des résidus.
Le nuage de points montre les valeurs mesurées sous forme de points. La ligne de régression décrit la relation calculée entre la variable indépendante x et la variable dépendante y.
L'équation de régression décrit cette relation mathématiquement. Elle peut être utilisée pour estimer la variable dépendante dans la plage de données considérée.
Le résumé du modèle montre des métriques pour la qualité du modèle. S décrit la déviation typique des valeurs mesurées par rapport à la ligne de régression. Le R-carré montre quelle proportion de la variation est expliquée par le modèle. Le R-carré (ajusté) est le R-carré ajusté et prend en compte le nombre de termes du modèle.
L'analyse de variance montre comment la variation des données est répartie sur la régression, l'erreur et la variation totale. La valeur p aide à évaluer si la relation est statistiquement détectable.
Les graphiques des résidus montrent les déviations entre les valeurs mesurées et les valeurs du modèle. Les résidus devraient se disperser de manière aussi aléatoire que possible autour de 0. Des motifs remarquables peuvent indiquer que le modèle ne décrit pas complètement toutes les relations.
- Les points devraient se situer approximativement sur une ligne droite.
- Des courbures fortes ou des motifs en forme de S plaident contre une distribution normale.
- Des points individuels éloignés peuvent indiquer des valeurs aberrantes.
- Les points devraient se disperser aléatoirement autour de la ligne zéro.
- Une courbe suggère qu'un modèle linéaire ne décrit pas adéquatement la courbure.
- Une forme d'entonnoir suggère que la variation n'est pas constante.
- Des points individuels éloignés peuvent être des valeurs aberrantes.
- La distribution devrait être approximativement symétrique autour de 0.
- Une distribution fortement asymétrique peut indiquer des valeurs aberrantes ou un modèle inadapté.
- Des pics multiples peuvent indiquer que différents groupes ou états de processus ont été mélangés.
- Les points devraient fluctuer aléatoirement autour de 0.
- Une tendance croissante ou décroissante indique un changement temporel.
- Des motifs récurrents peuvent indiquer des cycles, des lots ou des changements de processus.
- De longues séquences de résidus uniquement positifs ou uniquement négatifs montrent que le modèle surestime ou sous-estime systématiquement certaines zones.
Dans l'analyse de régression, vous pouvez sélectionner divers modèles et sorties :
| Sélection dans l'outil | Type de modèle | Équation générale |
|---|---|---|
| Linéaire | Polynôme de degré 1 | y = a₀ + a₁x |
| Quadratique | Polynôme de degré 2 | y = a₀ + a₁x + a₂x² |
| Cubique | Polynôme de degré 3 | y = a₀ + a₁x + a₂x² + a₃x³ |
| Polynôme de degré 4 | Polynôme de degré 4 | y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ |
| Polynôme de degré 5 | Polynôme de degré 5 | y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ + a₅x⁵ |
| Polynôme de degré 6 | Polynôme de degré 6 | y = a₀ + a₁x + a₂x² + a₃x³ + a₄x⁴ + a₅x⁵ + a₆x⁶ |
Ce qui suit s'applique :
- y = variable cible
- x = variable influente
- a₀ = intercept
- a₁ à a₆ = coefficients du modèle
Préparation
- Définir la variable cible (y) (par exemple, la viscosité de la sauce tomate)
- Définir la variable influente (x) (par exemple, le temps de cuisson)
- Assurez-vous que les deux variables sont des mesures quantitatives
- Collecter des données
Utiliser dans AlphadiTab
- Sélectionnez l'outil Analyse de régression dans la Phase de mesure
- Sélectionnez la colonne du temps de cuisson pour Données X
- Sélectionnez la colonne de viscosité pour Données Y
- Sélectionnez le modèle souhaité pour la Régression, par exemple, linéaire ou polynomial de degré 2
- Optionnel : Afficher les graphiques des résidus
- Confirmer avec Mettre à jour
Interprétation
- Vérifiez si une relation entre les axes x et y est apparente
- Évaluer si le modèle de régression décrit la tendance de manière sensée
- Evaluer les métriques du modèle telles que S, R-carré et R-carré (ajusté)
- Examiner les résidus pour identifier des anomalies ou des motifs systématiques
Considération générale
- Les points sont-ils ordonnés ou distribués aléatoirement?
- Une tendance des points est-elle reconnaissable?
- Le modèle de régression choisi correspond-il à la tendance?
- La relation est-elle positive ou négative?
- Si la tendance est courbée : Un degré polynomial plus élevé est-il techniquement significatif?
- La dispersion des points autour du modèle est-elle petite ou grande?
Note : Un bon modèle de régression ne signifie pas nécessairement qu'une variable est la cause de l'autre.
- Plus le degré du polynôme est élevé, plus il faut de valeurs x différentes pour pouvoir ajuster le modèle.
- Avec trop peu de valeurs x différentes, le modèle de régression ne peut pas être calculé ou interprété de manière fiable.
Dans le développement d'un nouveau composant, il est étudié comment le temps de refroidissement après traitement thermique affecte la dureté du matériau. On soupçonne qu'un temps de refroidissement plus long entraîne une dureté du matériau plus faible.
Vous pouvez télécharger les données ici : MaterialHardnessCoolingTime.xlsx
Interprétation
L'analyse de régression montre une corrélation négative : à mesure que le temps de refroidissement augmente, la dureté du matériau diminue. Cependant, les graphiques des résidus doivent être examinés de manière critique. Dans le graphique Résidus vs Ajustement, les résidus ne sont pas distribués de manière aléatoire mais montrent un schéma récurrent. La série chronologique des résidus semble également régulière et non aléatoire. Cela montre clairement que bien que les données montrent une tendance claire, les résidus ne semblent pas être des écarts de mesure aléatoires. Le modèle décrit la corrélation mais ne doit pas être interprété comme un exemple idéal de résidus discrets.
En production, une caractéristique de qualité est mesurée en ligne, par exemple, la quantité de remplissage. Dans l'assurance qualité, la même caractéristique est vérifiée à nouveau avec un instrument de mesure distinct. Pour étudier si les mesures de production et d'assurance qualité sont cohérentes entre elles, les deux mesures sont enregistrées sous forme de paire de valeurs et présentées dans une analyse de régression.
Vous pouvez télécharger les données ici : QAProductionWeight.xlsx
Interprétation
L'analyse de régression montre une corrélation positive claire entre la mesure de production et la mesure d'assurance qualité. Cependant, les graphiques des résidus indiquent une déviation systématique. Dans le graphique Résidus vs. Ajustés, un motif courbé est visible : les résidus ne se dispersent pas aléatoirement autour de 0 mais changent sur la plage de mesure. La série chronologique des résidus montre également une tendance notable. Cela suggère qu'un modèle linéaire simple ne décrit pas entièrement la relation. En pratique, il devrait être vérifié s'il existe une plage de mesure ou un effet de calibration.
En production, il est examiné comment la fréquence de maintenance affecte le temps d'arrêt imprévu des machines. On suppose qu'une maintenance régulière réduit les temps d'arrêt imprévus, mais cet effet diminue au-delà d'une certaine fréquence de maintenance. Pour plusieurs machines, le nombre de maintenances par mois et le temps d'arrêt imprévu pendant la même période sont enregistrés et documentés sous forme de paires de valeurs. Une analyse de régression est utilisée pour vérifier s'il existe une corrélation et si un effet de saturation peut être observé.
Vous pouvez télécharger les données ici : Downtimes_Maintenance.xlsx
Interprétation
L'analyse de régression montre qu'avec l'augmentation de la fréquence de maintenance, le temps d'arrêt imprévu diminue initialement de manière significative. À partir d'une fréquence de maintenance d'environ 4–5 maintenances par mois, l'effet se stabilise. Le modèle cubique représente visiblement cette utilité marginale décroissante et décrit très bien les valeurs mesurées. Dans cette représentation, les graphiques résiduels n'ont délibérément pas été affichés, donc l'interprétation est basée sur la progression du modèle et les tableaux de résultats.
Au service d'assistance informatique, il est étudié si l'âge d'un ticket a un impact sur le temps de traitement. On soupçonne que les tickets plus anciens sont souvent plus complexes ou ont été escaladés plusieurs fois, ce qui entraîne des temps de traitement plus longs. Pour plusieurs tickets, l'âge du ticket au moment du traitement et le temps de traitement réel sont enregistrés et documentés sous forme de paires de valeurs. Une analyse de régression est utilisée pour vérifier s'il existe une corrélation entre l'âge du ticket et le temps de traitement.
Vous pouvez télécharger les données ici : ProcessingTimeITTickets_Age.xlsx
Interprétation
L'analyse de régression montre une forte dispersion des temps de traitement pour tous les âges de tickets. Le modèle linéaire n'explique qu'une petite partie de la dispersion ; la valeur p de la régression n'est pas suffisamment significative pour en déduire une relation linéaire claire. Les résidus ne fournissent pas d'indication claire que le modèle linéaire explique la dispersion de manière significative. Par conséquent, l'âge du ticket seul n'est pas un prédicteur approprié pour le temps de traitement.
Dans les ventes, des offres commerciales sont créées pour les clients. Il convient d'examiner si la durée du processus d'offre a un impact sur le taux de vente. Pour plusieurs offres, la durée de l'offre (temps entre la création de l'offre et la décision) et le taux de vente résultant sont enregistrés et documentés sous forme de paires de valeurs. Une analyse de régression est utilisée pour vérifier si une connexion entre la durée de l'offre et le taux de vente est reconnaissable.
Vous pouvez télécharger les données ici : Sales_ConversionRateQuoteDuration.xlsx
Interprétation
L'analyse de régression montre la connexion entre la durée de l'offre et le taux de vente. La tendance n'est pas linéaire ; par conséquent, un modèle quadratique a été utilisé. Le modèle de régression décrit une tendance en forme de U : pour des durées d'offre moyennes, le taux de vente est plus bas, pour des durées d'offre très courtes et plus longues, il est plus élevé. Les métriques du modèle montrent une connexion explicable, mais les résidus montrent encore une dispersion. Par conséquent, le modèle doit être examiné professionnellement et ne doit pas être utilisé sans contexte pour des prévisions en dehors de la plage observée. Le diagramme illustre que la connexion entre la durée de l'offre et le taux de vente ne peut pas être décrite de manière significative par une simple ligne.
Dans la logistique, les commandes des clients sont traitées à travers plusieurs centres logistiques. Il convient d'examiner si la quantité de livraison a un impact sur le délai de livraison. Pour plusieurs commandes, la quantité de livraison et le délai de livraison réel sont enregistrés et documentés sous forme de paires de valeurs. À l'aide d'une analyse de régression, il est vérifié si une relation entre la quantité de livraison et le délai de livraison est reconnaissable.
Vous pouvez télécharger les données ici : Logistics_DeliveryTimeDeliveryQuantity.xlsx
Interprétation
L'analyse de régression montre seulement une corrélation faible à modérée entre le délai de livraison et la quantité de livraison. Les résidus se dispersent de manière significative autour de la ligne zéro. Dans le diagramme des résidus vs. ajustement, des écarts individuels plus importants sont reconnaissables ; la dispersion semble significative dans l'ensemble. La série chronologique des résidus montre également une tendance à la hausse. Cela peut indiquer que l'ordre des données ou d'autres facteurs influents jouent un rôle. Par conséquent, la quantité de livraison seule n'explique que partiellement le délai de livraison.
Dans les achats, on examine si la durée du délai de commande a un impact sur la livraison à temps. On soupçonne que des délais plus longs améliorent la planification et augmentent ainsi le taux de livraison à temps. Pour plusieurs commandes, le délai (temps entre la commande et la date de livraison prévue) et le taux de livraison à temps réel sont enregistrés et documentés sous forme de paires de valeurs. Une analyse de régression est utilisée pour vérifier si une relation entre le délai et le taux de livraison à temps est discernable.
Vous pouvez télécharger les données ici : Procurement_OnTimeDeliveriesOrderTiming.xlsx
Interprétation
L'analyse de régression montre une relation linéaire positive entre le délai et le taux de livraison à temps. À mesure que le délai augmente, le taux de livraison à temps augmente. Les points sont proches de la ligne de régression. Le résumé du modèle montre une variance expliquée élevée, et l'analyse de variance indique un modèle statistiquement significatif. Dans cette représentation, les graphiques résiduels n'ont pas été délibérément affichés, car la relation linéaire est déjà clairement visible dans le diagramme principal et dans les tableaux de résultats.
Dans la planification de la production, les prévisions sont ajustées à l'aide d'un facteur de correction pour compenser les sur- ou sous-prévisions systématiques. Il convient d'examiner comment le niveau du facteur de correction appliqué affecte la déviation de prévision restante. Pour plusieurs prévisions, le facteur de correction utilisé et la déviation de prévision réelle sont enregistrés et documentés sous forme de paires de valeurs. Une analyse de régression est utilisée pour vérifier si une relation entre le facteur de correction et la déviation de prévision est discernable.
Vous pouvez télécharger les données ici : PlanningDeviation_CorrectionFactor.xlsx
Interprétation
L'analyse de régression montre une relation négative claire entre le facteur de correction et la déviation de prévision. Cependant, les graphiques des résidus montrent que les déviations ne sont pas complètement distribuées de manière aléatoire. Dans le graphique Résidus vs. Ajustement, une légère structure est reconnaissable, et dans la série temporelle des résidus, il y a des zones contiguës avec des résidus positifs ou négatifs. Le modèle décrit la relation fondamentale, mais les résidus suggèrent que d'autres facteurs d'influence ou effets systématiques peuvent jouer un rôle.
Pour le calcul, un modèle de régression est utilisé.