Corrélation et régression linéaire
Deux variables quantitatives semblent liées : le poids et la pression artérielle, l'âge et un score biologique. Reste à savoir si cette relation est réelle, dans quel sens elle va, et si l'on peut en prédire l'une à partir de l'autre. C'est le rôle de la corrélation et de la régression linéaire. Cet article clarifie ce que ces outils disent vraiment, ce qu'ils ne disent surtout pas, et les points précis qu'un jury vérifiera dans votre manuscrit.
Corrélation : mesurer un lien, pas l'expliquer
Le coefficient de corrélation résume par un seul nombre l'intensité et le sens d'une relation entre deux variables quantitatives. Il varie entre −1 et +1. Le signe donne le sens : positif quand les deux variables augmentent ensemble, négatif quand l'une augmente pendant que l'autre diminue. La valeur absolue donne la force : proche de 0, le lien est faible ; proche de 1, il est fort.
Il existe deux coefficients d'usage courant, et les confondre est une erreur fréquente.
Le coefficient de Pearson (noté r) mesure une relation linéaire : à quel point les points s'alignent sur une droite. Il est sensible aux valeurs extrêmes — un seul point aberrant peut le gonfler ou l'effondrer — et son test de significativité (le p) comme son intervalle de confiance supposent que les deux variables suivent ensemble une distribution à peu près normale. Quand cette hypothèse n'est pas plausible (asymétrie marquée, valeurs extrêmes), préférez Spearman.
Le coefficient de Spearman (noté rs) travaille non pas sur les valeurs elles-mêmes mais sur leurs rangs. Il mesure une relation monotone : les deux variables évoluent-elles dans le même sens, sans exiger que ce soit selon une droite. Il est robuste aux valeurs extrêmes et convient aussi aux variables ordinales.
Pour aller plus loin (optionnel) — Le p de Pearson (test t à n−2 ddl) résiste assez bien à un écart modéré à la normalité, tandis que son intervalle de confiance (transformation z de Fisher) se déforme plus vite : en cas de doute, un IC obtenu par bootstrap est plus sûr.
En clair — Pearson demande « les points forment-ils une droite ? ». Spearman demande seulement « quand l'un monte, l'autre monte-t-il aussi ? ». Le second est plus tolérant, le premier plus précis quand ses conditions sont réunies.
Pearson sur une relation non monotone. Si le lien est réel mais non monotone (en U, en cloche), Pearson peut afficher un r proche de 0 alors que les variables sont fortement associées. Et même pour une relation monotone mais courbe (exponentielle, logarithmique), Pearson sous-estime la force du lien là où Spearman la capte pleinement. Ne concluez jamais « pas de relation » sur la seule foi d'un Pearson faible : regardez d'abord la forme du nuage.
Interpréter r et r²
Une fois r obtenu, deux lectures complémentaires s'imposent.
La première est la force et le sens, décrits ci-dessus. On accompagne toujours r de son intervalle de confiance à 95 % et de son p. Attention : avec un grand effectif, une corrélation minuscule peut être « statistiquement significative » sans le moindre intérêt clinique. La significativité répond à « le lien est-il distinguable de zéro ? », pas à « le lien est-il important ? ».
r s'approche de 1, plus les points se resserrent autour d'une droite — de quoi « sentir » ce que vaut un r avant de le commenter.Combien de sujets pour une corrélation ? — La largeur de l'IC de r dépend presque uniquement de l'effectif n. Sur un petit échantillon (n ≈ 20), l'IC est si large qu'un r observé à 0,40 reste compatible avec « quasi nul » comme avec « fort » : on ne conclut rien de solide. Pour estimer une corrélation modérée (r ≈ 0,40) avec une précision utile (un IC d'une demi-largeur de l'ordre de 0,15), il faut typiquement de l'ordre de 120 à 125 sujets — sensiblement plus qu'on ne l'imagine spontanément. Retenez l'ordre de grandeur : estimer précisément une corrélation, et pas seulement la déclarer non nulle, demande souvent plus de monde qu'on ne le croit.
La seconde lecture est le coefficient de détermination, le fameux r² : c'est le carré de r. Il s'interprète comme la part de la variance d'une variable expliquée par sa relation linéaire avec l'autre. Un r de 0,50 donne un r² de 0,25 : la relation rend compte de 25 % de la variabilité, et 75 % restent dus à d'autres facteurs.
En clair — le r² dégonfle souvent l'enthousiasme : un r qui « paraît » élevé à 0,60 n'explique que 36 % de la variance. C'est un excellent garde-fou contre les conclusions trop fortes.
| Coefficient r | r² correspondant | Lecture prudente |
|---|---|---|
| 0,10 | 0,01 | 1 % de variance partagée — négligeable |
| 0,30 | 0,09 | lien faible |
| 0,50 | 0,25 | lien modéré |
| 0,70 | 0,49 | lien fort |
| 0,90 | 0,81 | lien très fort |
Ces seuils sont des repères commodes, pas des règles absolues : ce qui compte comme « fort » dépend du domaine. En biologie humaine, très bruitée, un r de 0,40 peut être remarquable.
Restriction de l'étendue. Un r dépend de l'étalement des données. Si l'on ne retient qu'un sous-groupe resserré sur X ou sur Y — par exemple seulement les patients à IMC élevé, ou seulement les valeurs « normales » d'un dosage — on rétrécit mécaniquement l'étendue et r chute, même quand le lien sous-jacent est intact. À l'inverse, un échantillon très étalé le gonfle. Ne comparez donc que des corrélations mesurées sur des étendues comparables.
Trois confusions à ne jamais commettre
Ces trois erreurs sont classiques en soutenance et faciles à éviter.
Corrélation n'est pas causalité. Deux variables peuvent varier ensemble parce que l'une cause l'autre, mais aussi parce qu'un troisième facteur les influence toutes deux (un facteur de confusion), ou par pure coïncidence. Observer une association ne dit rien du mécanisme. Une étude observationnelle transversale ne peut pas, à elle seule, établir un lien de cause à effet.
Conclure une causalité. Écrire « X augmente Y » à partir d'une simple corrélation observationnelle est la faute la plus sanctionnée. Formulez « X est associé à Y » et discutez explicitement les facteurs de confusion possibles.
Corrélation n'est pas accord. Pour comparer deux méthodes de mesure d'une même grandeur (deux tensiomètres, un dosage manuel contre automatisé), la corrélation est trompeuse : deux appareils peuvent être corrélés à 0,99 alors que l'un surestime systématiquement de 5 mmHg. La corrélation mesure si les valeurs évoluent ensemble, pas si elles coïncident. L'outil correct est la méthode de Bland-Altman, qui étudie le biais moyen et les limites d'agrément entre les deux mesures. (Pour la reproductibilité de mesures répétées — deux observateurs, un test-retest —, on emploie plutôt le coefficient de corrélation intraclasse, l'ICC, qui pénalise à la fois le décalage systématique et la dispersion.)
Un chiffre ne remplace pas un graphique. C'est l'objet de la section suivante.
Le quartet d'Anscombe : toujours faire le nuage de points
En 1973, le statisticien Francis Anscombe a construit quatre jeux de données qui partagent presque tout : même moyenne de X, même moyenne de Y, même corrélation de Pearson (≈ 0,82), même droite de régression. Sur le papier, ils sont identiques. Mais leurs nuages de points sont radicalement différents : l'un est une belle relation linéaire, un autre une parabole nette qui monte, culmine puis redescend (relation courbe que ni Pearson ni Spearman ne captent), un autre une droite parfaite déviée par un unique point aberrant, le dernier une colonne de points verticale que domine une seule observation excentrée.
La leçon est sans appel : un coefficient de corrélation ne se lit jamais sans son nuage de points. Le graphique révèle instantanément une non-linéarité, un point influent ou un regroupement que les statistiques résumées masquent.
Attention à ne pas tout mettre dans le même sac : la parabole d'Anscombe est non monotone (elle monte puis redescend), et à ce titre elle échappe aussi bien à Pearson qu'à Spearman. À l'inverse, pour une relation monotone mais courbe — qui progresse toujours dans le même sens tout en s'incurvant, comme le nuage de droite ci-dessous —, Spearman rattrape ce que Pearson sous-estime. Ce second cas, distinct du quartet d'Anscombe, est celui qu'illustre la figure suivante.
r, qui guide le choix du coefficient.La régression linéaire : de la description à la prédiction
Là où la corrélation résume un lien par un nombre, la régression linéaire modélise ce lien par une équation, ce qui permet de prédire une variable et de quantifier l'effet d'un prédicteur. Le modèle simple s'écrit : Y = a + b·X.
Deux quantités structurent cette droite. La pente (le coefficient b) est l'information clé : elle indique de combien varie Y en moyenne quand X augmente d'une unité. Une pente de 0,5 mmHg par kilogramme signifie que chaque kilogramme supplémentaire s'accompagne en moyenne de 0,5 mmHg de plus. L'ordonnée à l'origine (le coefficient a) est la valeur prédite de Y lorsque X vaut 0 ; elle n'a souvent pas d'interprétation concrète si X = 0 n'a pas de sens clinique.
X supposé mesuré sans erreur. La régression suppose que le prédicteur X est connu exactement. Si X est lui-même bruité — dosage biologique imprécis, appareil peu reproductible, mesure déclarative approximative —, la pente estimée est tirée vers 0 : on sous-estime l'effet réel. C'est le biais d'atténuation (ou dilution de régression), très fréquent en biologie clinique où presque aucune mesure n'est parfaite. Une erreur sur Y, elle, ne biaise pas la pente : elle ne fait qu'élargir l'incertitude.
Chaque coefficient s'accompagne de son intervalle de confiance à 95 % et de son p. L'intervalle de confiance de la pente porte le message : sa position indique l'ampleur et le sens plausibles de l'effet, sa largeur la précision de l'estimation. Un intervalle qui reste loin de 0 et cliniquement étroit est bien plus informatif qu'un simple verdict « significatif / non significatif » : privilégiez la lecture de l'estimation et de son incertitude au raisonnement binaire fondé sur le seuil p<0,05.
En clair — la corrélation dit « ces deux variables bougent ensemble ». La régression dit « quand X monte d'un cran, Y monte d'à peu près tant », et met un intervalle de confiance sur ce « tant ».
La régression n'est pas symétrique. Régresser Y sur X et régresser X sur Y donnent deux droites différentes : le modèle minimise les écarts sur la seule variable qu'on cherche à prédire. Le choix de ce qui « explique » et de ce qui est « expliqué » dépend donc de la question posée, pas du hasard.
La régression vers la moyenne est un piège voisin, à ne pas confondre. Les patients repérés sur une valeur extrême à une première mesure tendent, à une seconde mesure, à se rapprocher de la moyenne — non par un effet du traitement, mais simplement parce que deux mesures répétées ne sont jamais parfaitement corrélées. Sélectionner des sujets sur une valeur extrême puis les re-mesurer expose donc à prendre pour un effet ce qui n'est qu'un retour spontané vers la moyenne.
Deux incertitudes à ne pas confondre en prédiction. L'intervalle de confiance de la moyenne prédite encadre la valeur moyenne de Y attendue pour un X donné, c'est-à-dire l'incertitude sur la position de la droite elle-même ; il est étroit. L'intervalle de prédiction individuel encadre la valeur de Y d'un nouveau patient à ce même X : nettement plus large, il ajoute à l'incertitude de la droite la variabilité individuelle des points autour d'elle.
La régression multiple généralise l'idée à plusieurs prédicteurs : Y = a + b₁·X₁ + b₂·X₂ + … Son intérêt majeur est l'ajustement : chaque coefficient s'interprète « à valeur constante des autres variables du modèle ». C'est ainsi qu'on tient compte des facteurs de confusion inclus dans le modèle. Attention toutefois : l'ajustement ne corrige que les facteurs qu'on a mesurés, et ne transforme jamais une étude observationnelle en preuve causale. Il suppose aussi que les prédicteurs ne soient pas trop corrélés entre eux : en cas de forte colinéarité, les coefficients deviennent instables et leur interprétation trompeuse. On la surveille avec le facteur d'inflation de la variance (VIF).
Trop de prédicteurs pour l'effectif. En régression multiple, multiplier les variables sur un petit échantillon conduit au surajustement : le modèle épouse le bruit et ne se généralise plus. La règle historique des « 10 observations par variable » est aujourd'hui jugée simpliste ; les recommandations récentes dimensionnent plutôt l'échantillon à partir du rétrécissement (shrinkage) attendu des coefficients. N'introduisez pas plus de variables que vos données ne peuvent en supporter.
Les conditions de validité et leurs diagnostics
Une régression linéaire n'est valide que si quatre conditions sont raisonnablement remplies. Formellement, ces hypothèses portent sur les erreurs du modèle ; on les vérifie sur les résidus — les écarts entre valeurs observées et valeurs prédites — qui en sont l'estimation à partir des données.
Linéarité. La relation entre les prédicteurs et Y doit être approximativement linéaire. On la vérifie sur le graphique des résidus en fonction des valeurs prédites : les points doivent se répartir sans structure autour de zéro, sans courbe apparente. Une courbure trahit une mauvaise forme du modèle (ou une variable omise) et rend la pente estimée biaisée. Face à une courbure, on peut transformer X (passer au logarithme), ajouter un terme polynomial (un X² pour une relation en cloche) ou recourir à des splines plus souples, puis réexaminer les résidus jusqu'à ce que la structure disparaisse.
Indépendance. Les observations (donc les erreurs) doivent être indépendantes. Cette condition est mise en défaut par des mesures répétées chez un même patient ou des données temporelles ; elle relève du plan de l'étude, pas d'un simple test.
Homoscédasticité. La variance des résidus doit être constante sur tout le domaine des valeurs prédites. Sur le même graphique résidus/valeurs prédites, la dispersion ne doit pas s'élargir en entonnoir. Une variance qui croît avec les valeurs prédites signale une hétéroscédasticité. En cas d'hétéroscédasticité avérée, on ne jette pas le modèle : on recourt à des erreurs-types robustes (dites « sandwich » ou HC) pour l'inférence sur les coefficients, ou à une transformation de Y.
Normalité des résidus. Ce sont les résidus qui doivent suivre une distribution à peu près normale, ce que l'on juge sur un histogramme des résidus ou un diagramme quantile-quantile (QQ-plot). C'est la condition la moins critique : l'estimation des coefficients ne l'exige pas (elle reste sans biais sans elle), et sur un échantillon de taille raisonnable le théorème central limite rend l'inférence sur les coefficients — leurs IC et leurs p — robuste à une non-normalité modérée. Elle ne devient déterminante que sur petits effectifs et pour les intervalles de prédiction individuels. Jugez-la graphiquement (histogramme, QQ-plot) plutôt qu'avec un test formel type Shapiro-Wilk, hypersensible sur grand n.
Normalité des résidus, pas des variables. L'erreur la plus répandue est de tester la normalité de X ou de Y. Le modèle ne fait aucune hypothèse sur la distribution des variables elles-mêmes : la condition porte uniquement sur les résidus. Un prédicteur peut être très asymétrique sans invalider le modèle.
Aux quatre conditions formelles ci-dessus s'ajoutent, en régression multiple, deux vérifications pratiques : sans elles, les coefficients ajustés peuvent rester trompeurs même quand les quatre hypothèses sont satisfaites.
Absence de colinéarité forte (régression multiple). Lorsque plusieurs prédicteurs mesurent peu ou prou la même chose, ils se disputent la même part de variance : les coefficients deviennent instables, leurs IC s'élargissent et le signe peut même s'inverser. On la diagnostique avec le facteur d'inflation de la variance (VIF) ; face à une colinéarité forte, on retire ou combine les prédicteurs redondants avant d'interpréter les coefficients ajustés.
Absence de points très influents. Un point isolé peut à lui seul tirer la droite. On le repère avec la distance de Cook, qui combine une position extrême en X (fort levier) et un écart en Y important — il faut les deux à la fois pour qu'un point pèse vraiment. Un point influent ne se supprime pas machinalement : on comprend pourquoi il pèse, et l'on rapporte au besoin l'analyse avec et sans lui.
Le piège de l'extrapolation
Une droite de régression n'est valable que dans le domaine des valeurs observées. Rien ne garantit que la relation se prolonge de la même façon au-delà. Prédire la pression artérielle d'un nourrisson à partir d'un modèle ajusté sur des adultes, ou projeter une tendance bien au-delà des âges recueillis, revient à extrapoler : la prédiction devient spéculative, même si le calcul « fonctionne » numériquement.
En clair — un modèle interpole avec confiance entre les points qu'il a vus ; hors de cette plage, il devine. Précisez toujours l'intervalle de X sur lequel vos conclusions tiennent.
Ce qu'il faut reporter
- Le nuage de points systématiquement, avant tout coefficient — non négociable.
- Le coefficient choisi (Pearson ou Spearman) et la justification de ce choix (forme du nuage, valeurs extrêmes, forte asymétrie, variable ordinale).
- La valeur de
r(ours) avec son intervalle de confiance à 95 % et son p, ainsi que le r² interprété en part de variance. - L'effectif exact utilisé et le devenir des données manquantes (analyse sur cas complets ou imputation — à ne pas passer sous silence).
- Pour une régression : l'équation, les coefficients avec leur IC à 95 %, le r² (noté R² et R² ajusté en régression multiple) et la liste des variables incluses.
- Le rapport entre l'effectif et le nombre de prédicteurs, pour maîtriser le surajustement : n'introduisez pas plus de variables que l'échantillon ne peut en supporter (la règle des « 10 observations par variable » est aujourd'hui jugée trop simpliste).
- En régression multiple, la vérification de la colinéarité entre prédicteurs (facteur d'inflation de la variance,
VIF). - Les diagnostics des conditions : linéarité, indépendance, homoscédasticité, normalité des résidus (jugée graphiquement), recherche de points influents.
- Le domaine de validité (plage de X) et la mention explicite qu'aucune extrapolation n'est faite.
- Une formulation en termes d'association, et non de causalité, pour une étude observationnelle.
À quoi ça ressemble, une fois rédigé — Pour une corrélation : « Sur n = 84 sujets, l'IMC et la pression artérielle systolique sont positivement corrélés (Pearson r = 0,42, IC95 % [0,23 ; 0,58], p < 0,001 ; r² = 0,18) : l'IMC rend compte d'environ 18 % de la variabilité de la pression, les 82 % restants relevant d'autres facteurs. » Pour la régression simple correspondante : « PAS = 98,0 + 0,80 × IMC ; chaque point d'IMC supplémentaire s'accompagne en moyenne de 0,80 mmHg de plus (IC95 % [0,42 ; 1,18], p < 0,001), sur le domaine observé (IMC de 19 à 38). » Chaque nombre a sa place — estimation, IC à 95 %, p, r², effectif, plage de validité —, et en régression simple le p de la pente est exactement celui de la corrélation. C'est ce format complet, pas un p isolé, que le jury attend.
En résumé
La corrélation mesure l'intensité et le sens d'un lien entre deux variables quantitatives : Pearson pour une relation linéaire mais sensible aux valeurs extrêmes, Spearman pour une relation monotone et robuste. Le r² ramène à la réalité en donnant la part de variance expliquée. La régression prolonge cette lecture en une équation qui permet de prédire et, en version multiple, d'ajuster sur les facteurs de confusion mesurés — sa pente et son intervalle de confiance étant le cœur du message, à condition de ne pas surcharger le modèle au regard de l'effectif ni de laisser des prédicteurs colinéaires brouiller les coefficients. Rien de tout cela ne vaut sans le nuage de points, sans la vérification des conditions sur les résidus, et sans la prudence qui interdit de confondre association et causalité, corrélation et accord, ou d'extrapoler hors du domaine observé. Ce sont exactement les points qu'un jury vérifie, et les tenir met votre analyse à l'abri.