Comparer des moyennes : t de Student, Mann-Whitney, ANOVA
« Le groupe traité a-t-il une valeur moyenne différente du groupe contrôle ? » C'est sans doute la question la plus fréquente d'une thèse de médecine. Mais entre t de Student, t de Welch, Mann-Whitney, ANOVA et Kruskal-Wallis, le choix du test se joue sur quelques critères précis. Cet article clarifie ce qu'un jury vérifie vraiment : que vous ayez choisi le bon test, pour les bonnes raisons, et que vous sachiez le justifier.
Comment lire cet article — l'essentiel tient en une décision (deux groupes ou plus ? indépendants ou appariés ? distribution symétrique ou déformée ?) résumée dans le tableau récapitulatif, et dans la section « Ce qu'il faut reporter », le livrable concret pour votre thèse. Les encadrés dépliants « Pour aller plus loin » sont des approfondissements : sautez-les en première lecture sans rien perdre de l'essentiel.
La question de départ : quelle variable, combien de groupes ?
Comparer des « moyennes » suppose une variable quantitative (un âge, une pression artérielle, un taux de créatinine, une durée d'hospitalisation) que l'on veut comparer entre des groupes définis par une variable qualitative (traité / contrôle, trois stades de sévérité, etc.). Avant tout calcul, trois questions déterminent le test.
Combien de groupes compare-t-on ? Deux groupes orientent vers un test t ou son équivalent non paramétrique ; trois groupes ou plus vers une ANOVA ou Kruskal-Wallis. Les groupes sont-ils indépendants (deux patients différents dans chaque groupe) ou appariés (le même patient mesuré avant et après, ou des paires cas-témoins) ? Enfin, la forme de la distribution et la taille d'échantillon orientent entre approche paramétrique et non paramétrique.
En clair — Trois questions suffisent presque toujours : deux groupes ou plus ? Groupes indépendants ou mesures répétées ? Distribution à peu près symétrique ou franchement déformée ?
Avant de tester : dimensionner et choisir le sens du test
Deux décisions se prennent avant de recueillir les données. La première est le dimensionnement a priori (calcul d'effectif) : à partir de la taille d'effet jugée cliniquement pertinente, du risque α (souvent 5 %) et de la puissance visée (souvent 80 ou 90 %), on calcule le nombre de sujets nécessaire. Un échantillon sous-dimensionné risque de « rater » un effet pourtant réel (faux négatif) ; un jury apprécie qu'un protocole justifie son effectif plutôt que de le subir.
La seconde décision est le choix unilatéral ou bilatéral. Un test bilatéral cherche une différence dans les deux sens (le traitement peut aider ou nuire) : c'est le choix par défaut, presque toujours attendu. Un test unilatéral ne teste qu'un seul sens et, à écart observé égal, « gonfle » mécaniquement la significativité — le seuil est atteint plus facilement. On le réserve aux rares situations où un seul sens a réellement du sens, et à condition de l'avoir décidé a priori.
Piège de jury. Passer en unilatéral après coup, parce que le test bilatéral « ne sort pas » significatif, est une faute méthodologique classique : cela revient à s'offrir un seuil plus indulgent une fois les données vues. Le sens du test se fixe au protocole, jamais au vu des résultats.
Deux groupes indépendants : t de Student, mais surtout t de Welch
Le t de Student compare les moyennes de deux groupes indépendants. Dans sa forme classique, il repose sur trois conditions : indépendance des observations, distribution approximativement normale des données dans chaque groupe, et égalité des variances entre les deux groupes (homoscédasticité). Cette dernière condition est la plus fragile.
C'est pourquoi la recommandation actuelle est d'utiliser le t de Welch par défaut. Il ne met pas les variances en commun : il calcule l'erreur-type à partir des deux variances estimées séparément, puis ajuste les degrés de liberté (correction de Welch–Satterthwaite). Son avantage : il reste valable quand les variances sont réellement égales, avec une perte de puissance négligeable, tout en restant fiable quand elles diffèrent. Il n'y a donc presque jamais de raison de préférer le Student classique.
Une réserve importante, en revanche : le Welch corrige l'inégalité des variances, pas l'écart à la normalité. Comme le t de Student, il suppose toujours des distributions approximativement normales, ou un échantillon assez grand pour que le théorème central limite prenne le relais. Passer à Welch ne dispense donc jamais de regarder la forme de la distribution.
Le pire cas pour le Student classique. Le Student dérape surtout quand deux défauts se conjuguent : variances inégales et effectifs déséquilibrés entre les groupes. Le vrai risque α s'éloigne alors nettement des 5 % annoncés. Comme on ne maîtrise à l'avance ni l'équilibre des effectifs ni l'égalité des variances, ce seul risque justifie le réflexe Welch d'emblée.
Le réflexe « Levene puis Student ». Beaucoup de manuscrits testent d'abord l'égalité des variances par le test de Levene, puis choisissent Student ou Welch selon le résultat. Cette procédure en deux étapes fait dépendre la conclusion d'un test préalable peu fiable et perturbe le contrôle du risque. Un jury averti préfère un Welch annoncé d'emblée à un « Levene non significatif donc Student ».
En clair — En cas de doute entre Student et Welch, prenez Welch. Vous ne perdez presque rien et vous gagnez en robustesse.
Mesures répétées : le t apparié
Quand chaque sujet fournit deux mesures — une pression avant et après traitement, un score à deux temps — les deux séries ne sont pas indépendantes. On utilise alors le t apparié, qui travaille en réalité sur les différences intra-individuelles : il teste si la différence moyenne entre les deux mesures diffère de zéro. La condition de normalité porte ici sur ces différences, pas sur chacune des deux séries.
En clair — Le t apparié, c'est un t de Student appliqué à une seule colonne : la différence (après − avant) de chaque patient. Une subtilité pour la taille d'effet : le d de Cohen apparié (dz) se calcule sur l'écart-type de ces différences, pas des mesures brutes — il ne se compare donc pas directement à un d entre deux groupes indépendants.
Apparié traité comme indépendant : l'erreur classique. Appliquer un t indépendant à un dispositif avant/après est une faute de méthode fréquente. Elle ignore la corrélation entre les deux mesures d'un même patient, gaspille de la puissance et fausse l'estimation de l'incertitude. Vérifiez toujours : chaque ligne de données correspond-elle au même individu mesuré deux fois ? Si oui, c'est apparié.
Ne pas confondre deux dispositifs « avant/après ». Le t apparié répond à une question intra-groupe : « la valeur a-t-elle changé dans un seul groupe ? ». Mais l'essai typique compare deux groupes (traité et contrôle), chacun mesuré avant et après : la vraie question devient « la variation avant→après diffère-t-elle entre les deux groupes ? ». On n'y répond pas par un t apparié dans chaque groupe, mais en comparant les variations entre groupes — un t indépendant sur les différences (après − avant), ou mieux une ANCOVA qui ajuste les valeurs finales sur la valeur de départ. Deux mesures par sujet ne signifient donc pas automatiquement « t apparié ».
Les alternatives non paramétriques : Mann-Whitney et Wilcoxon
Quand la distribution est franchement asymétrique ou comporte des valeurs extrêmes marquées, les tests non paramétriques prennent le relais. Ils reposent sur les rangs des valeurs plutôt que sur les valeurs elles-mêmes, ce qui les rend robustes aux valeurs extrêmes et à l'asymétrie. Attention toutefois : en très petit effectif, ces tests de rangs sont eux-mêmes peu puissants (avec des n minuscules, ils n'atteignent parfois même pas p < 0,05), et la forme de la distribution y est de toute façon mal évaluable — le petit n n'est donc pas, en soi, un argument en faveur du non-paramétrique.
Pour deux groupes indépendants, on utilise le test de Mann-Whitney U (équivalent au test de la somme des rangs de Wilcoxon). Pour deux mesures appariées, on utilise le test des rangs signés de Wilcoxon ; il suppose des différences intra-individuelles à peu près symétriques (c'est cette symétrie, et non la normalité, qu'on regarde).
Une précision qui évite de surinterpréter : Mann-Whitney ne compare pas exactement des « moyennes », ni même des médianes. Il teste si une valeur tirée d'un groupe tend à être supérieure à une valeur tirée de l'autre (la supériorité stochastique) ; il ne se lit comme une comparaison de médianes que si les deux distributions ont la même forme.
Contrairement à une idée reçue, ces tests fournissent bien une estimation chiffrée avec intervalle de confiance : l'estimateur de Hodges-Lehmann (un décalage de localisation, dans l'unité de la variable) accompagne les deux tests et se rapporte avec son IC à 95 %. On lui adjoint une taille d'effet de rang standardisée et sans unité : elle joue, pour les rangs, le même rôle que le d de Cohen pour les moyennes — chiffrer l'ampleur d'un effet de façon comparable d'une étude à l'autre — mais sur une échelle différente. Comme un coefficient de corrélation, elle varie de −1 à +1 (le d de Cohen, lui, n'est pas borné) : le signe indique le sens de la différence (quel groupe tend à dépasser l'autre), et la valeur absolue (de 0 à 1) son ampleur. Un test non paramétrique n'exempte donc pas de chiffrer l'effet.
Pour aller plus loin — le détail des estimateurs de rang (optionnel)
Le décalage de Hodges-Lehmann ne se définit pas de la même façon selon le dispositif : pour Mann-Whitney (groupes indépendants), c'est la médiane de toutes les différences possibles entre une valeur d'un groupe et une valeur de l'autre ; pour le Wilcoxon signé (mesures appariées), c'est la médiane des moyennes prises deux à deux parmi les différences intra-sujet. Ne transposez donc pas la formule « deux échantillons » au cas apparié.
Côté taille d'effet standardisée, deux mesures circulent, souvent confondues à tort : la corrélation rang-bisériale (pour deux groupes indépendants, elle est équivalente au delta de Cliff), calculée directement à partir des rangs ; et le r de Rosenthal (r = Z/√N, où Z est la statistique du test et N le nombre total d'observations), dérivé de l'approximation normale. Les deux vont dans le même sens mais ne donnent en général pas le même chiffre : précisez laquelle vous rapportez.
Le non-paramétrique « par sécurité ». Choisir Mann-Whitney systématiquement « pour être tranquille » est un piège. En cas de vraie normalité, les tests non paramétriques sont légèrement moins puissants ; surtout, ils ne fournissent pas de différence de moyennes dans l'unité clinique — on rapporte à la place un décalage de localisation (l'estimateur de Hodges-Lehmann, voir plus haut), certes accompagné d'un IC, mais souvent moins parlant qu'une différence de moyennes. Le non-paramétrique est un choix motivé par la distribution observée, pas une assurance tous risques.
La normalité : la regarder, pas la tester aveuglément
La condition de normalité est la plus mal comprise. Deux points essentiels à maîtriser pour la soutenance.
D'abord, l'inspection visuelle prime sur le test statistique. Un histogramme et surtout un QQ-plot par groupe renseignent bien mieux sur la forme réelle de la distribution que la valeur p d'un test de normalité. Le test de Shapiro-Wilk a un défaut structurel : en grand échantillon, il devient hypersensible et signale comme « non normaux » des écarts minuscules sans aucune conséquence pratique ; en petit échantillon, il manque de puissance et laisse passer de vraies déviations. Se fier mécaniquement à son verdict conduit donc souvent à la mauvaise décision.
Ensuite, le théorème central limite rend les tests t et l'ANOVA robustes à la non-normalité dès que l'échantillon est raisonnablement grand. Ce qui compte n'est pas la normalité des données brutes mais celle de la distribution d'échantillonnage de la moyenne, qui se rapproche d'une loi normale à mesure que n augmente. En pratique, à partir d'une trentaine d'observations par groupe (le fameux repère « n ≈ 30 », à relever à cinquante ou plus si l'asymétrie est marquée) et avec une asymétrie modérée, un test paramétrique reste parfaitement légitime.
En clair — La bonne démarche : regarder la distribution par groupe (ou les résidus du modèle), tenir compte de la taille d'échantillon, et décider. Pas : lancer Shapiro-Wilk et obéir à sa valeur p.
Trois groupes ou plus : ANOVA et Kruskal-Wallis
Avec trois groupes ou davantage, on ne compare pas les groupes deux à deux d'emblée. On commence par un test global. L'ANOVA à un facteur teste l'hypothèse nulle « toutes les moyennes sont égales » contre « au moins une diffère ». Ses conditions sont l'indépendance, la normalité des résidus et l'homogénéité des variances entre groupes. Quand les variances sont inégales, il existe une ANOVA de Welch, exactement dans le même esprit que le t de Welch, à privilégier plutôt que de forcer l'ANOVA classique.
En pratique, la séquence « test global d'abord, puis post-hoc » reste la présentation attendue et la plus lisible pour un jury : suivez-la.
Pour aller plus loin — le test global est-il vraiment obligatoire ? (optionnel)
Des procédures modernes comme Tukey, Games-Howell ou Dunn contrôlent déjà elles-mêmes le risque global et ne dépendent pas, formellement, d'un test global significatif préalable ; l'imposer peut même, dans certains cas, faire perdre un peu de puissance. La règle du « test global d'abord » est donc une convention de présentation solide, pas un absolu statistique — mais en thèse, respectez-la : c'est ce qu'un jury attend.
L'équivalent non paramétrique de l'ANOVA est le test de Kruskal-Wallis, extension de Mann-Whitney à plus de deux groupes, fondé sur les rangs. On y recourt pour les mêmes raisons que Mann-Whitney (distributions franchement déformées ou variable ordinale), et il hérite de la même réserve d'interprétation : il détecte une supériorité stochastique (la même notion que pour Mann-Whitney), pas strictement une différence de médianes (sauf si les distributions ont la même forme). Là encore, un très petit effectif ne plaide pas en soi pour le non-paramétrique.
Jusqu'ici, les trois groupes étaient indépendants. Quand c'est le même sujet qui est mesuré à trois temps ou plus (par exemple un score à J0, J7 et J30), les mesures sont corrélées et l'ANOVA à un facteur ne convient plus : on utilise l'ANOVA à mesures répétées, l'extension du t apparié à plusieurs temps. Elle ajoute une condition qui lui est propre, la sphéricité : les variances des différences entre chaque paire de temps doivent être comparables. Quand cette condition est violée (test de Mauchly), on ne lit pas le résultat brut mais une version à degrés de liberté corrigés (correction de Greenhouse-Geisser ou de Huynh-Feldt). L'équivalent non paramétrique est le test de Friedman ; après un Friedman significatif, les comparaisons post-hoc se font par des tests de Wilcoxon signés entre paires de temps, avec correction (Holm de préférence).
Sphéricité et avant/après. La sphéricité ne concerne que trois temps ou plus. Avec seulement deux mesures, il n'existe qu'une seule différence, donc aucune variance à comparer : la condition est automatiquement satisfaite. Inutile donc d'invoquer Mauchly sur un simple avant/après (où l'on est de toute façon dans le cas du t apparié).
Pour aller plus loin — les modèles mixtes pour données répétées (optionnel)
Au-delà de l'ANOVA à mesures répétées, les modèles mixtes (modèles linéaires à effets aléatoires — un « effet aléatoire » revenant à donner à chaque patient sa propre ligne de base) sont aujourd'hui l'approche de référence pour les données répétées et longitudinales : ils gèrent nativement les données manquantes et les designs déséquilibrés (temps de mesure irréguliers, patients perdus de vue), là où l'ANOVA à mesures répétées exige des mesures complètes. C'est hors du périmètre d'une première thèse, mais bon à connaître pour dialoguer avec un statisticien.
En clair — Trois temps ou plus sur les mêmes patients : ANOVA à mesures répétées (en vérifiant la sphéricité), ou test de Friedman en non paramétrique. À ne pas confondre avec l'ANOVA à un facteur, réservée à des groupes indépendants.
Enchaîner des t multiples. Comparer trois groupes par trois tests t deux à deux au seuil de 5 % porte le risque de conclure à tort à au moins une différence à environ 14 % (valeur approchée : 1 − 0,95³ ≈ 14,3 %, une formule qui suppose les comparaisons indépendantes — comme les paires partagent des groupes, le risque réel est un peu inférieur) ; avec quatre groupes (six comparaisons), il dépasse 25 %. C'est l'inflation du risque de type I. La parade : un test global d'abord, puis des comparaisons post-hoc corrigées.
Les tests post-hoc : Tukey, Games-Howell et Dunn
Si le test global est significatif, il indique qu'au moins une paire de groupes diffère, sans dire laquelle. Les comparaisons post-hoc identifient les paires concernées tout en contrôlant le risque global. Après une ANOVA classique (variances homogènes), le test de Tukey (HSD) compare toutes les paires en ajustant le seuil ; il suppose lui aussi l'homogénéité des variances, puisqu'il s'appuie sur une variance résiduelle commune. Lorsque les variances sont inégales et qu'on a opté pour l'ANOVA de Welch, on lui associe le test de Games-Howell, qui n'exige pas l'égalité des variances — enchaîner une ANOVA de Welch avec un Tukey HSD serait contradictoire. Après un Kruskal-Wallis, le test de Dunn joue le même rôle sur les rangs, avec une correction (Bonferroni ou Holm) du nombre de comparaisons.
Holm plutôt que Bonferroni. Ces deux corrections des comparaisons multiples contrôlent le même risque (la probabilité de faire au moins un faux positif sur l'ensemble des tests). Mais la correction de Holm procède par étapes (elle ordonne les p et n'applique le seuil le plus strict qu'à la plus petite) et rejette toujours au moins autant d'hypothèses que Bonferroni, jamais moins : à contrôle du risque identique, elle est uniformément plus puissante, sans complexité ni condition supplémentaire. Chaque fois que le choix est proposé (Dunn, post-hoc de Wilcoxon, comparaisons multiples en général), préférez Holm — Bonferroni ne garde d'intérêt que sa simplicité de calcul à la main.
En clair — Le test global répond à « y a-t-il une différence quelque part ? » ; le post-hoc répond à « entre quels groupes précisément ? », sans laisser exploser les faux positifs. Et le post-hoc doit rester cohérent avec le test global : Games-Howell, pas Tukey, quand les variances sont inégales.
Au-delà de la valeur p : la taille d'effet
Un test significatif dit qu'une différence existe, pas qu'elle est cliniquement importante. Avec un grand échantillon, une différence infime devient « statistiquement significative » sans intérêt médical. D'où l'importance de rapporter une taille d'effet.
Pour une comparaison de deux moyennes, le d de Cohen exprime la différence en nombre d'écarts-types (conventions de Cohen : 0,2 petit, 0,5 moyen, 0,8 grand — de simples repères, à interpréter selon le contexte clinique). En petit échantillon, il surestime l'effet ; on lui applique alors la correction de biais de Hedges (le g de Hedges). Pour une ANOVA, l'êta² (η²) indique la part de variance de la variable expliquée par le facteur groupe. Mais le plus parlant reste la différence de moyennes avec son intervalle de confiance à 95 % : c'est la grandeur la plus directement interprétable, dans l'unité clinique de la variable.
Pour aller plus loin — deux raffinements de la taille d'effet (optionnel)
Le delta de Glass n'utilise l'écart-type que d'un seul groupe, celui de référence (le contrôle). Sa motivation n'est pas « les variances diffèrent » mais le cas où l'intervention modifie elle-même la dispersion : mettre les deux écarts-types en commun mêlerait alors l'effet et son retentissement sur la variabilité ; l'écart-type du seul groupe contrôle fournit un étalon stable. À ne pas confondre avec le g de Hedges (qui, lui, corrige le petit échantillon et reste fondé sur l'écart-type commun).
Pour l'ANOVA, l'êta² surestime l'effet en petit échantillon ; l'oméga² ou l'epsilon², moins biaisés, sont préférables quand on peut les calculer.
En clair — La valeur p dit « probablement pas dû au hasard ». La taille d'effet et l'intervalle de confiance disent « et voici l'ampleur de la différence ». Un jury attend les deux.
Décrire avant de comparer : moyenne±ET ou médiane[IQR]
La statistique descriptive doit être cohérente avec le test. Si vous utilisez un test paramétrique parce que la distribution s'y prête, décrivez par la moyenne ± écart-type. Si la distribution est asymétrique et que vous partez sur du non-paramétrique, décrivez par la médiane [intervalle interquartile], plus fidèle à une distribution déformée. Rapporter une moyenne ± écart-type pour une variable très asymétrique (une durée de séjour, un délai) est trompeur : la moyenne y est tirée par les valeurs extrêmes.
| Situation | Test paramétrique | Alternative non paramétrique | Description |
|---|---|---|---|
| 2 groupes indépendants | t de Welch (défaut) | Mann-Whitney U | moyenne±ET ou médiane[IQR] |
| 2 mesures appariées | t apparié | Wilcoxon signé | différences : moyenne ou médiane |
| ≥3 groupes indépendants | ANOVA 1 facteur (Welch si variances inégales) | Kruskal-Wallis | par groupe, selon distribution |
| ≥3 mesures répétées (mêmes sujets) | ANOVA à mesures répétées (sphéricité ; correction Greenhouse-Geisser) | Friedman | par temps, selon distribution |
| Après test global significatif | Tukey (variances égales) / Games-Howell (variances inégales) | post-hoc de Dunn | paires + correction |
Ce qu'il faut reporter
- La nature de la variable comparée et le nombre de groupes, avec la nature indépendante ou appariée du dispositif.
- La statistique descriptive par groupe : moyenne ± écart-type ou médiane [IQR] selon la distribution, avec les effectifs.
- Le test employé et sa justification (par exemple : « t de Welch, distributions approximativement symétriques à l'inspection des QQ-plots »), sans procédure automatique fondée sur Shapiro-Wilk seul.
- La valeur p exacte (ex. p = 0,03, pas « p < 0,05 »), et pour l'ANOVA la statistique globale avant les post-hoc.
- Une taille d'effet adaptée au test, et/ou la différence de moyennes avec son IC à 95 % (la grandeur la plus parlante). En paramétrique : le d de Cohen (ou le g de Hedges en petit échantillon), l'êta² pour l'ANOVA. Pour un test de rangs (Mann-Whitney, Wilcoxon signé) : une taille d'effet de rang (en précisant laquelle) et l'estimateur de Hodges-Lehmann avec son IC à 95 % — un test non paramétrique n'exempte pas de rapporter l'ampleur de l'effet.
- Pour ≥3 groupes : le test post-hoc utilisé (Tukey ou Games-Howell selon l'homogénéité des variances, Dunn en non paramétrique) et la méthode de correction des comparaisons multiples.
- Le logiciel et sa version.
En résumé
Comparer une variable quantitative entre groupes se décide en trois temps : combien de groupes, indépendants ou appariés, et quelle forme de distribution. Pour deux groupes indépendants, le t de Welch est le choix par défaut ; le t apparié pour deux mesures répétées — et, dès trois temps sur les mêmes sujets, l'ANOVA à mesures répétées (sous condition de sphéricité) ou le test de Friedman ; Mann-Whitney et Wilcoxon signé comme alternatives non paramétriques motivées par la distribution, non par précaution ni par la seule petitesse de l'échantillon. Au-delà de deux groupes, un test global (ANOVA, ou ANOVA de Welch en cas de variances inégales, ou Kruskal-Wallis) précède des post-hoc corrigés et cohérents avec lui — Tukey après une ANOVA classique, Games-Howell après une ANOVA de Welch, Dunn après Kruskal-Wallis — jamais des t multiples non corrigés. La normalité se regarde plus qu'elle ne se teste, le théorème central limite protège en grand échantillon, et une valeur p ne dispense jamais de rapporter une taille d'effet et son intervalle de confiance. Un jury ne cherche pas le test le plus sophistiqué : il cherche le test juste, justifié, et une conclusion à la fois statistiquement et cliniquement lisible.