Valeur-p, intervalles de confiance et significativité
La valeur-p est sans doute le nombre le plus cité et le plus mal interprété des thèses de médecine. Un jury sait que derrière un « p < 0,05 » se cachent souvent des raccourcis dangereux : conclure à une absence de différence, sur-interpréter un résultat limite, oublier de corriger pour les tests multiples. Cet article clarifie ce que dit réellement une valeur-p, pourquoi l'intervalle de confiance est presque toujours plus informatif, et comment distinguer significativité statistique et pertinence clinique.
Ce qu'est vraiment une valeur-p
Toute analyse inférentielle part d'une hypothèse nulle (notée H0), qui postule généralement l'absence d'effet : pas de différence entre deux traitements, pas d'association entre une exposition et une maladie. La valeur-p est alors définie ainsi : c'est la probabilité d'observer des données au moins aussi extrêmes que celles obtenues, en supposant que l'hypothèse nulle est vraie (et que le modèle statistique, y compris ses hypothèses, est correct).
Chaque mot compte. La valeur-p est calculée sous H0 : on se place dans le monde hypothétique où il n'y a aucun effet, et on demande à quel point les données observées y seraient surprenantes. Un petit p signifie que les données seraient peu compatibles avec ce monde-là.
En clair — La valeur-p mesure la surprise : si en réalité rien ne se passait, à quel point serait-il inhabituel d'obtenir un résultat au moins aussi marqué que le mien ? (« au moins aussi marqué », et non « exactement le mien » : le p cumule le résultat observé et tous ceux qui seraient encore plus extrêmes.) Plus le p est petit, plus les données « collent » mal à l'hypothèse « il ne se passe rien ».
De cette définition découlent trois interprétations fausses, extrêmement répandues :
| Formulation entendue | Pourquoi c'est faux |
|---|---|
| « p = 0,03, donc il y a 3 % de chances que H0 soit vraie » | La valeur-p est calculée en supposant H0 vraie. Elle ne peut pas, en retour, mesurer la probabilité que H0 soit vraie. Cette probabilité-là (P(H0 | données)) relève d'une approche bayésienne et exige une probabilité a priori. |
| « p = 0,03, donc il y a 3 % de chances que le résultat soit dû au hasard » | Même confusion. Le hasard de l'échantillonnage est déjà intégré dans le calcul, sous H0. Le p n'est pas la probabilité que « ce soit le hasard ». |
| « p = 0,03, donc il y a 97 % de chances que le traitement marche » | Le complément à 1 de la valeur-p n'est ni la probabilité que l'hypothèse alternative soit vraie, ni la probabilité de reproduire le résultat. |
Le piège de l'inversion. Confondre « probabilité des données sous H0 » et « probabilité de H0 sachant les données » est l'erreur la plus fréquente en soutenance. Ce sont deux quantités différentes, et rien dans une valeur-p ne permet de passer de l'une à l'autre sans information supplémentaire.
Les six principes de l'American Statistical Association
Face à l'ampleur des mésusages, l'American Statistical Association (ASA) a publié en 2016 un énoncé officiel rappelant six principes. Les connaître vous protège en soutenance :
- 1. Une valeur-p peut indiquer à quel point les données sont incompatibles avec un modèle statistique donné (typiquement H0).
- 2. Une valeur-p ne mesure pas la probabilité que l'hypothèse étudiée soit vraie, ni la probabilité que les données proviennent du seul hasard.
- 3. Les conclusions scientifiques et les décisions ne doivent pas reposer uniquement sur le franchissement d'un seuil (par exemple p < 0,05).
- 4. Une inférence correcte exige un compte rendu complet et transparent : toutes les analyses menées, y compris celles non significatives, doivent être rapportées.
- 5. Une valeur-p ne mesure ni l'ampleur d'un effet, ni l'importance d'un résultat. Un petit p peut correspondre à un effet trivial.
- 6. À elle seule, une valeur-p ne fournit pas une bonne mesure de la force d'une preuve concernant un modèle ou une hypothèse.
En clair — La valeur-p est un indicateur, pas un verdict. Elle mérite d'être rapportée, mais jamais interprétée seule, et jamais réduite à un simple « significatif / non significatif ».
Pourquoi privilégier l'intervalle de confiance
La valeur-p ne répond qu'à une seule question — dans quelle mesure les données sont compatibles avec H0 —, alors qu'une thèse a besoin de deux informations bien plus utiles : quelle est l'amplitude de l'effet, et avec quelle précision l'a-t-on estimée. C'est exactement ce que donne l'intervalle de confiance (IC).
Un IC à 95 % pour une différence de moyennes, un risque relatif ou un odds ratio fournit une fourchette de valeurs compatibles avec les données. La largeur de l'intervalle traduit directement la précision : un IC étroit signale une estimation précise, un IC large une grande incertitude.
Le piège de l'inversion, version IC. Un IC à 95 % ne signifie pas « il y a 95 % de chance que la vraie valeur soit dans cet intervalle-ci ». Une fois l'étude réalisée, l'intervalle obtenu contient ou ne contient pas la vraie valeur (probabilité 0 ou 1). Le « 95 % » qualifie la procédure — la proportion d'intervalles corrects sur des répétitions hypothétiques de l'étude —, pas cet intervalle particulier. C'est la question exacte qu'un jury pose : « que signifie précisément votre IC à 95 % ? »
L'IC contient d'ailleurs l'information du test : si l'intervalle à 95 % exclut la valeur nulle du paramètre (0 pour une différence, 1 pour un rapport comme un RR ou un OR), alors le test bilatéral donne p < 0,05. Mais il dit bien plus. Comparez :
| Résultat rapporté | Ce que le jury en déduit |
|---|---|
| Baisse de PAS : −2 mmHg, IC 95 % [−3 ; −1], p < 0,001 | Effet statistiquement net mais cliniquement négligeable : l'intervalle entier reste trivial. |
| Baisse de PAS : −9 mmHg, IC 95 % [−18 ; 0], p = 0,05 | Effet potentiellement important mais imprécis : on ne peut exclure ni un effet fort ni un effet nul. |
La seule valeur-p aurait renversé les priorités : le premier résultat paraîtrait « meilleur » car p plus petit, alors qu'il est cliniquement inintéressant. C'est l'intervalle de confiance qui rétablit le bon jugement.
Ne confondez jamais IC et écart-type. L'écart-type décrit la dispersion des individus dans l'échantillon. L'intervalle de confiance décrit l'incertitude sur une estimation (une moyenne, une différence). Écrire « moyenne ± écart-type » et appeler cela un intervalle de confiance est une erreur classique. Pour une moyenne, l'erreur standard vaut l'écart-type divisé par la racine de l'effectif ; pour une différence ou un rapport, elle se calcule autrement. Dans tous les cas, c'est elle (et non l'écart-type) qui sert à construire l'IC.
Piège de jury : deux IC qui se chevauchent. On lit très souvent « les IC des deux groupes se recouvrent, donc la différence n'est pas significative ». C'est faux, et c'est l'une des erreurs les plus répandues dans les thèses. Le chevauchement de deux intervalles n'implique pas l'absence de différence significative : deux IC peuvent se recouvrir partiellement alors que le test de la différence reste significatif (p < 0,05). La raison est que le bon outil n'est pas la comparaison visuelle des deux IC, mais l'IC de la différence entre les groupes. Pour conclure, calculez cet IC de la différence et regardez s'il exclut le zéro — ne superposez jamais à l'œil les IC de chaque groupe.
Significativité statistique n'est pas significativité clinique
La significativité statistique dépend de trois ingrédients : la taille de l'effet, la variabilité des données et, de façon déterminante, l'effectif. Avec un très grand n, un écart minuscule et sans intérêt pour le patient devient « significatif ». À l'inverse, avec un petit échantillon, un effet réel et important peut ne pas atteindre le seuil, faute de puissance — la probabilité, si l'effet existe vraiment, de le détecter. Manquer ainsi un effet réel, c'est commettre l'erreur de deuxième espèce (risque bêta, β) : là où α est le risque de « crier au loup » à tort, β est le risque de « rater le loup » bien réel. Les deux sont liés par une relation simple, puissance = 1 − β : une puissance de 80 % laisse ainsi 20 % de risque de manquer l'effet visé. Cette puissance se calcule toujours pour une taille d'effet fixée à l'avance : elle sera plus faible pour un effet plus petit.
En clair — « Significatif » veut dire « données peu compatibles avec H0 (le modèle sans effet) », pas « important pour le malade ». Un grand échantillon peut rendre significatif un effet dérisoire ; un petit échantillon peut faire manquer un effet majeur.
La bonne démarche consiste toujours à confronter l'effet observé à un seuil de pertinence clinique défini à l'avance (différence minimale cliniquement importante). Un résultat n'est convaincant que lorsqu'il est à la fois statistiquement robuste et cliniquement pertinent.
Absence de preuve n'est pas preuve d'absence
C'est le piège de soutenance le plus fréquent. Un test qui donne p = 0,20 ne prouve pas que les groupes sont égaux. Il indique seulement que les données sont compatibles avec l'absence d'effet — tout comme elles peuvent l'être avec un effet modéré non détecté faute de puissance.
La distinction se lit dans l'intervalle de confiance. Un IC large qui chevauche le nul (cas B) signifie « on ne sait pas » : l'étude manque de puissance. Un IC étroit centré sur le nul, dont les bornes restent dans la marge d'indifférence clinique retenue (cas C), est la seule situation qui autorise à parler d'absence d'effet pertinent. Pour affirmer formellement une équivalence, il faut d'ailleurs un test d'équivalence ou de non-infériorité spécifique, jamais un test de supériorité non significatif.
Piège de jury : conclure « pas de différence ». Écrire « les deux groupes ne diffèrent pas (p = 0,15) » sera presque toujours repris. Formulez plutôt : « nous n'avons pas mis en évidence de différence significative », et discutez la puissance et la largeur de l'IC.
Le seuil de 0,05 est une convention
Le seuil de 5 % n'a rien de sacré : c'est une convention historique, popularisée par Fisher comme simple repère — et non comme un couperet. Or un résultat à p = 0,049 et un résultat à p = 0,051 apportent une force de preuve quasi identique ; les traiter comme un tout ou rien (« significatif » contre « non significatif ») est trompeur.
En clair — 0,05 est une ligne tracée par usage, pas par la nature. Rapportez la valeur-p exacte (par exemple p = 0,03, et non « p < 0,05 ») et laissez le lecteur juger, plutôt que de dichotomiser.
Pour aller plus loin (optionnel — vous pouvez sauter). Deux traditions se sont mélangées dans la pratique courante. Fisher défendait le report de la valeur-p exacte, sans seuil couperet. Le cadre accepter / rejeter sur un seuil fixé à l'avance vient, lui, de Neyman et Pearson, qui recommandaient pourtant de choisir α selon le contexte (selon le coût de chaque type d'erreur), et non de figer universellement 0,05. En 2019, un éditorial de l'ASA et un appel largement soutenu paru dans Nature ont invité à abandonner l'étiquette binaire de « significativité » au profit d'une interprétation graduée, appuyée sur l'ampleur de l'effet et son intervalle de confiance.
Test unilatéral ou bilatéral ? Un test bilatéral cherche une différence dans les deux sens — le traitement peut être meilleur ou pire que le comparateur. Un test unilatéral ne regarde qu'un seul sens (« le traitement est-il supérieur ? »). Le piège : choisir l'unilatéral après avoir vu la direction de l'effet gonfle artificiellement la significativité (un p bilatéral de 0,08 devient un « 0,04 » unilatéral). En clinique, on retient donc presque toujours le test bilatéral ; l'unilatéral doit être justifié et fixé dans le protocole, jamais décidé au vu des données.
En clair — Un test unilatéral n'est pas un « diviseur de p » automatique. Il ne donne un p deux fois plus petit que si vous aviez parié d'avance sur le bon sens de l'effet — et parier dans le mauvais sens rend le résultat encore moins significatif.
Comparaisons multiples et inflation du risque alpha
Le seuil de 5 % correspond au risque d'erreur de première espèce (alpha) : conclure à un effet qui n'existe pas. Ce risque vaut 5 % pour un seul test. Multipliez les tests, et la probabilité qu'au moins l'un d'eux soit « significatif » par pur hasard grimpe vite.
| Nombre de tests indépendants | Risque d'au moins un faux positif (α = 0,05) |
|---|---|
| 1 | 5 % |
| 5 | ≈ 23 % |
| 10 | ≈ 40 % |
| 20 | ≈ 64 % |
Ces valeurs découlent du calcul 1 − (1 − 0,05)^k pour k tests indépendants. Avec vingt sous-groupes ou vingt critères secondaires, trouver « quelque chose de significatif » devient presque garanti, même sans aucun effet réel.
Pour contrer cette inflation, on abaisse le seuil de chaque test. Deux grandes familles de corrections existent ; elles ne répondent pas à la même question.
La première veut éviter la moindre fausse alerte sur l'ensemble des tests. La correction la plus connue est Bonferroni : on divise simplement le seuil par le nombre de tests. Avec 4 tests, chaque résultat doit alors franchir 0,05 / 4 = 0,0125 au lieu de 0,05. Simple, mais sévère : elle rejette beaucoup. La correction de Holm poursuit le même but en étant un peu moins stricte (toujours au moins aussi puissante que Bonferroni) — à préférer par défaut.
La seconde famille est plus tolérante : elle accepte quelques faux positifs, tant qu'ils restent une petite proportion des résultats déclarés significatifs. Sa méthode de référence, Benjamini-Hochberg, est pensée pour les analyses où l'on teste des centaines ou des milliers d'hypothèses (génomique, métabolomique…), où viser « zéro fausse alerte » ne laisserait plus aucune puissance.
Quand j'utilise quoi ?
- Peu de tests, un critère qui compte (comparer 3 ou 4 traitements sur le critère principal) → Holm (ou Bonferroni). Objectif : quasiment aucune fausse alerte.
- Beaucoup de tests exploratoires (cribler des centaines de marqueurs) → Benjamini-Hochberg. Objectif : ne pas rater les vrais signaux, en tolérant une petite part de fausses découvertes.
Dans une thèse clinique classique, vous serez presque toujours dans le premier cas. (Les sigles techniques — FWER pour la première famille, FDR pour la seconde — ne sont utiles que si un membre du jury les emploie.)
Le problème est exactement le même pour les intervalles de confiance, et c'est une symétrie qu'on oublie souvent. Si vous calculez vingt IC à 95 %, la probabilité qu'au moins un « rate » sa vraie valeur grimpe tout autant que pour les valeurs-p. Un tableau de vingt IC à 95 % n'offre donc pas une garantie globale de 95 %. Privilégier l'IC ne dispense pas de raisonner sur la multiplicité.
Le point décisif reste toutefois le statut des hypothèses. Un critère de jugement pré-spécifié dans le protocole, avant de voir les données, a une valeur probante bien supérieure à une association exploratoire découverte après coup. Ces analyses exploratoires génèrent des hypothèses ; elles ne les confirment pas.
Piège de jury : le « p = 0,04 » isolé. Si vous présentez un résultat proche du seuil, tiré d'un sous-groupe ou d'un critère secondaire non pré-spécifié et non corrigé, attendez-vous à la question « avez-vous corrigé pour les tests multiples ? ». Distinguez toujours, dans le manuscrit, le critère principal pré-spécifié des analyses exploratoires, et présentez ce type de résultat comme une piste à confirmer (avec son intervalle de confiance), pas comme une preuve.
Un « p < 0,05 » est-il vraiment un vrai positif ?
Reprenons le fil du piège de l'inversion. Une valeur-p faible dit que les données seraient surprenantes si H0 était vraie ; elle ne dit pas quelle est la probabilité que votre découverte « significative » soit réelle. Or c'est bien celle-ci que le jury vous prête. Cette probabilité — la valeur prédictive positive d'un test significatif — dépend de deux éléments extérieurs à la valeur-p : la proportion d'hypothèses réellement vraies parmi celles que l'on teste (leur plausibilité avant l'expérience) et la puissance de l'étude.
Un exemple chiffré le rend concret. Supposons que, sur 1 000 hypothèses testées dans un champ, 100 seulement soient vraies (900 sont de fausses pistes). Avec une puissance de 80 %, on détecte 80 des 100 effets réels : 80 vrais positifs. Mais parmi les 900 hypothèses nulles, un risque α de 5 % produit 45 faux positifs. Au total, 125 résultats « significatifs » sortent — dont 45 sont faux. Autrement dit, plus d'un tiers des « p < 0,05 » sont des fausses alertes, alors même que chaque test respecte le seuil de 5 %. Testez surtout des idées peu plausibles (faible prévalence a priori), ou avec une faible puissance, et cette proportion explose.
En clair — Un seuil de 5 % ne veut pas dire que 5 % de vos résultats significatifs sont faux. Si vous partez à la pêche à des hypothèses improbables, ou avec un petit effectif, la majorité de vos « trouvailles » peuvent être fausses. Une hypothèse plausible, pré-spécifiée et testée avec de la puissance vaut bien plus qu'un p spectaculaire déniché au hasard.
Un cadre valable seulement si le modèle et le design le sont
Dernier rappel, essentiel : valeur-p et intervalle de confiance ne quantifient qu'une seule source d'erreur, les fluctuations d'échantillonnage (le tirage aléatoire des sujets). Tous leurs calculs supposent que le modèle statistique est correct (distribution adéquate, observations indépendantes, forme de relation bien spécifiée) et qu'il n'existe aucun biais systématique. Un biais, contrairement au hasard, ne se dilue pas quand on augmente l'effectif : il déplace l'estimation elle-même.
Trois familles à garder en tête : le biais de confusion (un facteur tiers explique l'association — par exemple l'âge, lié à la fois à l'exposition et à la maladie), le biais de sélection (les sujets inclus ne représentent pas la population visée) et le biais de mesure (exposition ou issue mal classée). Sur des données biaisées, un intervalle de confiance à 95 % parfaitement calculé reste centré sur la mauvaise valeur : il sera précis mais faux.
En clair — Un IC étroit dit « j'ai estimé cette valeur avec précision », pas « cette valeur est la vérité ». Sur un design biaisé, il vous donne une réponse précise… à la mauvaise question. Aucune statistique ne rattrape un recueil de données défaillant.
Ce qu'il faut reporter
Voici la check-list concrète à garder sous les yeux au moment de rédiger vos résultats. Pour chaque effet important :
- L'effet et sa précision — l'estimation (différence, risque relatif, odds ratio, hazard ratio…) avec son intervalle de confiance à 95 %.
- La valeur-p exacte (p = 0,03), plutôt qu'un « p < 0,05 » ou « NS » ; réservez « p < 0,001 » aux très petites valeurs.
- Le statut de l'analyse — distinguez nettement le critère de jugement principal pré-spécifié des critères secondaires et des analyses exploratoires.
- La correction pour tests multiples quand elle s'applique, avec le seuil ajusté retenu.
- Le seuil de pertinence clinique fixé à l'avance, pour que le lecteur juge l'amplitude de l'effet.
- Le test utilisé et ses conditions d'application, en précisant s'il est uni- ou bilatéral.
Deux situations demandent une attention particulière :
- Résultat non significatif — appuyez-vous sur l'intervalle de confiance : sa largeur dit si l'étude était concluante ou seulement trop peu puissante. Si vous parlez de puissance, citez la puissance planifiée a priori (celle du calcul d'effectif), jamais une « puissance observée » recalculée après coup, qui ne fait que reformuler la valeur-p.
- Conclusion d'équivalence — utilisez un test d'équivalence ou de non-infériorité dédié, jamais un test de supériorité non significatif.
En résumé
Une valeur-p mesure la compatibilité des données avec l'hypothèse nulle, rien de plus : ni la probabilité que H0 soit vraie, ni celle que le résultat soit dû au hasard, ni l'importance de l'effet. Le seuil de 0,05 n'est qu'une convention, et un résultat non significatif ne prouve jamais une absence de différence. Un résultat « significatif » n'est d'ailleurs pas forcément un vrai positif : sa fiabilité dépend aussi de la plausibilité a priori de l'hypothèse et de la puissance. Enfin, tout ce cadre ne vaut que si le modèle est correct et le design exempt de biais — un intervalle précis sur des données biaisées reste faux.
Pour une thèse solide, retenez trois réflexes : appuyez chaque conclusion sur l'intervalle de confiance, qui donne l'amplitude et la précision de l'effet ; confrontez la significativité statistique à la pertinence clinique ; et anticipez la question des comparaisons multiples en distinguant clairement vos hypothèses pré-spécifiées de vos analyses exploratoires. C'est cette rigueur, plus qu'un p spectaculaire, qui convainc un jury.