Le Tableau 1 : décrire sa population
Le premier tableau de votre thèse ne compare rien : il décrit qui vous avez étudié. C'est pourtant là que beaucoup de manuscrits trébuchent — une moyenne posée sur une variable très asymétrique, des p-values partout, des manquants passés sous silence. Voici comment construire un Tableau 1 qu'un jury lira sans froncer les sourcils, et ce qu'il y vérifiera en priorité.
À quoi sert vraiment le Tableau 1
Dans presque toute thèse quantitative, le premier tableau des résultats — le fameux « Table 1 » de la littérature anglo-saxonne — décrit les caractéristiques de la population incluse. Son rôle est simple et unique : permettre au lecteur de se représenter les patients, de juger la validité externe (à qui vos résultats pourront être transposés) et de repérer d'éventuels déséquilibres entre les groupes que vous comparerez ensuite.
Ce n'est pas un tableau d'analyse. Il ne répond pas à votre question de recherche ; il plante le décor. Cette distinction gouverne toutes les décisions qui suivent, à commencer par le choix des statistiques et par la question des tests.
En clair — Le Tableau 1 est la carte d'identité de votre échantillon. On y lit qui sont les patients, pas si un traitement marche.
Quelle statistique pour quel type de variable
La règle de base tient en trois lignes, selon la nature de la variable et, pour les variables quantitatives, selon la forme de sa distribution.
| Type de variable | Statistique descriptive | Exemple de présentation |
|---|---|---|
| Quantitative à distribution symétrique | Moyenne ± écart-type | Âge : 54,2 ± 11,8 ans |
| Quantitative asymétrique ou avec valeurs extrêmes | Médiane [Q1 – Q3] | Durée de séjour : 6 [4 – 11] jours |
| Quantitative log-normale (charge virale, dosages, titres) | Moyenne géométrique (ou médiane [Q1 – Q3]) | Charge virale : 3 200 copies/mL (moy. géom.) |
| Qualitative nominale, ou ordinale à peu de modalités | Effectif n (%) | Sexe féminin : 128 (46 %) |
| Ordinale à nombreux niveaux (scores, échelles) | Médiane [Q1 – Q3] (souvent préférable) | mRS : 3 [2 – 4] |
Un mot sur les variables ordinales, souvent expédiées trop vite. Une variable ordinale à peu de modalités (grade binaire, stade en deux ou trois classes) se décrit très bien par un n (%) par modalité. En revanche, une variable ordinale à nombreux niveaux ordonnés — échelle de Rankin modifiée (mRS, 7 niveaux), échelle visuelle analogique ou numérique de la douleur, stades TNM, échelles de type Likert — devient illisible et perd son information d'ordre si on l'éclate en une ligne par modalité. Pour celles-là, on préfère souvent la médiane [Q1 – Q3], comme pour une quantitative ; le choix dépend du nombre de modalités et de ce que l'on veut faire ressortir, et rien n'interdit de donner les deux.
Quelques précisions qui font la différence. L'écart-type (SD) décrit la dispersion des individus ; il ne faut pas le confondre avec l'erreur standard de la moyenne (SEM), qui décrit la précision d'estimation de la moyenne et est plus petite. Dans un Tableau 1, on veut décrire la population : c'est l'écart-type qu'on rapporte, jamais la SEM.
Pour une variable asymétrique, on rapporte la médiane accompagnée des deux quartiles Q1 et Q3 — les 25e et 75e percentiles —, notés [Q1 – Q3] : par exemple 6 [4 – 11]. Précisez dans les méthodes ce que contient le crochet, car certaines équipes y mettent les valeurs extrêmes (min – max) plutôt que les quartiles : cette ambiguïté est une source classique de remarque en soutenance.
Pour une variable qualitative, donnez l'effectif et le pourcentage. Le pourcentage seul masque la taille réelle (2 patients sur 3, ce n'est pas 200 sur 300), et l'effectif seul oblige le lecteur à faire le calcul.
Piège des décimales. Un âge à 54,23718 ans ou un pourcentage à 46,4286 % suggère une précision qui n'existe pas. Une décimale suffit presque toujours pour une moyenne ; pour un pourcentage, l'entier ou une décimale au maximum. Sur un petit effectif, mieux vaut parfois écrire « 2/28 » que « 7,1 % » — un pourcentage sur 28 patients n'a pas trois chiffres significatifs.
Quand l'effectif est très petit (une dizaine de patients, une série de cas), moyenne comme médiane deviennent instables : une seule valeur change tout, et les quartiles n'ont presque plus de sens. Mieux vaut alors montrer directement les valeurs extrêmes — le minimum et le maximum (min – max) — voire lister les données brutes patient par patient. Le lecteur voit ainsi la réalité des chiffres au lieu d'un résumé qui donne une fausse impression de stabilité.
Symétrique ou asymétrique : comment décider
Le réflexe fréquent est de lancer un test de normalité (le plus courant est le Shapiro-Wilk) et de suivre aveuglément son verdict. C'est une mauvaise habitude. Ces tests répondent à une question binaire — « la distribution est-elle exactement normale ? » — qui n'est pas celle qui vous intéresse : vous voulez seulement savoir si un résumé par la moyenne est raisonnable.
Pour aller plus loin — quel test de normalité ? (optionnel)
Le Shapiro-Wilk est souvent présenté comme le plus puissant des tests usuels, mais ce n'est pas une vérité absolue : sa puissance dépend de la façon dont la vraie distribution s'écarte de la normale (asymétrie, aplatissement, queues épaisses) — selon cet écart, tel ou tel test peut être plus sensible. On croise aussi le Kolmogorov-Smirnov : sa version « brute » suppose une loi entièrement spécifiée (moyenne et variance connues d'avance) ; pour tester la normalité avec des paramètres estimés sur l'échantillon, il faut la correction de Lilliefors. Détail utile à connaître, mais qui ne change rien à la règle ci-dessous : aucun de ces tests ne remplace le coup d'œil sur la distribution.
Leur défaut est double. Sur un petit échantillon, le test manque de puissance et ne rejette que très rarement la normalité, même sur une distribution franchement tordue : un test non significatif ne prouve donc pas la normalité, il reflète surtout le manque de données. Sur un grand échantillon, il devient hypersensible et rejette la normalité pour des écarts infimes et sans conséquence pratique. Dans les deux cas, la décision qu'il vous dicte peut être l'inverse de la bonne.
La bonne méthode est l'inspection : tracez un histogramme et une boîte à moustaches, regardez la forme, l'asymétrie, les valeurs extrêmes. Comparez la moyenne et la médiane : si elles s'écartent nettement, la distribution est asymétrique. Ajoutez le sens clinique : certaines variables sont asymétriques par nature (durées de séjour, délais, dosages biologiques, charge virale, âge gestationnel dans certaines populations). Pour celles-là, la médiane [Q1 – Q3] est le plus souvent le meilleur choix, indépendamment de tout test.
En clair — Le test de normalité ne décide pas à votre place. On regarde la forme et on se demande ce que la variable représente cliniquement. La moyenne ne résume bien la valeur typique que si la distribution est à peu près symétrique ; sur une variable asymétrique, elle est tirée vers la queue et la médiane est plus honnête.
La moyenne géométrique : la moyenne des variables log-normales
Beaucoup de variables biologiques asymétriques — charge virale, dosages (anticorps, hormones, enzymes), titres de dilution — ne sont pas seulement « étirées à droite » : elles deviennent presque symétriques dès qu'on les regarde sur une échelle logarithmique. On parle de distribution log-normale. Pour ces variables, un outil canonique complète médiane et moyenne classique : la moyenne géométrique. Concrètement, on prend le logarithme de chaque valeur, on calcule la moyenne (là, symétrique) sur cette échelle, puis on repasse en unités d'origine (exponentielle). Pour une distribution log-normale « parfaite », elle coïncide même avec la médiane ; en pratique elle en reste très proche, résiste bien aux grandes valeurs et garde le sens d'une « moyenne ».
En clair — Une charge virale qui va de 100 à 1 000 000 copies se lit mal en moyenne arithmétique (écrasée par les gros chiffres) ; sur l'échelle log, chaque « facteur 10 » compte pareil. La moyenne géométrique est la moyenne juste de ce genre de variables — d'où son usage courant pour les charges virales et les titres d'anticorps.
Pour aller plus loin — deux nuances sur la moyenne géométrique (optionnel)
Valeurs nulles ou « indétectables ». La moyenne géométrique passe par le logarithme, or log(0) n'existe pas : une seule valeur nulle rend le calcul impossible. C'est fréquent sur la charge virale, où une partie des patients sont indétectables (résultat rendu « < seuil », souvent codé 0). Ne remplacez pas ces valeurs par un chiffre choisi en douce : signalez leur proportion, et si elle est importante, la moyenne géométrique n'est plus le bon résumé — préférez la médiane et le pourcentage de patients sous le seuil.
Coûts et consommation de ressources. Sur des données de coûts ou de durée de séjour, la médiane n'est pas toujours la bonne réponse : si la question est budgétaire, c'est la moyenne qui porte le sens, car le coût total d'une file de patients, c'est la moyenne multipliée par l'effectif. On rapporte alors souvent la moyenne en plus de la médiane.
Décrire par groupes
La plupart des thèses comparent des groupes : cas vs témoins, exposés vs non exposés, bras A vs bras B. Le Tableau 1 présente alors une colonne par groupe, souvent précédée d'une colonne « ensemble de la population ». Chaque ligne applique la règle statistique adaptée au type de variable, de façon identique dans chaque colonne : on ne mélange pas moyenne dans une colonne et médiane dans l'autre pour la même variable.
L'intérêt de cette présentation est de rendre visibles les déséquilibres entre groupes : un âge plus élevé chez les cas, plus de comorbidités chez les exposés. Certains concernent des variables suspectes de confusion — liées à la fois à l'exposition et à l'événement étudié.
Mais attention. Les facteurs que vous ajusterez ensuite se choisissent a priori, sur des arguments cliniques, pas à partir de ce qui « paraît » déséquilibré dans le tableau. Un vrai confondeur peut être parfaitement équilibré par le seul hasard ; à l'inverse, un déséquilibre observé ne prouve pas à lui seul une confusion. Rendre visible, ce n'est donc ni tester, ni choisir ses ajustements sur les écarts constatés. C'est le point le plus mal compris du Tableau 1.
En clair — Le tableau par groupes sert à voir les écarts, pas à les tester. Et les variables que vous ajusterez ensuite se choisissent à l'avance, sur des arguments cliniques — jamais parce qu'une ligne « paraît » déséquilibrée.
Le débat des p-values dans le Tableau 1
La question revient à chaque soutenance : faut-il ajouter une colonne de p-values comparant les groupes ? Dans une étude observationnelle descriptive, la réponse recommandée par de nombreuses revues et par les méthodologistes est non. Plusieurs raisons convergentes.
D'abord, un p ne mesure pas ce qui vous intéresse ici. Il quantifie la compatibilité d'un écart observé avec l'hypothèse du seul hasard d'échantillonnage. Or ce qui importe pour un facteur de confusion, ce n'est pas de savoir si un déséquilibre est « significatif », c'est son ampleur et sa plausibilité clinique. Un écart d'âge de quelques mois peut être « significatif » sur un grand échantillon sans avoir la moindre importance ; un écart de dix ans peut être « non significatif » sur un petit échantillon tout en étant un confondeur majeur.
Ensuite, à ampleur d'écart donnée, la significativité dépend fortement de la taille de l'échantillon. Le même déséquilibre relatif donnera un p minuscule sur 2 000 patients et un p non significatif sur 60. Piloter la décision d'ajustement par un seuil de p, c'est laisser la taille de l'étude décider à la place de la clinique — exactement l'inverse de ce qu'il faut faire.
Enfin, multiplier les tests sur toutes les lignes du tableau relève du test multiple non planifié : certaines « significativités » apparaîtront par pur hasard, et elles n'ont pas de sens puisqu'aucune de ces comparaisons n'était une hypothèse de recherche.
Piège de jury nº 1 : « chercher » des différences significatives dans le Tableau 1. Présenter une colonne de p et commenter les lignes étoilées comme des résultats donne l'impression que vous confondez description et inférence. Un déséquilibre pertinent se justifie par sa taille et son rôle clinique de confusion, pas par un astérisque. Attendez-vous à la question : « Pourquoi ce test, et qu'auriez-vous conclu s'il avait été non significatif ? »
Cela dit, la règle « jamais de p » n'est pas absolue. Il existe un cas légitime : celui où comparer les deux groupes est votre question descriptive. Si votre travail vise justement à décrire en quoi deux populations diffèrent — par exemple comparer le profil des patients de deux centres, ou décrire comment une cohorte a changé entre deux périodes — alors la comparaison n'est plus un artefact : c'est l'objet même de l'étude. Un test au Tableau 1 peut alors se défendre, à condition de l'assumer clairement dans l'objectif et de ne pas le confondre avec la recherche « au petit bonheur » de lignes significatives. Le vrai reproche du jury n'est pas le test en soi, c'est le test injustifié.
En pratique, avec un logiciel. La plupart des outils (le nôtre compris) ajoutent la colonne de p par défaut dès que vous stratifiez le tableau. C'est à vous de décider : dans un Tableau 1 descriptif ou étiologique, retirez-la et commentez plutôt l'ampleur des écarts ; si comparer les groupes est votre objectif, gardez-la et assumez-le dans vos méthodes. Le logiciel produit le calcul ; le choix de le montrer reste un choix méthodologique, le vôtre.
Dans ce cas légitime, encore faut-il choisir le bon test selon le type de variable — la même logique que pour n'importe quelle comparaison de deux groupes indépendants.
| Type de variable | Test usuel (2 groupes) | Quand plutôt l'alternative |
|---|---|---|
| Quantitative, distribution ~ symétrique | Test t de Welch (par défaut) ; Student si variances égales | — |
| Quantitative asymétrique ou petit effectif | Mann-Whitney (Wilcoxon) | Dès que le t n'est pas raisonnable |
| Qualitative (proportions) | Chi-2 | Fisher exact si les effectifs attendus sont trop petits (voir la règle ci-dessous) |
Deux précisions que les jurys apprécient. D'abord, pour comparer deux moyennes, le choix par défaut aujourd'hui n'est pas le test t de Student « classique » mais le test t de Welch. Le Student suppose que les deux groupes ont la même variance (même dispersion) ; le Welch ne l'exige pas et reste valide quand les variances diffèrent — cas fréquent, surtout si les groupes sont de tailles inégales. Quand les variances sont égales, les deux donnent des résultats quasi identiques : Welch ne coûte donc presque rien et évite un mauvais pari.
Ensuite, pour le Fisher exact, retenez la règle pratique : sur le tableau 2 × 2 le plus courant, dès qu'une case a un effectif attendu inférieur à 5, on bascule du chi-2 sur Fisher.
Pour aller plus loin — la règle exacte du Fisher (optionnel)
La règle de référence (Cochran) est plus nuancée que « une case attendue < 5 » : le chi-2 reste acceptable tant que pas plus de 20 % des cases ont un effectif attendu inférieur à 5, et qu'aucune n'a un effectif attendu inférieur à 1. Sur un tableau 2 × 2 (quatre cases), « 20 % des cases » revient à zéro case tolérée — d'où la version raccourcie ci-dessus. La nuance ne change vraiment la décision que sur des tableaux plus grands.
En clair — Variable chiffrée à peu près symétrique : test t (de Welch de préférence, qui ne suppose pas des variances égales). Chiffrée mais tordue, ou très peu de patients : Mann-Whitney. Comptage en catégories : chi-2, et Fisher quand les cases attendues sont trop petites (pas plus de 20 % des cases sous 5, aucune sous 1). Choisissez le test avant de regarder les résultats, pas après.
Et si vous comparez trois groupes ou plus ?
Le tableau ci-dessus compare deux groupes — le cas le plus fréquent. Mais beaucoup de thèses en comparent trois ou davantage : plusieurs centres, plusieurs stades de sévérité, plusieurs bras. Comparer les groupes deux à deux avec des tests t ou chi-2 répétés multiplie alors les comparaisons et gonfle le risque de fausse découverte. On utilise plutôt un test conçu pour comparer tous les groupes d'un coup.
| Type de variable | Test usuel (3 groupes ou plus) |
|---|---|
| Quantitative, distribution ~ symétrique | ANOVA de Welch par défaut (ne suppose pas des variances égales) ; ANOVA classique si variances comparables |
| Quantitative asymétrique ou petit effectif | Kruskal-Wallis (l'équivalent « non paramétrique » de l'ANOVA) |
| Qualitative (proportions) | Chi-2 sur le tableau entier (Fisher exact si les cases attendues sont trop petites) |
Une cohérence à ne pas perdre en chemin : de même qu'à deux groupes on préfère le t de Welch parce qu'il n'exige pas des variances égales, l'ANOVA classique fait exactement la même hypothèse d'homoscédasticité (toutes les variances égales). L'analogue cohérent du conseil « Welch par défaut » est donc l'ANOVA de Welch — même idée, transposée à trois groupes ou plus : elle reste valide quand les groupes n'ont pas la même dispersion, un cas courant dès que leurs effectifs sont inégaux. Réserver l'ANOVA classique aux cas où les variances sont manifestement comparables.
En clair — L'ANOVA est le « test t à plusieurs groupes », et Kruskal-Wallis en est la version pour distributions tordues ou petits effectifs, comme Mann-Whitney l'est du test t. Ces tests disent seulement « au moins deux groupes diffèrent quelque part » ; savoir lesquels demande ensuite des comparaisons deux à deux avec correction du nombre de tests. Et, tout comme à deux groupes, la mise en garde sur les p au Tableau 1 reste valable : on ne teste que si comparer les groupes est vraiment l'objectif.
Le cas des essais randomisés et des populations appariées
Ici l'argument contre les p est encore plus fort, pour une raison différente. Dans un essai randomisé, on sait par construction que toute différence entre bras à l'inclusion est due au hasard de la randomisation : tester l'hypothèse nulle « les groupes viennent de la même population » n'a aucun sens, puisqu'elle est vraie par définition.
Ce qui est utile, en revanche, c'est de juger si un déséquilibre est assez grand pour peser sur le résultat. Pour cela, on rapporte des différences standardisées (SMD, standardized mean difference). La SMD exprime l'écart entre deux groupes en unités d'écart-type. Son grand avantage sur le p : elle ne gonfle pas avec la taille de l'échantillon — un plus grand effectif rend seulement sa mesure plus précise. C'est donc elle, et non un seuil de significativité, qui sert de critère d'équilibre : par convention, une |SMD| inférieure à 0,1 traduit un bon équilibre. Le principe vaut pour tout type de variable.
La SMD est surtout l'outil de référence après un appariement ou une pondération par score de propension : on compare la SMD avant et après pour montrer que la procédure a bien rééquilibré les groupes. Après une pondération, calculez-la sur les données pondérées (on parle de SMD pondérée) ; la formule brute surestimerait le rééquilibrage.
En essai randomisé, la recommandation première du CONSORT reste simplement de ne pas faire de tests à l'inclusion. La SMD n'y est qu'un descripteur optionnel, et les covariables à ajuster se pré-spécifient dans le protocole, indépendamment de tout déséquilibre observé.
Pour aller plus loin — comment se calcule une SMD (optionnel)
Pour une variable quantitative, la SMD est la différence des moyennes divisée par un écart-type commun « poolé » non pondéré par les effectifs, soit √((s1² + s2²) / 2) — la simple moyenne des deux variances de groupe. Ce choix rend la SMD stable même quand les groupes sont de tailles très différentes (typiquement avant/après appariement).
Pour une variable binaire, on remplace moyennes et écarts-types par les proportions : SMD = (p1 − p2) / √[(p1(1 − p1) + p2(1 − p2)) / 2], où p(1 − p) tient lieu de variance. Pour une variable catégorielle à plusieurs modalités, une extension compare les proportions de toutes les modalités d'un coup, en un seul chiffre, plutôt que modalité par modalité.
En clair — Le p répond à « cet écart est-il compatible avec le seul hasard ? », une question sans intérêt quand on sait déjà que oui (randomisation) ou quand on décrit seulement. La SMD répond à « l'écart est-il grand ? », la seule qui compte pour un déséquilibre.
Les données manquantes : à déclarer, toujours
Aucune base clinique n'est complète. Le Tableau 1 doit rendre les données manquantes visibles, variable par variable — sur une ligne « données manquantes : n », dans une colonne dédiée, ou en note. C'est d'ailleurs ce qu'exige STROBE (item 14) pour les études observationnelles : indiquer, pour chaque variable d'intérêt, le nombre de participants avec donnée manquante. Deux raisons à cela.
La première est la transparence : un lecteur ne peut juger la solidité d'une variable renseignée pour 40 % des patients de la même façon qu'une variable complète. La seconde est technique : quand des valeurs manquent, chaque pourcentage doit indiquer quel dénominateur a servi. Calculer un pourcentage sur les seuls cas disponibles sans le dire fausse la lecture et peut biaiser toute interprétation.
Piège de jury nº 2 : les manquants oubliés. Un tableau où tous les effectifs de colonne tombent pile sur le total, alors que la base réelle a des trous, éveille la méfiance. Soit vous avez masqué les manquants, soit vous les avez exclus en silence. Annoncez-les et précisez le dénominateur de chaque proportion.
Ce qu'il faut reporter
- L'effectif de chaque groupe dans l'en-tête de colonne (ex. « Cas (n = 140) »), pour situer chaque n et chaque pourcentage.
- Pour chaque variable quantitative symétrique : moyenne ± écart-type (l'écart-type, pas la SEM).
- Pour chaque variable quantitative asymétrique : médiane [Q1 – Q3], en précisant dans les méthodes que le crochet donne les quartiles. Pour une variable log-normale (charge virale, dosages, titres), la moyenne géométrique est un descripteur adapté ; sur des données de coûts / ressources, penser à donner aussi la moyenne, qui porte le sens budgétaire.
- En très petit effectif : préférer les valeurs extrêmes (min – max), voire les données brutes, à un résumé faussement stable.
- Pour chaque variable qualitative : effectif n (%), jamais le pourcentage seul ; pour une variable ordinale à nombreux niveaux (scores, échelles), une médiane [Q1 – Q3] est souvent plus lisible.
- Une colonne par groupe comparé, avec la même statistique pour une variable donnée dans toutes les colonnes, et une colonne « ensemble » si utile.
- Le nombre de données manquantes pour chaque variable concernée (item 14 de STROBE), et le dénominateur réellement utilisé pour chaque proportion.
- Après appariement / score de propension : des différences standardisées (SMD) plutôt qu'une colonne de p-values — et après une pondération, une SMD pondérée (calculée sur les données pondérées). En essai randomisé, la SMD reste optionnelle et aucun test d'inclusion n'est requis.
- Un nombre de décimales sobre : une décimale pour les moyennes, entier ou une décimale pour les pourcentages.
- Dans les méthodes : la justification du choix moyenne/médiane (inspection de la distribution), le contenu des crochets, et la gestion des manquants.
En résumé
Le Tableau 1 décrit, il ne démontre pas. On y applique une statistique adaptée à chaque type de variable — moyenne ± écart-type quand la distribution est symétrique, médiane [Q1 – Q3] quand elle est asymétrique (ou pour une variable ordinale à nombreux niveaux), n (%) pour le qualitatif — la forme se jugeant à l'œil et au sens clinique bien plus qu'à un test de normalité. Dans une étude observationnelle, on s'abstient de semer des p-values entre les groupes : un déséquilibre se juge à sa taille et à son rôle de confusion, non à un seuil de significativité, et le choix des variables d'ajustement se décide a priori sur des arguments causaux, pas sur l'imbalance observée. Après appariement, on préfère les différences standardisées, dont la valeur attendue ne dépend pas de l'effectif ; en essai randomisé, on se garde des tests d'inclusion et l'on pré-spécifie ses ajustements. Et l'on déclare toujours les données manquantes, comme le demande STROBE. Un jury ne demande pas un tableau spectaculaire : il demande un tableau honnête, lisible et défendable — c'est exactement ce que ces règles produisent.