← Tous les articles

Valeurs manquantes : les gérer sans biaiser sa thèse

Mis à jour le 21 août 2026 · 10 min de lecture · Équipe Diagnostats

Presque aucune base de données clinique n'est complète : un âge non renseigné, un bilan non revenu, un patient perdu de vue. La façon dont vous traitez ces trous décide souvent de la validité de vos conclusions — au moins autant que le choix du test statistique. Cet article clarifie les trois mécanismes de manquance, pourquoi les solutions « par réflexe » (supprimer les lignes, remplacer par la moyenne) biaisent votre travail, et ce qu'un jury vérifiera vraiment dans votre manuscrit.

Pourquoi les données manquantes ne sont pas un détail

Face à une case vide, la tentation est de la contourner discrètement : le logiciel écarte les patients incomplets, l'analyse tourne, un p s'affiche. Le problème, c'est que ce silence a des conséquences invisibles. Écarter des patients peut introduire un biais de sélection si les patients incomplets diffèrent systématiquement des autres, et cela réduit toujours la taille de l'échantillon, donc la puissance de vos analyses. Combler les trous à la va-vite fabrique, lui, une fausse précision.

La bonne nouvelle : il existe un cadre clair et reconnu pour raisonner. Il repose d'abord sur une question — pourquoi cette donnée est-elle manquante ? — avant toute question de méthode.

Les trois mécanismes de manquance

La terminologie de référence, formalisée par Rubin (1976) puis systématisée par Little et Rubin, distingue trois situations. Elle décrit non pas les valeurs manquantes elles-mêmes, mais le processus qui décide qu'une valeur sera manquante.

MCAR — manquant complètement au hasard

MCAR (Missing Completely At Random) : la probabilité qu'une valeur soit absente ne dépend ni des données observées, ni des données non observées. L'absence est un pur accident, sans lien avec quoi que ce soit de médical. Exemple : un tube d'analyse cassé lors du transport, un formulaire perdu par hasard. Sous MCAR, les patients complets forment un sous-échantillon représentatif de la population de départ.

En clair — Sous MCAR, les trous tombent « au petit bonheur ». On perd de l'information (donc de la puissance), mais on ne fausse pas systématiquement les résultats.

MAR — manquant au hasard, conditionnellement à l'observé

MAR (Missing At Random) : la probabilité d'être manquant dépend de variables observées, mais pas de la valeur manquante elle-même une fois ces variables prises en compte. Exemple : les hommes remplissent moins souvent un questionnaire de qualité de vie que les femmes ; le fait d'avoir la réponse dépend du sexe (observé), et non de la qualité de vie réelle du patient à sexe égal. Le nom prête à confusion : MAR ne signifie pas « au hasard » au sens courant, mais « au hasard une fois qu'on tient compte de ce qu'on sait déjà ».

En clair — Sous MAR, l'information qui explique les trous est dans vos données : on peut donc s'en servir pour reconstruire intelligemment ce qui manque. C'est l'hypothèse de travail des méthodes modernes. Bon à savoir : MCAR est simplement un cas particulier « chanceux » de MAR ; une méthode valide sous MAR l'est donc aussi sous MCAR. MNAR (ci-dessous) désigne la situation où cette hypothèse tombe en défaut — mais ce n'est pas une case qu'on lit dans les données : c'est une hypothèse de travail qu'on argumente.

MNAR — manquant non au hasard

MNAR (Missing Not At Random) : le fait d'être manquant dépend de la valeur manquante elle-même, même après ajustement sur tout ce qui est observé. Exemple : les patients dont la douleur est la plus intense ne reviennent pas à la consultation de suivi ; la valeur de douleur manque précisément parce qu'elle est élevée. Autre exemple : un revenu non déclaré surtout quand il est très haut ou très bas. Ici, l'information qui expliquerait le trou est justement celle qui manque.

Aucun test ne prouve le mécanisme. On ne peut pas distinguer MAR de MNAR à partir des seules données observées, puisque cela demanderait de connaître les valeurs… manquantes. Le fameux test de Little ne teste que MCAR contre « non-MCAR », ne distingue pas MAR de MNAR, et un résultat non significatif ne prouve pas MCAR. Le mécanisme se raisonne cliniquement et s'argumente ; il ne se démontre pas par un p.

Pour aller plus loin (optionnel) — Il existe des méthodes qui modélisent explicitement le MNAR (les modèles de sélection et les modèles pattern-mixture). Retenez seulement l'idée : elles servent à dire à voix haute « les manquants sont peut-être différents des présents » et à tester la solidité de vos conclusions — jamais à récupérer l'information perdue. L'analyse du « point de bascule » décrite plus loin en est la version simple.

Pourquoi cette distinction change tout ? Parce que la validité de chaque méthode en dépend : l'analyse sur cas complets suppose (à peu près) MCAR pour être non biaisée, l'imputation multiple standard suppose MAR, et le MNAR exige des approches spécifiques et, surtout, une honnêteté sur l'incertitude résiduelle.

Ce qu'il ne faut (presque) jamais faire

L'analyse sur cas complets, faite en silence

L'analyse sur cas complets (complete-case) supprime tout patient ayant au moins une donnée manquante parmi les variables du modèle. C'est le comportement par défaut de beaucoup de logiciels. Deux problèmes : si les manquants ne sont pas MCAR, les patients restants ne sont plus représentatifs et les estimations sont biaisées ; et même sous MCAR, on jette de l'information, donc on perd de la puissance et on élargit les intervalles de confiance.

Piège de soutenance : supprimer des lignes sans le dire. Passer de 300 à 210 patients « parce que le logiciel l'a fait » sans le mentionner est l'un des reproches les plus fréquents en jury. La question tombe presque à coup sûr : « combien de patients avez-vous réellement analysés, et ceux que vous avez exclus étaient-ils différents ? »

À noter : l'analyse sur cas complets n'est pas toujours à bannir. Quand les manquants sont rares et sans profil particulier, ou dans une régression où le fait d'être un cas complet ne dépend pas de la variable à expliquer une fois les covariables prises en compte, elle peut rester acceptable : la manquance peut alors porter sur les covariables, voire y être MNAR, sans biaiser les coefficients — à condition d'être déclarée et justifiée. Ce cas ne contredit pas la mise en garde ci-dessus : celle-ci porte sur la représentativité de l'échantillon et les estimations descriptives, alors qu'ici on parle des coefficients d'une régression, dont la validité tient à cette seule condition (manquance indépendante de la variable à expliquer une fois les covariables prises en compte).

Remplacer par la moyenne

Imputer chaque trou par la moyenne (ou la médiane) de la variable semble inoffensif. C'est en réalité une mauvaise pratique bien identifiée. En posant tous les patients manquants sur la même valeur centrale, on écrase artificiellement la variance de la variable et on atténue ses corrélations avec les autres. Pire : ces valeurs inventées sont ensuite traitées comme si elles avaient été mesurées, ce qui sous-estime les erreurs standards, rétrécit les intervalles de confiance et gonfle le risque d'erreur de type I. On obtient une précision de façade.

Les points pleins suivent la relation réelle ; les points creux, imputés à la moyenne, s'alignent sur une bande plate et diluent la corrélation.

LOCF — reporter la dernière valeur

Dans les études longitudinales, la méthode LOCF (Last Observation Carried Forward) reporte la dernière valeur mesurée pour combler les temps manquants. Longtemps utilisée dans les essais, elle est aujourd'hui déconseillée. Elle suppose implicitement que l'état du patient reste figé après sa sortie, hypothèse rarement crédible. Surtout, le sens du biais qu'elle induit sur l'effet du traitement dépend à la fois de l'évolution du patient et du bras auquel il appartient : reporter une dernière valeur plus favorable pour un patient du bras traité qui s'aggrave après sa sortie surestime l'effet du traitement ; le même mécanisme dans le bras contrôle le sous-estime. Comme l'imputation par la moyenne, elle traite une valeur inventée comme certaine et fausse l'estimation de la variabilité. Le biais peut donc aller dans les deux sens et n'est pas « conservateur » comme on l'a longtemps cru.

Dans les études à mesures répétées — le cadre même où le LOCF était employé —, la parade recommandée n'est d'ailleurs pas nécessairement l'imputation : un modèle mixte (dans les essais, le plus souvent un MMRM, mixed model for repeated measures) analyse directement toutes les observations disponibles et reste valide sous MAR, sans reconstruire les valeurs manquantes. C'est aujourd'hui la référence pour remplacer le LOCF dans les essais.

Le mot que le jury attend : l'estimand. Depuis l'addendum ICH E9(R1), on ne discute plus « comment gérer les manquants » dans le vide, mais d'abord quelle grandeur on cherche à estimer — l'estimand — et comment les données manquantes (arrêts de traitement, décès, perdus de vue) entrent dans cette définition. En clair : préciser la question avant de choisir la méthode. C'est dans ce langage qu'on justifie aujourd'hui qu'un LOCF est inadéquat et qu'on cadre une analyse de sensibilité ; le mentionner, même brièvement, signale une maîtrise appréciée.

Le standard actuel : l'imputation multiple

Sous hypothèse MAR, la méthode de référence est l'imputation multiple, dont la variante la plus répandue est MICE (Multiple Imputation by Chained Equations, ou imputation par équations chaînées). Son idée maîtresse : au lieu de combler chaque trou par une valeur unique — ce qui revient à prétendre qu'on connaît la réponse —, on reconnaît qu'on ne la connaît pas et on génère plusieurs valeurs plausibles. MICE s'est imposée en pratique parce qu'elle impute chaque variable tour à tour, ce qui lui permet de s'accommoder souplement de variables de natures différentes (binaires, catégorielles, continues).

À savoir — L'imputation multiple n'est pas la seule voie valide sous MAR. Le modèle mixte (déjà croisé avec le LOCF) analyse directement les données disponibles, sans jamais fabriquer de valeur ; il est tout aussi fondé. Le choix entre les deux dépend surtout de votre plan d'analyse.

Le principe de l'imputation multiple se déroule en trois temps :

ÉtapeCe qui se passe
1. ImputerOn crée m copies complètes du jeu de données (souvent m = 5 à 50). Dans chacune, les valeurs manquantes sont remplacées par des valeurs tirées à partir d'un modèle utilisant les autres variables observées, avec une part d'aléa qui reflète l'incertitude.
2. AnalyserOn réalise l'analyse prévue (régression, comparaison de moyennes…) séparément sur chacune des m copies. On obtient m estimations, légèrement différentes.
3. CombinerOn agrège les m résultats par les règles de Rubin : l'estimation finale est la moyenne des estimations ; l'erreur standard combine la variabilité à l'intérieur de chaque imputation et la variabilité entre imputations.

En clair — L'imputation multiple ne cherche pas à « deviner juste » chaque valeur. Elle cherche à ce que votre incertitude soit honnête : la variabilité entre les copies ajoute précisément l'ignorance liée aux données manquantes, que l'imputation simple oublie.

C'est ce troisième temps qui distingue l'imputation multiple de toutes les méthodes précédentes. En combinant les deux sources de variabilité, les règles de Rubin produisent des intervalles de confiance qui ne sont ni trop étroits ni trompeurs. Là où l'imputation par la moyenne mentait sur la précision, l'imputation multiple la restitue correctement.

m imputations (ici 3)Jeu de donnéesincompletJeu complété 1Jeu complété 2Jeu complété 3Analyse 1Analyse 2Analyse 3Estimation combinée(règles de Rubin)
Un seul jeu incomplet donne m jeux complétés (ici 3 pour la lisibilité du schéma ; en pratique au moins 5, voir plus bas) ; chacun est analysé séparément, puis les résultats sont combinés en une estimation unique : c'est ce passage par plusieurs copies qui propage l'incertitude de l'imputation.

Pour aller plus loin (optionnel) — les règles de Rubin en chiffres. Un exemple concret. Imaginons un coefficient estimé sur m = 5 copies : 0,40 · 0,52 · 0,46 · 0,58 · 0,44. L'estimation finale est leur moyenne, soit 0,48. Pour l'erreur standard, on combine deux ingrédients : la précision à l'intérieur de chaque copie (ce qu'on aurait sans manquants) et le désaccord entre les copies (la marque des données manquantes). Ici, l'erreur standard passe de 0,20 à environ 0,21 : ce léger élargissement, c'est exactement le prix des données manquantes, rendu visible et honnête — là où l'imputation par la moyenne le masquait.

Bonne nouvelle : vous n'avez aucun de ces calculs à faire à la main. Les logiciels appliquent aussi, tout seuls, de légères corrections sur les petits échantillons, qui rendent vos p et intervalles un peu plus prudents — à juste titre.

Quelques bonnes pratiques : inclure dans le modèle d'imputation toutes les variables de l'analyse, y compris la variable à expliquer, plus d'éventuelles variables auxiliaires qui prédisent la manquance ou l'issue (cela rend l'hypothèse MAR plus crédible) ; et imputer chaque variable sur l'échelle qui lui convient (une variable binaire par régression logistique, par exemple).

Combien d'imputations ? On ne se cale pas sur le nombre de cases vides, mais sur la fraction d'information manquante (FMI) : la part de l'incertitude de votre résultat qui provient réellement des trous. Règle simple : prendre m au moins égal à la FMI exprimée en pourcentage (soit m ≈ 100 × FMI). Le vieux m = 5 n'est donc plus une cible mais un plancher : avec 30 % d'information manquante, on vise plutôt m ≈ 30. En prendre davantage ne coûte que du temps de calcul.

Jusqu'où l'imputation tient-elle ? L'imputation multiple reconstruit l'information manquante à partir de l'information présente ; quand la proportion de manquants — ou la FMI — devient très élevée, au-delà d'environ 40 à 50 % sur une variable clé, il reste trop peu de données réelles pour la guider. Les valeurs imputées reflètent alors surtout le modèle d'imputation lui-même, et les résultats deviennent fragiles. Il n'y a pas de seuil couperet, mais passé ce cap, l'imputation ne remplace plus une donnée : elle devient une hypothèse à éprouver en analyse de sensibilité — et l'honnêteté commande de le signaler.

Les trois conditions de validité. Pour que l'imputation multiple soit fiable, trois choses doivent tenir ensemble. (1) L'hypothèse MAR — l'information qui explique les trous est bien dans vos données. (2) La congénialité : le modèle qui impute et le modèle qui analyse doivent parler la même langue ; concrètement, tout ce qui figure dans l'analyse finale (interaction, terme au carré, variable) doit déjà exister dans le modèle d'imputation, sinon les règles de Rubin perdent leur garantie. (3) Un modèle d'imputation correctement spécifié — les bonnes variables, sur la bonne échelle, avec la bonne forme de relation ; un modèle faux produit des valeurs biaisées même sous MAR (d'où les vérifications de la section suivante).

Pour aller plus loin (optionnel) — deux pièges d'imputation. À garder en tête seulement si votre analyse est concernée ; sinon, passez.

  • Analyse de survie (modèle de Cox) : n'imputez pas à partir de la durée de suivi brute. Le modèle d'imputation doit tenir compte à la fois de la survenue de l'événement (décès, rechute) et du temps de suivi transformé — un détail que les guides de mice expliquent pas à pas.
  • Interaction ou terme au carré : ne les ajoutez pas comme une colonne de plus à imputer. Imputez les variables de base, puis recalculez le terme ensuite.

Vérifier que l'imputation a bien fonctionné

Une imputation multiple ne se lance pas « en aveugle » : on vérifie deux choses avant d'exploiter les résultats. D'abord la convergence de l'algorithme, qui impute chaque variable tour à tour sur plusieurs itérations : on trace l'évolution des valeurs imputées au fil des itérations (trace plots), et les courbes doivent se stabiliser, sans tendance ni cycle persistant. Ensuite la plausibilité des valeurs imputées : elles doivent rester cliniquement crédibles (pas d'âge négatif, pas d'hémoglobine à 300) et ressembler à la distribution des valeurs observées. Un bon réflexe pour les variables continues : la méthode par défaut du package mice, le predictive mean matching (PMM), n'invente pas une valeur par formule mais emprunte une valeur réellement observée chez un patient au profil proche — les valeurs imputées sont donc réalistes d'emblée.

En clair — Deux réflexes : « est-ce que l'algorithme s'est calmé ? » (convergence) et « est-ce que les valeurs inventées ressemblent à des vraies mesures ? » (plausibilité). Une valeur imputée aberrante trahit souvent un modèle d'imputation mal spécifié — mauvaise échelle, variable oubliée.

L'analyse de sensibilité : votre garde-fou contre le MNAR

L'imputation multiple et les modèles mixtes reposent sur l'hypothèse MAR — que vous ne pouvez pas prouver. La parade attendue par un jury exigeant est l'analyse de sensibilité : montrer que vos conclusions ne dépendent pas de façon cruciale de cette hypothèse.

Concrètement, cela consiste à refaire l'analyse sous plusieurs jeux d'hypothèses et à comparer les conclusions : cas complets versus imputation multiple ; et surtout un ou plusieurs scénarios MNAR plausibles, en décalant volontairement les valeurs imputées d'une quantité δ dans un sens défavorable (approche dite ajustement delta, une forme simple de modèle pattern-mixture). Poussée à sa limite, cette idée donne l'analyse du point de bascule (tipping point) : elle cherche jusqu'où il faut pénaliser les manquants — quelle valeur de δ — pour que la conclusion s'inverse. Si l'effet reste dans le même sens et de même ordre de grandeur d'un scénario à l'autre, vos résultats sont robustes. S'ils basculent, c'est une information capitale à discuter honnêtement — pas à cacher.

En clair — L'analyse de sensibilité répond à la vraie question du jury : « et si votre hypothèse sur les manquants était fausse, votre conclusion tiendrait-elle ? » Y répondre par avance est un signe de maturité méthodologique.

Ce qu'il faut reporter

Un traitement des manquants n'est crédible que s'il est transparent. Votre manuscrit doit faire figurer, noir sur blanc :

  • Le taux de manquants par variable (en effectif et en pourcentage), et le nombre de patients avec au moins une donnée manquante.
  • Le mécanisme supposé (MCAR, MAR ou MNAR) pour les principales variables, avec son argumentation clinique — pas seulement un test statistique.
  • La méthode retenue (cas complets, imputation multiple, modèle mixte…) et sa justification au regard du mécanisme supposé et du plan d'analyse.
  • Pour une imputation multiple : le logiciel et le package, le nombre d'imputations m, les variables incluses dans le modèle d'imputation (dont les variables auxiliaires), le contrôle de la convergence et de la plausibilité des valeurs imputées, et le fait que les résultats ont été combinés par les règles de Rubin.
  • Une comparaison des caractéristiques des patients complets et incomplets, pour éclairer la plausibilité du mécanisme.
  • Les résultats de l'analyse de sensibilité et la conclusion sur la robustesse des résultats.

En résumé

Les valeurs manquantes ne se contournent pas, elles se raisonnent. Tout commence par une question clinique — pourquoi cette donnée manque-t-elle ? — qui vous situe entre MCAR, MAR et MNAR, un mécanisme qui s'argumente cliniquement et ne se prouve pas par un test (aucun test ne départage MAR de MNAR ; le test de Little ne juge que MCAR contre non-MCAR). Les réflexes courants sont piégeux : supprimer silencieusement les patients incomplets biaise et affaiblit l'étude, imputer par la moyenne fabrique une fausse précision, et le LOCF suppose un patient figé dans le temps. Sous l'hypothèse MAR, deux voies de référence coexistent : l'imputation multiple (type MICE) — imputer plusieurs fois, analyser chaque copie, combiner par les règles de Rubin pour restituer honnêtement l'incertitude — et les modèles mixtes à vraisemblance directe, souvent préférés pour des mesures répétées. Enfin, parce qu'aucune hypothèse sur les manquants n'est vérifiable, une analyse de sensibilité — cas complets, imputation, scénarios MNAR — démontre la robustesse de vos conclusions. Déclarez le taux de manquants, le mécanisme supposé et la méthode justifiée : c'est exactement ce qu'un jury vérifiera, et c'est ce qui distingue une thèse solide d'une thèse fragile.

À lire ensuite

Concentrez-vous sur votre thèse, pas sur vos stats

Diagnostats transforme votre fichier de données en tableau de bord interactif : il choisit le bon test, contrôle ses conditions d'application, l'applique avec les bibliothèques de référence (les mêmes qu'en R) et exporte des résultats reproductibles, prêts pour le manuscrit et défendables devant le jury.

Vérifier mes données gratuitement →