Tests diagnostiques : sensibilité, spécificité et courbe ROC
Votre thèse évalue un test, un marqueur biologique ou un score : sait-il vraiment séparer les malades des non-malades ? Répondre exige de manier sans les confondre la sensibilité, la spécificité, les valeurs prédictives et l'AUC. Cet article clarifie ce que chaque indice mesure, ce qu'il ne mesure pas, et surtout les points qu'un jury vérifiera ligne à ligne.
Comment lire cet article — l'essentiel tient en cinq idées : le tableau 2×2, la paire Se/Sp (propriétés du test), les valeurs prédictives (qui dépendent de la prévalence), les rapports de vraisemblance (le pont entre les deux) et la courbe ROC/AUC pour les marqueurs continus. Maîtrisez d'abord ces cinq briques. Les passages signalés « Pour aller plus loin » (RV par intervalles, calibration fine, test de DeLong, courbe de décision) sont des approfondissements utiles face à un jury exigeant, mais non indispensables à une première lecture.
Le point de départ : le tableau 2×2
Toute évaluation d'un test binaire repose sur la confrontation entre le résultat du test et un test de référence (le gold standard) censé définir le vrai statut de chaque patient. On croise les deux dans un tableau à quatre cases.
| Malade (référence +) | Non-malade (référence −) | |
|---|---|---|
| Test positif | Vrais positifs (VP) | Faux positifs (FP) |
| Test négatif | Faux négatifs (FN) | Vrais négatifs (VN) |
Ces quatre effectifs suffisent à calculer tous les indices classiques. La colonne à laquelle on rapporte un chiffre change radicalement sa signification : lire le tableau en colonnes donne la sensibilité et la spécificité ; le lire en lignes donne les valeurs prédictives. C'est là que naissent la plupart des erreurs.
Pour aller plus loin — quand la référence n'est pas parfaite. Tout le tableau suppose que la référence dit la vérité. Si elle se trompe parfois (biopsie faillible, avis d'expert imparfait), votre test peut être injustement pénalisé là où il a raison et la référence tort. Deux garde-fous : combiner plusieurs examens en une référence composite (selon une règle fixée à l'avance), ou, quand aucun étalon fiable n'existe, recourir à l'analyse en classes latentes (elle estime la performance des tests sans supposer de test parfait). Ces méthodes reposent sur des hypothèses fortes : à discuter avec un méthodologiste, pas à improviser.
Sensibilité et spécificité : les propriétés du test
La sensibilité répond à la question « parmi les malades, quelle proportion le test détecte-t-il ? ». Elle se calcule dans la colonne des malades :
Se = VP / (VP + FN)
La spécificité répond à la question inverse « parmi les non-malades, quelle proportion le test écarte-t-il correctement ? », dans la colonne des non-malades :
Sp = VN / (VN + FP)
En clair — la sensibilité mesure l'aptitude à ne pas rater les malades ; la spécificité, l'aptitude à ne pas alarmer à tort les bien-portants. Un bon test peut être à la fois très sensible et très spécifique. Le compromis entre les deux n'apparaît que pour un marqueur continu, quand on déplace le seuil de positivité (voir plus loin) : abaisser le seuil gagne en sensibilité mais se paie en spécificité, et inversement.
Propriété fondamentale : la sensibilité et la spécificité sont calculées à l'intérieur des groupes malades et non-malades. Elles ne dépendent donc pas, par construction, de la proportion de malades dans la population étudiée. On dit qu'elles sont indépendantes de la prévalence. C'est ce qui en fait des propriétés « intrinsèques » du test, transférables d'un contexte à l'autre. Attention toutefois : cette indépendance vaut sur le papier. En pratique, Se et surtout Sp peuvent varier d'une population à l'autre dès que le profil des patients change (nous y reviendrons avec le biais de spectre).
En clair — un moyen mnémotechnique classique : un test très sensible et négatif aide à exclure la maladie (SnNout) ; un test très spécifique et positif, à la confirmer (SpPin). Pratiques, mais à ne pas prendre au pied de la lettre : elles oublient la probabilité pré-test. On leur préférera le raisonnement par rapports de vraisemblance, présenté plus loin.
Valeurs prédictives : ce que le résultat signifie pour le patient
En consultation, on ne connaît pas le statut du patient : on connaît seulement le résultat du test et on veut en déduire une probabilité de maladie. C'est le rôle des valeurs prédictives, qui se lisent en lignes.
La valeur prédictive positive est la probabilité d'être réellement malade quand le test est positif :
VPP = VP / (VP + FP)
La valeur prédictive négative est la probabilité d'être réellement indemne quand le test est négatif :
VPN = VN / (VN + FN)
Contrairement à la sensibilité et à la spécificité, ces deux indices dépendent de la prévalence de la maladie dans la population testée. Une même performance intrinsèque produit des valeurs prédictives très différentes selon que la maladie est fréquente ou rare.
Illustrons avec un test dont la sensibilité et la spécificité valent toutes deux 95 %, appliqué à 10 000 personnes, mais à deux prévalences distinctes.
| Scénario | Malades | VP | FP | VPP |
|---|---|---|---|---|
| Prévalence 1 % | 100 | 95 | 495 | ≈ 16 % |
| Prévalence 30 % | 3 000 | 2 850 | 350 | ≈ 89 % |
Le test n'a pas changé : Se et Sp sont identiques dans les deux lignes. Pourtant, en population peu prévalente, un résultat positif ne correspond à une vraie maladie que dans 16 % des cas, parce que les faux positifs — issus de la grande masse des non-malades — écrasent numériquement les rares vrais positifs. En population enrichie en malades, le même test devient nettement plus informatif.
Ignorer la prévalence. Annoncer une VPP ou une VPN sans préciser la prévalence de votre échantillon est une faute méthodologique : une VPP mesurée à l'hôpital ne vaut pas en dépistage de masse, où la maladie est bien plus rare.
Le piège du plan « à deux portes » (two-gate). Certaines études recrutent séparément les malades d'un côté et les non-malades de l'autre (schéma cas-témoins). C'est alors le plan d'étude qui fixe le ratio malades/non-malades, pas la réalité : la « prévalence » de l'échantillon ne veut rien dire. Conséquence à retenir — les valeurs prédictives ne se lisent pas dans un tel tableau ; seules Se, Sp et les rapports de vraisemblance restent valides. Ce même plan a d'autres effets que l'on retrouvera plus bas (biais de spectre) : gardez le terme en tête.
Rapports de vraisemblance : plus stables, souvent négligés
Les rapports de vraisemblance (RV, ou likelihood ratios) offrent un compromis élégant. Ils se construisent à partir de la sensibilité et de la spécificité — donc restent, comme elles, indépendants de la prévalence — tout en permettant de mettre à jour la probabilité de maladie d'un patient donné.
RV+ = Se / (1 − Sp) et RV− = (1 − Se) / Sp
Le RV+ dit combien un résultat positif rend la maladie plus probable ; le RV− combien un résultat négatif la rend moins probable. On les combine à la probabilité pré-test (souvent la prévalence, ou l'estimation clinique) via le théorème de Bayes exprimé en cotes : cote post-test = cote pré-test × RV.
En clair — un RV+ nettement supérieur à 10 apporte une forte présomption de maladie ; un RV− inférieur à 0,1 permet de l'écarter avec confiance. Autour de 1, le test ne change presque rien à ce que l'on savait déjà.
Un exemple chiffré — partons d'une probabilité pré-test de 20 % (par exemple la prévalence dans votre contexte). En cotes (odds), cela fait 20/80 = 0,25, soit « 1 contre 4 ». Le test revient positif, avec un RV+ de 10. On multiplie : cote post-test = 0,25 × 10 = 2,5. On repasse en probabilité : 2,5 / (1 + 2,5) ≈ 0,71. La probabilité de maladie est ainsi passée de 20 % à environ 71 %. Les deux conversions à retenir : cote = p / (1 − p), et p = cote / (1 + cote). Le nomogramme de Fagan fait ce calcul graphiquement : on relie à la règle la probabilité pré-test au RV, et on lit directement la probabilité post-test, sans passer par les cotes.
Leur intérêt : comme Se et Sp, les RV se transportent d'une population à l'autre (sous la même réserve de spectre comparable), puisqu'ils en découlent directement. Mais, contrairement aux valeurs prédictives, ils s'appliquent à un patient individuel via sa probabilité pré-test. Ils offrent souvent la façon la plus honnête de résumer l'apport clinique d'un test.
Tout relier : un exemple chiffré complet
Reprenons les cinq indices sur un même jeu de données, pour voir comment ils sortent tous du même tableau. Un test est évalué chez 1 000 personnes, dont 100 réellement malades (prévalence 10 %). Les effectifs observés :
| Malade (+) | Non-malade (−) | Total ligne | |
|---|---|---|---|
| Test positif | VP = 90 | FP = 45 | 135 |
| Test négatif | FN = 10 | VN = 855 | 865 |
| Total colonne | 100 | 900 | 1 000 |
On lit d'abord en colonnes — les propriétés du test :
Se = VP / (VP + FN) = 90 / 100 = 90 %Sp = VN / (VN + FP) = 855 / 900 = 95 %
Puis en lignes — ce que le résultat signifie pour un patient, à cette prévalence de 10 % :
VPP = VP / (VP + FP) = 90 / 135 ≈ 67 %VPN = VN / (VN + FN) = 855 / 865 ≈ 99 %
Enfin les rapports de vraisemblance, qui ne dépendent que de Se et Sp :
RV+ = Se / (1 − Sp) = 0,90 / 0,05 = 18RV− = (1 − Se) / Sp = 0,10 / 0,95 ≈ 0,105
En clair — le même tableau, lu en colonnes, donne les propriétés du test (Se, Sp) ; lu en lignes, ce que le résultat dit du patient (VPP, VPN). Les deux lectures sont cohérentes via Bayes : cote pré-test = 100/900 ≈ 0,11 ; le test étant positif, on multiplie par RV+ = 18, d'où une cote post-test ≈ 2, soit une probabilité de 2/(1+2) ≈ 67 % — exactement la VPP. Changez la prévalence, et VPP et VPN bougent, mais Se, Sp et les RV, eux, ne bougent pas.
Pour aller plus loin — le rapport de cotes diagnostique. On peut résumer tout le tableau en un seul nombre, le rapport de cotes diagnostique (diagnostic odds ratio, DOR) : DOR = RV+ / RV− = (VP × VN) / (FP × FN). Ici 18 / 0,105 = (90 × 855) / (45 × 10) ≈ 171. Plus il est grand, mieux le test sépare malades et non-malades ; il vaut 1 pour un test sans valeur. Pratique en méta-analyse, mais peu parlant en clinique : il écrase la différence entre confirmer et exclure, et ne se traduit pas en probabilité pour un patient.
Rapports de vraisemblance par intervalles
Pour aller plus loin — approfondissement du raisonnement par RV, à sauter en première lecture.
Réduire un marqueur continu à un seuil unique jette de l'information : une valeur juste au-dessus du seuil et une valeur très au-dessus sont traitées à l'identique, alors que la seconde est bien plus évocatrice. On peut faire mieux en découpant l'échelle du marqueur en intervalles (tranches cliniques ou quantiles) et en calculant, pour chaque tranche, son propre rapport de vraisemblance : proportion des malades dans la tranche / proportion des non-malades dans la tranche. On injecte ensuite dans le calcul de Bayes le RV de la tranche où tombe réellement le patient.
En clair — au lieu de dire « positif ou négatif », on dit « cette valeur-là multiplie les cotes par tel facteur ». C'est plus proche du raisonnement clinique réel, où un dosage franchement élevé pèse plus lourd qu'un résultat tout juste au-dessus du seuil.
La courbe ROC : quand le test est un marqueur continu
Beaucoup de tests ne sont pas binaires mais quantitatifs : un dosage, un score, une taille. On doit alors fixer un seuil au-delà duquel le résultat est déclaré positif. Or chaque seuil possible produit son propre couple (sensibilité, spécificité) : abaisser le seuil augmente la sensibilité mais dégrade la spécificité, et inversement.
La courbe ROC (Receiver Operating Characteristic) trace cet arbitrage. Pour tous les seuils, on porte en ordonnée la sensibilité et en abscisse le taux de faux positifs, c'est-à-dire 1 − Sp. Chaque point de la courbe correspond à un seuil.
Un test qui ne vaut pas mieux que le hasard suit la diagonale. Plus la courbe se hisse vers le coin supérieur gauche — sensibilité élevée sans sacrifier la spécificité — plus le marqueur discrimine bien.
Pour aller plus loin — empirique ou lissée ? Tracée directement à partir des données, la courbe ROC est empirique : un escalier de petites marches, une par valeur observée du marqueur. On peut à la place l'ajuster par un modèle (par exemple binormal) pour obtenir une courbe lissée (paramétrique). Le lissage donne un tracé plus régulier, parfois utile sur petits échantillons, mais il repose sur des hypothèses de distribution : par défaut, pour une thèse, rapportez la courbe empirique.
L'AUC : une mesure globale de discrimination
L'aire sous la courbe ROC (AUC) résume cette performance en un seul nombre, compris entre 0 et 1 : 0,5 correspond au hasard (la diagonale) et 1 à une discrimination parfaite. Par convention, on oriente le marqueur vers la maladie pour se ramener à une valeur supérieure ou égale à 0,5 — et cette orientation doit être fixée à l'avance, sur la biologie et non sur les données.
L'AUC possède une interprétation probabiliste utile : c'est la probabilité que, pour un malade et un non-malade tirés au hasard, le malade présente la valeur du marqueur la plus évocatrice de maladie (les ex æquo comptant pour une demi-probabilité). Une AUC de 0,5 équivaut à tirer à pile ou face ; 0,80 traduit une bonne capacité à distinguer malades et non-malades.
Pour aller plus loin — une AUC observée sous 0,5. Deux cas à distinguer, que départage l'intervalle de confiance. S'il exclut 0,5, le marqueur discrimine bien mais « à l'envers » (il est orienté dans le mauvais sens). S'il reste seulement un peu sous 0,5, c'est le plus souvent un marqueur sans valeur dont l'estimation fluctue autour de 0,5 par hasard. Dans tous les cas, retourner l'orientation après coup pour repasser au-dessus de 0,5 est un biais optimiste : on choisit alors la direction sur le bruit.
En clair — l'AUC mesure la capacité à classer correctement deux sujets l'un par rapport à l'autre, indépendamment de tout seuil. C'est sa force (elle ne dépend d'aucun choix de seuil) et sa limite (elle ne dit pas quel seuil utiliser).
« AUC élevée, donc test parfait ». Une AUC forte signale une bonne discrimination, pas un test cliniquement prêt à l'emploi. Elle ne renseigne ni sur la calibration (les probabilités prédites sont-elles justes ?), ni sur le seuil pertinent, ni sur l'utilité nette au regard du coût des erreurs — qu'on évalue par l'analyse de courbe de décision (decision curve analysis, net benefit). Deux courbes de même AUC peuvent avoir des formes très différentes et servir des usages cliniques opposés.
La calibration. (Pour aller plus loin — surtout si vous proposez un score prédictif.) L'AUC dit si le test classe bien les patients les uns par rapport aux autres ; la calibration dit si les probabilités annoncées sont justes — quand le modèle prédit « 30 % de risque », observe-t-on bien environ 30 % de malades ? On la juge d'abord à l'œil, avec un graphe de calibration (probabilité prédite en abscisse, fréquence observée en ordonnée ; la diagonale = calibration parfaite).
Piège de jury — le test de Hosmer-Lemeshow est souvent brandi pour « prouver » la calibration, mais il est peu fiable (son résultat dépend du découpage en groupes et il ne dit rien du sens de l'erreur). Préférez le graphe de calibration : bien plus parlant qu'un simple « p non significatif ».
Comparer deux courbes ROC : le test de DeLong
Pour aller plus loin — utile seulement si votre travail compare deux marqueurs.
« Mon nouveau marqueur fait-il vraiment mieux que le marqueur habituel ? » On compare alors leurs deux AUC avec le test de DeLong (en R : pROC::roc.test), qui donne la différence d'AUC, son intervalle de confiance et un p. Le point à ne pas manquer : préciser si les deux tests ont été mesurés sur les mêmes patients (courbes appariées) ou sur deux groupes distincts (courbes indépendantes) — pour des courbes appariées, DeLong tient compte de la corrélation entre les deux mesures, et l'ignorer fausse le résultat.
Comparer les AUC, c'est comparer la discrimination, rien de plus. Une différence d'AUC statistiquement significative peut rester cliniquement minime. Pour juger l'apport d'un marqueur ajouté à un modèle existant, l'analyse de courbe de décision (net benefit) est souvent plus parlante qu'un simple gain d'AUC.
Choisir un seuil : l'indice de Youden et ses limites
Pour transformer un marqueur continu en test binaire, il faut retenir un seuil. L'indice de Youden, J = Se + Sp − 1, identifie le point de la courbe le plus éloigné de la diagonale, c'est-à-dire celui qui maximise la somme sensibilité + spécificité.
Mais ce critère suppose implicitement qu'un faux négatif et un faux positif ont la même gravité — ce qui est rarement vrai. Manquer un cancer curable n'a pas le même coût qu'une biopsie inutile. Le seuil « optimal » dépend donc de l'objectif clinique : un test de dépistage privilégiera la sensibilité (quitte à multiplier les faux positifs, filtrés ensuite), un test de confirmation privilégiera la spécificité.
Optimiser et valider le seuil sur le même échantillon. Choisir le seuil qui maximise la performance sur vos données, puis rapporter cette même performance à ce seuil, revient à surestimer le test : c'est du surajustement. Le seuil déterminé sur un échantillon de développement doit être évalué sur un échantillon de validation indépendant. À défaut, annoncez clairement que votre seuil est exploratoire. Dès lors que vous développez un seuil ou un score prédictif, le reporting relève aussi du référentiel TRIPOD (et de son extension TRIPOD+AI pour les modèles d'apprentissage automatique), qui insiste sur la calibration et la validation externe.
Intervalles de confiance et incertitude
Chaque indice — Se, Sp, VPP, VPN, AUC — n'est qu'une estimation obtenue sur un échantillon. Il doit impérativement être accompagné de son intervalle de confiance à 95 %. Une sensibilité de 90 % mesurée sur 20 malades est très incertaine ; la même valeur sur 300 malades l'est bien moins, et l'intervalle de confiance rend cette différence visible. Pour les proportions calculées sur de petits effectifs, préférez des méthodes adaptées (par exemple l'intervalle de Wilson) aux formules approchées, peu fiables aux valeurs extrêmes.
Le biais de spectre. Si vos malades sont surtout des formes sévères et vos témoins des sujets manifestement sains, votre test paraîtra artificiellement performant : les cas ambigus, ceux où il est vraiment utile, sont absents. Se et Sp ne sont « intrinsèques » que si le spectre des patients reflète la population où le test sera employé. C'est le second travers du plan « à deux portes » vu plus haut : en recrutant des cas typiques d'un côté et des témoins bien portants de l'autre, il creuse artificiellement l'écart entre les deux groupes (le spectre des patients est tronqué de ses cas ambigus) et gonfle l'AUC.
Le biais de vérification (partial verification bias). Il survient quand le fait de recevoir, ou non, le test de référence dépend du résultat du test étudié. Cas typique : les patients au test positif partent en coronarographie (la référence), ceux au test négatif rentrent chez eux sans être vérifiés. En clair — le tableau 2×2 n'est rempli que pour une partie des patients, et pas au hasard, si bien que des faux négatifs manquent à l'appel. Conséquence : la sensibilité est surestimée et la spécificité sous-estimée. Le remède : définir à l'avance qui reçoit la référence, indépendamment du résultat du test.
La fiabilité du test, distincte de son exactitude
Un test peut viser juste en moyenne tout en étant irrégulier : deux lecteurs qui interprètent la même radiographie, ou deux dosages du même prélèvement, ne donnent pas toujours le même résultat. Cette reproductibilité (ou fiabilité) est une question à part entière, différente de l'exactitude : l'exactitude demande « le test tombe-t-il sur la bonne réponse ? », la fiabilité « le test redonne-t-il la même réponse si on le répète ? ». Un test peu reproductible plafonne mécaniquement en exactitude, car une part de ses variations n'est que du bruit.
En clair — pensez à une balance : l'exactitude, c'est qu'elle affiche le bon poids ; la fiabilité, c'est qu'elle réaffiche le même poids si vous remontez dessus. On peut être fiable sans être exact (toujours 2 kg de trop), ou exact en moyenne mais peu fiable (l'aiguille saute à chaque pesée).
On la chiffre selon la nature du résultat : le coefficient kappa (de Cohen) pour un accord entre deux observateurs sur un test binaire ou catégoriel, le coefficient de corrélation intra-classe (CCI) pour une mesure quantitative. Le kappa a le mérite de corriger l'accord observé de la part due au hasard : deux lecteurs qui cochent « positif » au hasard tomberaient parfois d'accord par pure chance, et le kappa retranche cette concordance fortuite.
Le paradoxe du kappa. Comme les autres indices, le kappa a son piège, souvent oublié : quand la maladie est très rare (ou très fréquente), c'est-à-dire quand les marges du tableau sont déséquilibrées, le kappa peut s'effondrer alors même que les deux lecteurs sont d'accord dans presque tous les cas. En clair — si 95 % des clichés sont normaux, deux lecteurs qui cochent « normal » partout seront d'accord 95 % du temps… mais comme le hasard seul produirait déjà presque ce taux, le kappa reste bas et suggère à tort un accord médiocre. Un accord brut élevé accompagné d'un kappa faible ne veut donc pas forcément dire que les lecteurs se contredisent : cela peut simplement trahir des marges très asymétriques. Rapportez toujours le kappa avec l'accord brut et la répartition des catégories, et non le kappa seul.
L'esprit de STARD invite à rapporter cette reproductibilité — inter-observateurs, voire intra-observateur ou inter-laboratoires — dès que la lecture du test comporte une part d'interprétation.
Ce qu'il faut reporter
Le référentiel international STARD (Standards for Reporting of Diagnostic accuracy studies), dans sa version STARD 2015 — complétée par l'extension STARD for Abstracts pour les résumés —, fixe les éléments attendus dans un article d'exactitude diagnostique. Reprenez-en l'esprit dans votre thèse :
- Le test de référence retenu et sa justification comme étalon du vrai statut. Signalez ses imperfections : risque de biais de vérification si tous les patients ne reçoivent pas la même référence, et, si la référence est faillible, comment vous l'avez géré (référence composite ou analyse en classes latentes).
- La reproductibilité du test quand sa lecture comporte une part d'interprétation : accord inter-observateurs (kappa, ou CCI pour une mesure quantitative), avec son intervalle de confiance.
- Le tableau 2×2 complet (VP, FP, FN, VN), afin que tout indice soit recalculable.
- Se, Sp, VPP, VPN et, idéalement, les rapports de vraisemblance, chacun avec son intervalle de confiance à 95 %.
- La prévalence observée dans l'échantillon, indispensable pour interpréter les valeurs prédictives (rappel : dans un plan « à deux portes », elle n'est pas estimable et les valeurs prédictives ne se lisent pas dans le tableau).
- Pour un marqueur continu : la courbe ROC, l'AUC avec son intervalle de confiance, le seuil retenu et la méthode de choix (Youden ou critère clinique explicite) ; envisagez des rapports de vraisemblance par intervalles plutôt qu'un seuil unique. Si vous comparez deux marqueurs, rapportez la différence d'AUC avec le test de DeLong (courbes appariées si les deux tests sont mesurés chez les mêmes patients).
- Le mode de recrutement et le spectre des patients, ainsi que la gestion des résultats indéterminés et des données manquantes.
- Si un seuil ou un score prédictif est proposé : préciser s'il a été validé sur un échantillon indépendant ou s'il reste exploratoire — un travail de ce type relève aussi du référentiel TRIPOD (ou TRIPOD+AI), calibration et validation externe comprises.
En résumé
Évaluer un test diagnostique, c'est distinguer deux questions que le tableau 2×2 sépare naturellement. La sensibilité et la spécificité décrivent le test lui-même, en principe indépendamment de la prévalence — même si elles peuvent varier d'une population à l'autre si le profil des patients change. Les valeurs prédictives décrivent ce qu'un résultat signifie pour un patient et dépendent, elles, directement de la prévalence. Les rapports de vraisemblance réconcilient les deux : transférables comme Se et Sp, mais applicables à un patient donné, ils fournissent souvent le raisonnement le plus honnête. Pour un marqueur continu, la courbe ROC visualise l'arbitrage sensibilité–spécificité et l'AUC en donne une mesure globale de discrimination, sans pour autant désigner un seuil ni garantir une utilité clinique. Accompagnez chaque chiffre de son intervalle de confiance, déclarez votre prévalence, préspécifiez l'orientation de votre marqueur, méfiez-vous du biais de spectre et ne validez jamais un seuil sur les données qui ont servi à le choisir : ce sont exactement les points qu'un jury attentif ira vérifier.