Accord inter-observateurs : kappa, ICC, Bland-Altman
Deux radiologues relisent les mêmes clichés, deux appareils mesurent la même tension : sont-ils vraiment d'accord ? La question de la reproductibilité revient dans presque toutes les thèses, et un jury vérifiera que vous avez choisi le bon indice de concordance — pas un simple pourcentage, ni une corrélation de Pearson détournée de son rôle. Cet article clarifie quand utiliser le kappa, quand utiliser l'ICC, et pourquoi le graphe de Bland-Altman est souvent la pièce maîtresse.
En bref — quel indice pour quelle variable ? Si vous ne lisez qu'un encadré, c'est celui-ci.
- Qualitatif nominal (présent/absent, type A/B/C) → kappa de Cohen pour deux juges, kappa de Fleiss au-delà.
- Qualitatif ordinal (stades, scores ordonnés) → kappa pondéré.
- Juges en nombre variable ou données manquantes → alpha de Krippendorff.
- Quantitatif (mm, mmHg, taux sanguin…) → ICC ; et Bland-Altman pour savoir si deux méthodes de mesure sont interchangeables.
Dans tous les cas : rapportez l'indice avec son intervalle de confiance à 95 %, jamais la valeur seule.
Inter- ou intra-observateur ? L'accord inter-observateur compare des juges différents entre eux. La reproductibilité intra-observateur compare un même juge à lui-même, sur les mêmes cas relus à distance (un délai suffisant pour qu'il ne se souvienne plus de sa première lecture). Les deux se mesurent avec les mêmes indices (kappa, ICC) et un jury attend souvent les deux : si un examen n'est déjà pas reproductible pour un seul lecteur, il ne le sera jamais entre lecteurs.
Un mot sur le vocabulaire. Dans un manuscrit, précisez toujours ce qui change d'une mesure à l'autre : c'est cela qui donne son sens au chiffre. Deux mesures faites dans des conditions identiques (même opérateur, même appareil) relèvent de la répétabilité ; dès qu'une condition varie (autre observateur, autre appareil, autre jour), on parle de reproductibilité. Dans cet article, nous employons « reproductibilité » au sens large et courant en médecine.
Pourquoi le « pourcentage d'accord » ne suffit pas
La tentation est grande : deux observateurs classent 100 dossiers, ils sont d'accord sur 85, donc « 85 % d'accord ». Le problème est que cette valeur ne dit rien de la part d'accord due au simple hasard. Si une pathologie est présente dans 90 % des cas, deux médecins qui répondraient « présent » quasiment tout le temps seraient souvent d'accord — non parce qu'ils lisent bien, mais parce que la catégorie dominante écrase tout.
Les indices de concordance corrigent précisément cela : ils comparent l'accord observé à l'accord attendu sous l'hypothèse d'un classement indépendant. Ce qui reste après soustraction est l'accord « réel », au-delà de la chance.
En clair — un bon indice d'accord répond à la question « sont-ils d'accord plus souvent qu'on ne l'attendrait s'ils classaient au hasard selon la fréquence des catégories ? », pas seulement « combien de fois tombent-ils d'accord ? ».
Variable qualitative : le kappa de Cohen
Pour deux observateurs qui classent des sujets dans des catégories nominales (présent/absent, type A/B/C), l'outil de référence est le kappa de Cohen. Sa logique :
κ = (po − pe) / (1 − pe), où po est la proportion d'accord observée et pe la proportion d'accord attendue par hasard, estimée à partir des marges du tableau de contingence. Un κ de 0 signifie « pas mieux que le hasard », 1 « accord parfait » ; des valeurs négatives (accord pire que le hasard) sont possibles mais rares.
La grille d'interprétation la plus citée reste celle de Landis et Koch, à manier avec recul car ses seuils sont conventionnels, pas des lois de la nature.
| Valeur de κ | Interprétation (Landis-Koch) |
|---|---|
| < 0,00 | Désaccord (pire que le hasard) |
| 0,00 – 0,20 | Accord très faible |
| 0,21 – 0,40 | Accord faible |
| 0,41 – 0,60 | Accord modéré |
| 0,61 – 0,80 | Accord substantiel |
| 0,81 – 1,00 | Accord presque parfait |
Les seuils ne sont pas sacrés. Un κ de 0,65 « substantiel » peut rester insuffisant pour une décision clinique lourde, tandis qu'un κ « modéré » peut convenir à un dépistage. Interprétez toujours la valeur au regard de l'enjeu clinique, et non de la seule case du tableau.
Le « p » du kappa n'apporte presque rien. Les logiciels affichent une valeur p testant l'hypothèse « κ = 0 ». Mais montrer que l'accord dépasse le pur hasard est un seuil dérisoire en clinique : ce qui compte, c'est l'ampleur de l'accord et la précision de son estimation. Rapportez toujours la valeur de κ et son IC 95 % ; ne concluez jamais sur le seul fait qu'il soit « significativement supérieur à 0 ».
Variable ordinale : le kappa pondéré
Quand les catégories sont ordonnées (stade I / II / III, score 0 à 4), toutes les erreurs ne se valent pas : confondre le stade I et le stade IV est plus grave que confondre I et II. Le kappa pondéré intègre cette hiérarchie en attribuant un poids à chaque type de désaccord, d'autant plus pénalisant que l'écart entre catégories est grand.
Deux pondérations dominent : linéaire (la pénalité croît proportionnellement à l'écart) et quadratique (elle croît avec le carré de l'écart, punissant davantage les gros désaccords). Précisez toujours celle que vous avez choisie, car elle change la valeur obtenue.
Linéaire ou quadratique n'est pas neutre. Le barème quadratique est très indulgent pour les petits écarts : un désaccord d'un seul cran ne coûte presque rien (son carré est minuscule), si bien que la valeur ressort souvent nettement plus haute qu'avec la pondération linéaire. Sur une échelle où se tromper d'un cran a déjà des conséquences cliniques, le quadratique peut donc gonfler l'accord. Choisissez la pondération selon la gravité réelle des erreurs — pas pour obtenir le plus beau chiffre —, annoncez-la, et ne comparez pas deux kappas pondérés calculés avec des pondérations différentes.
Pour aller plus loin (optionnel). Le kappa pondéré quadratique a une propriété souvent citée : sous certaines conditions, il coïncide approximativement avec l'ICC obtenu en traitant les catégories ordonnées comme des scores numériques équidistants (l'ICC(2,1) décrit plus bas). L'équivalence n'est pas exacte — elle est asymptotique et dépend du modèle retenu —, mais elle fait le pont entre le monde ordinal et le monde quantitatif. Vous pouvez sauter ce détail sans rien perdre pour votre thèse.
En clair — sur une échelle ordonnée, le kappa pondéré dit « se tromper d'un cran, c'est presque d'accord ; se tromper de trois crans, c'est un vrai désaccord ». Le kappa simple, lui, traiterait ces deux erreurs à égalité.
Plus de deux observateurs : le kappa de Fleiss
Le kappa de Cohen est bâti pour deux juges. Dès qu'ils sont trois ou plus et qu'ils classent chaque sujet en catégories nominales, on utilise le kappa de Fleiss. Il demande surtout un nombre fixe d'évaluations par sujet (le même nombre de juges pour chacun) — mais ces juges ne sont pas forcément les mêmes d'un sujet à l'autre. Pour un panel fixe d'observateurs sur une variable ordinale, on se tourne plutôt vers l'ICC.
Plus souple encore, l'alpha de Krippendorff (α) accepte à peu près tout : un nombre de juges qui varie d'un sujet à l'autre, des données manquantes (des juges n'ayant pas évalué tous les sujets), et n'importe quel niveau de mesure (nominal, ordinal, quantitatif). C'est l'indice à connaître dès que votre grille de recueil est incomplète ou que le nombre d'observateurs n'est pas constant.
En clair — là où le kappa de Fleiss exige le même nombre d'évaluations pour chaque sujet, l'alpha de Krippendorff s'accommode des cases vides : chaque sujet peut avoir été noté par un nombre différent d'évaluateurs, et le calcul de l'accord reste possible.
Le paradoxe du kappa : la trappe la plus classique
Voici la situation qui piège tant d'étudiants. Deux observateurs sont d'accord sur 90 % des cas, et pourtant le kappa ressort étonnamment bas, à peine « faible ». Comment est-ce possible ?
C'est le paradoxe du kappa. Le mécanisme principal est l'effet de prévalence : quand une catégorie domine, l'accord attendu par hasard pe devient lui-même très élevé ; la « marge de progression » au-dessus du hasard (1 − pe) s'effondre, et le kappa est mécaniquement écrasé, même quand l'accord observé est excellent. C'est exactement ce qui se produit dans l'exemple ci-dessous. La leçon : ne jamais lire un kappa sans son accord brut et sa distribution.
Le calcul, pas à pas — déroulons la formule sur ce tableau (N = 100). L'accord observé est la proportion de cases diagonales : po = (88 + 2) / 100 = 0,90. Pour l'accord attendu par hasard, on croise les marges de chaque juge : les deux ont répondu « + » 93 fois sur 100 et « − » 7 fois, d'où pe = (0,93 × 0,93) + (0,07 × 0,07) = 0,865 + 0,005 = 0,870. Reste à appliquer κ = (po − pe) / (1 − pe) = (0,90 − 0,870) / (1 − 0,870) = 0,030 / 0,130 ≈ 0,23. La clé est le dénominateur : parce qu'une classe domine, il ne restait que 0,130 de « marge de progression » au-dessus du hasard, et l'accord réel n'en a comblé qu'un petit quart. Voilà comment 90 % d'accord se traduisent par un kappa « faible ».
Pour aller plus loin (optionnel). Il existe un second mécanisme, plus rare et contre-intuitif : l'effet de biais. Quand les deux juges ont des habitudes asymétriques (l'un dit « présent » bien plus souvent que l'autre), le kappa peut au contraire remonter à accord observé égal. Retenez surtout la règle générale, valable dans les deux cas : le kappa se lit toujours avec son accord brut et son tableau de contingence.
Ne jamais commenter un kappa sans regarder la distribution. Face à un kappa bas, vérifiez d'abord la prévalence des catégories et l'accord brut. Rapportez systématiquement l'accord observé et le tableau de contingence à côté du kappa : c'est ce qui vous permet de dire « le kappa est bas à cause du paradoxe, pas d'un vrai désaccord ». En cas de forte prévalence, ajoutez un coefficient conçu pour y résister — voir juste en dessous.
Répondre au paradoxe : PABAK et Gwet AC1/AC2
Puisque le kappa se laisse déstabiliser par la prévalence, des indices ont été proposés pour rester interprétables même quand une catégorie domine. Le plus simple, le PABAK, se déduit directement de l'accord observé ; mais il efface toute l'information sur la prévalence — pratique pour illustrer, insuffisant comme unique résultat. La réponse le plus souvent mise en avant est le coefficient de Gwet AC1 (et sa version pondérée AC2 pour les échelles ordinales) : il compte l'accord « dû à la chance » d'une manière qui ne s'effondre pas quand une catégorie est rare, si bien qu'il reste stable là où le kappa dévisse. Sa valeur se lit de 0 à 1. Ce n'est pas « le » bon indice qui remplacerait le kappa, mais un complément utile à rapporter à côté de lui en situation de forte prévalence.
En clair — le kappa et le Gwet AC1 posent la même question (« sont-ils d'accord au-delà du hasard ? »), mais comptent différemment l'accord dû au hasard. Quand une classe écrase tout, le kappa gonfle cette part et écrase le score ; le Gwet AC1 ne tombe pas dans ce piège. En situation de forte prévalence, rapporter l'AC1 à côté du kappa désamorce le débat au lieu de le subir.
Ne lisez pas l'AC1 avec la grille du kappa sans précaution. En pratique, l'AC1/AC2 donne le plus souvent des valeurs plus hautes que le kappa sur les mêmes données — surtout quand une classe domine. Appliquer tel quel le barème de Landis-Koch — pensé pour le kappa — revient donc à surestimer l'accord : un AC1 « presque parfait » est moins exigeant qu'un kappa « presque parfait ». Rapportez-le à côté du kappa plutôt que de le lire seul sur la grille, et gardez l'enjeu clinique comme juge de paix.
Variable quantitative : le coefficient de corrélation intraclasse (ICC)
Quand les mesures sont continues (une distance en millimètres, un taux sanguin, un score numérique), on abandonne le kappa pour le coefficient de corrélation intraclasse (ICC). L'idée : sur la variabilité totale observée, quelle part vient des vraies différences entre sujets, et non des observateurs ou de l'erreur de mesure ? Il vaut au plus 1 (reproductibilité parfaite) et tend vers 0 quand il n'y a aucune reproductibilité. Sur un petit échantillon, la valeur calculée peut même ressortir légèrement négative : on l'interprète alors, comme un kappa négatif, comme une reproductibilité nulle, pas comme un « anti-accord » réel.
Mais dire « j'ai calculé l'ICC » ne suffit pas : il existe plusieurs formes, et un jury attend que vous précisiez laquelle. Trois choix structurent le calcul.
| Décision | Options | Quand ? |
|---|---|---|
| Modèle | Aléatoire à 1 facteur / aléatoire à 2 facteurs / mixte à 2 facteurs | 1 facteur : des observateurs différents d'un sujet à l'autre. 2 facteurs aléatoire : mêmes observateurs, représentant une population de juges (résultat généralisable). Mixte : mêmes observateurs, les seuls concernés (pas de généralisation). |
| Type | Accord (absolute agreement) / cohérence (consistency) | Accord : les valeurs doivent coïncider. Cohérence : un décalage systématique entre juges est toléré (on ignore un décalage additif constant entre juges, mais pas les écarts individuels). |
| Unité | Mesure unique / moyenne de k mesures | Mesure unique : on se fiera à une seule lecture en pratique. Moyenne : la valeur finale sera la moyenne de plusieurs lectures. |
À noter : la distinction accord/cohérence ne s'applique qu'aux modèles à deux facteurs ; avec un modèle à un facteur, l'effet « observateur » n'est pas isolable de l'erreur, et seul l'accord absolu est défini.
Ces choix ne sont pas cosmétiques : pour les mêmes données, la valeur de l'ICC change selon la combinaison retenue. Le type « accord » est presque toujours le bon pour une étude de reproductibilité en médecine, car on veut que les mesures soient identiques, pas seulement corrélées.
En clair — l'ICC « cohérence » pardonne à un observateur qui lit toujours 3 unités de trop ; l'ICC « accord » ne le pardonne pas. Pour de la reproductibilité clinique, choisissez « accord ».
Pearson n'est pas un indice d'accord. Le r de Pearson mesure la liaison linéaire, pas la concordance. Deux méthodes dont l'une lit systématiquement le double de l'autre auront un r parfait de 1 tout en étant en désaccord total. Utiliser Pearson pour justifier un accord est l'une des erreurs les plus sanctionnées en soutenance.
L'ICC dépend de l'échantillon, pas seulement de l'instrument. C'est le pendant quantitatif du paradoxe du kappa, et il piège tout autant. L'ICC compare la variance entre sujets à la variance totale. Sur un échantillon très hétérogène (sujets aux valeurs très étalées), cette variance entre sujets explose et l'ICC monte mécaniquement, même avec une mesure médiocre ; sur un échantillon homogène, la même mesure donnera un ICC bas. L'ICC n'est donc pas une propriété intrinsèque de l'instrument : il dépend de la population testée.
En clair — un ICC de 0,95 sur un échantillon très étalé n'annonce pas forcément une bonne mesure ; un ICC décevant sur un échantillon homogène ne condamne pas forcément l'instrument. Choisissez un échantillon représentatif de la vraie variabilité clinique, décrivez son étendue, et ne comparez jamais deux ICC issus de populations d'hétérogénéité différente.
Comparer deux méthodes de mesure : Bland-Altman
Lorsque l'objectif est de savoir si deux méthodes de mesure sont interchangeables (nouvel appareil vs référence, mesure manuelle vs automatisée), le graphe de Bland-Altman est l'outil de choix, et il est bien plus informatif qu'un coefficient unique.
Le principe : pour chaque sujet, on porte en abscisse la moyenne des deux mesures et en ordonnée leur différence. On en tire :
- le biais moyen : la différence moyenne entre les deux méthodes (idéalement proche de 0) ;
- les limites d'agrément : biais ± 1,96 écart-type des différences, intervalle censé contenir environ 95 % des écarts individuels — à condition que les différences soient à peu près normales et de variance constante sur toute l'étendue des mesures.
La force de cette méthode est visuelle : elle révèle d'un coup d'œil un biais constant, un biais proportionnel (l'écart entre méthodes dérive quand la valeur mesurée augmente — le nuage s'incline), une variance qui s'évase en entonnoir (les différences se dispersent de plus en plus), ou des points aberrants — autant de choses qu'un simple r, ou même un ICC, masqueraient. C'est aussi elle qui permet de trancher : les limites d'agrément sont-elles cliniquement acceptables ? Un écart de ±0,5 mmHg est négligeable ; ±20 mmHg ne l'est pas, quel que soit l'ICC.
Les limites d'agrément sont elles-mêmes estimées. Rapportez leur intervalle de confiance à 95 %, surtout sur petit effectif où elles sont instables. Et vérifiez leurs hypothèses : différences approximativement normales, biais et dispersion à peu près constants sur toute l'amplitude. Si les différences s'évasent en entonnoir quand la valeur augmente, des limites fixes à ±1,96 ET sont inadaptées : il faut alors transformer les données (souvent en logarithme) ou modéliser des limites qui varient avec l'amplitude.
Pour aller plus loin (optionnel). Deux raffinements que votre jury peut soulever. Un : on met la moyenne des deux mesures en abscisse (et non l'une d'elles) pour éviter une pente artificielle — un faux « biais proportionnel » qui apparaîtrait si l'axe contenait déjà l'une des deux mesures. Deux : si vous avez plusieurs mesures par sujet (relectures répétées), la formule « biais ± 1,96 ET » ne s'applique pas telle quelle — traiter toutes les différences comme indépendantes sous-estime la vraie variabilité et donne des limites trop serrées. Bland & Altman ont décrit la correction (on sépare la variance entre sujets de celle au sein d'un même sujet).
En clair — l'ICC vous donne un chiffre global, Bland-Altman vous montre de combien les deux méthodes divergent, sujet par sujet, dans l'unité clinique qui vous parle. Les deux sont complémentaires.
Traduire l'accord en unité clinique : SEM, coefficient de répétabilité et MDC
L'ICC et Bland-Altman disent si la mesure est reproductible ; un jury attend souvent, en complément, de combien elle peut varier — exprimé dans l'unité de la mesure (mm, mmHg, g/L…), là où un ICC sans unité reste abstrait. Trois grandeurs, sorties standard des études de reproductibilité quantitative, répondent à cette question. Elles se déduisent toutes de l'écart-type intra-sujet (la dispersion des mesures répétées d'un même sujet).
- L'erreur standard de mesure (SEM, standard error of measurement) : l'écart-type typique de l'erreur pour une mesure isolée. On l'obtient depuis l'ICC, SEM = ETtotal × √(1 − ICC), ou directement comme l'écart-type intra-sujet. C'est « à combien près » une lecture unique approche la vraie valeur.
- Le coefficient de répétabilité (Bland & Altman) : ≈ 2,77 × écart-type intra-sujet (soit 1,96 × √2 × SEM). C'est la différence maximale attendue, dans 95 % des cas, entre deux mesures répétées d'un même sujet — la demi-largeur des limites d'agrément quand on répète la même méthode.
- Le changement minimal détectable (MDC, ou « plus petite différence détectable ») : le plus petit écart, chez un patient suivi dans le temps, qu'on peut attribuer à un vrai changement plutôt qu'au bruit de mesure. MDC95 = 1,96 × √2 × SEM — numériquement le coefficient de répétabilité, mais lu comme un seuil de décision : en deçà, l'évolution observée peut n'être que de l'erreur de mesure.
En clair — ces trois chiffres traduisent la même information en unités parlantes : « une mesure vaut à ± X près » (SEM), « deux lectures d'un même sujet peuvent différer de Y sans anomalie » (coefficient de répétabilité), « il faut au moins Z de variation pour parler d'une vraie évolution » (MDC). Ce sont ces valeurs, et non l'ICC seul, que le clinicien utilise au lit du patient.
Combien de sujets, combien de juges ? Dimensionner l'étude
C'est la faiblesse numéro un des thèses de reproductibilité : trop peu de sujets. Sur un petit échantillon, le kappa comme l'ICC ne sont que des estimations très imprécises — leur intervalle de confiance est large — et les limites d'agrément de Bland-Altman sont, elles aussi, instables. Un ICC ponctuel de 0,85 calculé sur 15 sujets peut cacher un IC allant de 0,55 à 0,95 : selon le tirage de l'échantillon, la même étude « prouve » un accord excellent ou seulement modéré.
Il n'existe pas de nombre magique, mais deux repères. D'abord, dimensionnez sur la largeur d'IC que vous jugez acceptable : des formules et des tables existent pour cela. Ensuite, méfiez-vous des études à moins de ~30 sujets, souvent trop justes pour conclure ; augmenter le nombre de juges resserre aussi l'estimation. Surtout, calculez la taille avant le recueil, pas après.
Piège de jury. Annoncer « κ = 0,82, accord presque parfait » sur 12 dossiers, sans donner l'IC 95 %, est presque toujours relevé : sur si peu de sujets, l'intervalle est si large que la conclusion ne tient pas. Reportez toujours l'effectif et l'IC, et dites si l'étude était dimensionnée pour trancher.
Ce qu'il faut reporter
Voici la liste concrète à cocher dans votre thèse. Elle vaut checklist de relecture avant la soutenance.
- Le bon coefficient, selon la nature de la variable : kappa (nominal), kappa pondéré (ordinal, en précisant la pondération), kappa de Fleiss (plus de deux juges nominaux), alpha de Krippendorff (juges en nombre variable ou données manquantes), ICC (quantitatif).
- Son intervalle de confiance à 95 %, jamais la valeur seule : un ICC de 0,90 avec un IC [0,55–0,97] ne se conclut pas comme un IC [0,86–0,93].
- Pour un ICC, sa forme exacte : le modèle (un ou deux facteurs, aléatoire ou mixte), le type (accord ou cohérence), l'unité (mesure unique ou moyenne). Une notation compacte lève l'ambiguïté, par exemple ICC(2,1) (deux facteurs, accord absolu, mesure unique). Décrivez aussi l'étendue des valeurs de votre échantillon, puisque l'ICC en dépend.
- Pour un kappa, l'accord brut et le tableau de contingence, pour écarter le paradoxe du kappa. En cas de forte prévalence, ajoutez le Gwet AC1/AC2 à côté.
- Pour une comparaison de méthodes, le graphe de Bland-Altman (biais moyen et limites d'agrément avec leur IC 95 %), et un jugement sur leur acceptabilité clinique.
- Pour une mesure quantitative, les indices d'erreur en unité clinique : SEM, coefficient de répétabilité et MDC. Ce sont eux qui traduisent l'ICC en millimètres ou mmHg.
- Le nombre d'observateurs, de sujets et de mesures, et la procédure (lectures indépendantes, en aveugle, délai entre relectures pour l'intra-observateur).
Pour aller plus loin (optionnel). Deux références qui rassurent un jury exigeant. Sur l'IC : la plupart des logiciels en donnent un asymptotique (formule approchée, fiable surtout quand l'effectif est grand) ; sur petit échantillon, un IC par bootstrap (on recalcule l'indice sur des milliers de rééchantillonnages) est plus honnête. Sur la rédaction : les recommandations GRRAS sont le standard de reporting des études de concordance, l'équivalent de STROBE ou STARD.
En résumé
Mesurer l'accord, ce n'est pas compter les fois où deux personnes tombent d'accord : c'est retirer la part du hasard. Pour une variable qualitative, le kappa de Cohen (pondéré si l'échelle est ordinale, de Fleiss au-delà de deux juges) fait ce travail — à condition de toujours regarder l'accord brut et la distribution, pour ne pas se faire piéger par le paradoxe du kappa (le Gwet AC1 aide alors à trancher). Quand les juges sont en nombre variable ou les données incomplètes, l'alpha de Krippendorff prend le relais. Pour une variable quantitative, l'ICC remplace la corrélation de Pearson — qui mesure la liaison, jamais l'accord — à condition d'en préciser la forme exacte. Et pour comparer deux méthodes de mesure, le diagramme de Bland-Altman dit ce qu'aucun coefficient unique ne montre : de combien, concrètement, les mesures divergent. Reportez le bon indice, son IC 95 %, la forme d'ICC choisie et le graphe de Bland-Altman — complétés, pour une mesure quantitative, par les indices d'erreur en unité clinique (SEM, coefficient de répétabilité, MDC) —, sur un effectif dimensionné à l'avance : c'est exactement la grille qu'un jury déroulera.