Dans une compagnie d'assurances bien gérée, deux souscripteurs expérimentés reçoivent le même dossier. Leurs dirigeants s'attendaient à voir leurs primes différer d'environ 10 %. L'audit a mesuré un écart médian de 55 %. Quand l'un estimait une prime à 9 500 dollars, l'autre ne proposait pas 10 500 dollars mais 16 700.
Daniel Kahneman, psychologue et économiste, raconte cet audit dans Noise, paru en français chez Odile Jacob en 2021. Il a écrit le livre avec Olivier Sibony, professeur de stratégie à HEC Paris, ainsi qu'avec Cass Sunstein, juriste. Ils appellent bruit cette dispersion entre des professionnels réputés interchangeables. Le livre parle de juges, de médecins et d'assureurs. Il parle tout autant des managers qui notent leurs collaborateurs, recrutent et proposent des promotions.
Sans audit, préviennent les auteurs, une organisation ne connaît pas la quantité de bruit de ses jugements et tend à la sous-estimer gravement. Le problème reste invisible tant que personne ne compare les notes données au même dossier.
Quelle différence entre un biais et du bruit dans une décision ?
Un biais décale tous les jugements dans la même direction, le bruit les disperse. Les auteurs ouvrent leur livre sur un stand de tir. Une équipe dont les impacts se groupent loin du centre est biaisée. Une équipe dont les impacts s'éparpillent autour de la cible est bruyante. La première erreur se prévoit et s'explique. La seconde ne suit aucune direction.
Le bruit a une propriété décisive pour une organisation. Il se mesure sans connaître la bonne réponse. Même en regardant les cibles de dos, sans voir où se trouve le centre, on repère la dispersion d'un coup d'œil. Les auteurs l'écrivent ainsi, il est possible de l'identifier et de le mesurer « sans rien savoir ni de la cible ni du biais ». La plupart des décisions managériales n'ont justement aucune valeur vraie à consulter, qu'il s'agisse du potentiel d'un candidat, de la performance d'une année ou de la maturité d'un futur manager.
On se rassure souvent en pensant que les écarts se compensent. Ils ne se compensent que lorsque plusieurs juges se prononcent sur le même dossier et qu'on fait la moyenne de leurs avis. Dans une organisation, chaque dossier passe le plus souvent entre les mains d'un seul évaluateur. Un collaborateur sous-noté et un collègue surnoté font deux erreurs qui s'ajoutent. Dans les systèmes sujets au bruit, les erreurs « ne s'annulent pas » et « se cumulent », résument les auteurs.
Les biais cognitifs qui faussent nos décisions occupent depuis longtemps les formations au management. Le bruit y tient rarement une place, alors qu'il pèse dans l'erreur au même titre qu'eux.
Le bruit pèse autant que le biais dans l'erreur
Le livre additionne les deux sources d'erreur dans une même équation. L'erreur globale y vaut le carré du biais plus le carré du bruit. Réduire le bruit d'une quantité donnée améliore donc les jugements autant que réduire le biais de la même quantité. Rien n'oblige à connaître ses biais avant de s'attaquer au bruit.
Trois composantes du bruit et celle qu'on traite par réflexe
Le bruit de niveau sépare les évaluateurs sévères des évaluateurs cléments. Les auteurs comparent cette sévérité moyenne à un trait de personnalité, stable d'un dossier à l'autre. Le bruit de pattern tient à la manière dont chaque évaluateur réagit à chaque dossier. L'un accorde un grand poids à l'autonomie, l'autre à la rigueur, un troisième voit dans un candidat quelqu'un qu'il a connu. S'y ajoute le bruit occasionnel, la variation d'une même personne d'un jour à l'autre.
Selon les auteurs, le bruit de niveau est en principe le plus facile à mesurer et à corriger, par exemple en imposant une distribution des notes. Les mesures réunies dans le livre en font rarement la composante principale. Pour les auteurs, « si nous espérons traiter le problème des différences interindividuelles en nous focalisant sur le bruit de niveau, nous passons largement à côté du sujet ». Ils précisent eux-mêmes que les données sur ce point restent peu nombreuses et que leurs conclusions sont indicatives.
Combien de bruit y a-t-il dans les évaluations et les recrutements ?
Bien plus que ne l'imaginent ceux qui les pilotent. Après l'audit de l'assurance, les auteurs ont posé la même question à 828 P-DG et cadres supérieurs de tous secteurs. L'écart de 10 % est revenu comme réponse médiane et comme réponse la plus fréquente. Les mesures rassemblées dans le livre situent la dispersion réelle nettement au-dessus.
| Situation mesurée | Ce qui a été comparé | Résultat |
|---|---|---|
| Assurance, primes | Deux souscripteurs sur le même dossier | Écart médian de 55 % de leur moyenne, pour 10 % attendus par les dirigeants |
| Assurance, sinistres | Deux experts en sinistres sur le même dossier | Écart médian de 43 % |
| Gestion d'actifs | Analystes d'une même société estimant la valeur d'une action | Écart médian de 41 % |
| Évaluation à 360° | Plusieurs évaluateurs notant la même personne sur la même période | 20 à 30 % de la variance due à la performance, 70 à 80 % de bruit systémique |
| Recrutement | Deux recruteurs après un entretien avec le même candidat | Corrélation de 0,37 à 0,44 entre leurs évaluations |
| Recrutement en jury | Membres d'un même jury observant le même entretien | Corrélation de 0,74, soit un désaccord une fois sur quatre sur le meilleur de deux candidats |
| Délibération collective | Plus de 500 jurys simulés fixant une indemnité | 27 % des jurys fixent un montant égal ou supérieur à celui de leur membre le plus sévère |
Ces chiffres appellent deux précautions. L'audit de l'assurance est une mission de conseil menée par deux des auteurs. Leur note de méthode en donne les effectifs, 86 jugements de 48 souscripteurs et 113 jugements de 68 experts en sinistres. Les écarts cités sont des médianes. Dans la moitié des cas, la différence entre deux jugements était donc plus grande encore.
Le recrutement fournit l'expérience la plus troublante du livre. Des étudiants jouant les candidats répondaient oui ou non selon la première lettre de la question posée. Aucun des étudiants recruteurs ne s'en est aperçu. Ceux qui avaient reçu ces réponses aléatoires s'estimaient aussi souvent que les autres capables de tirer beaucoup de conclusions sur la personne rencontrée.
Pourquoi l'entretien annuel d'évaluation est-il si bruyant ?
Parce qu'il demande à chaque manager une note absolue sur une échelle que chacun lit à sa façon. « Satisfaisant » ou « 3 sur 5 » ne recouvrent pas la même réalité chez deux évaluateurs. Dans les évaluations à 360° analysées par le livre, le bruit systémique reste plus important que la performance de la personne, même quand les notes ne servent qu'au développement et n'ont aucun enjeu de rémunération.
Les questionnaires ont grossi pour tenter de mieux mesurer. Le livre cite un formulaire de quarante-six critères répartis sur onze dimensions du poste, à remplir pour chaque personne évaluée. Le coût a suivi. En 2015, Deloitte estimait consacrer chaque année deux millions d'heures à l'évaluation de ses soixante-cinq mille salariés.
Le classement forcé traite le mauvais bruit
La distribution imposée oblige chaque manager à placer un pourcentage fixe de collaborateurs dans chaque case. Elle corrige le bruit de niveau, les évaluateurs trop généreux ne pouvant plus distribuer les bonnes notes sans compter. Les auteurs lui reprochent moins de classer que de forcer. Imposer à une petite équipe la répartition d'une grande population revient à décider du résultat avant d'avoir regardé les personnes. Selon eux, exiger qu'une part fixe des soldats d'une unité d'élite de l'armée soit notée insatisfaisante n'aurait aucun sens.
L'échelle de cas, une référence commune
La parade proposée tient dans un cadre de référence partagé. Les évaluateurs notent ensemble des cas pratiques et comparent leurs notes à celles d'experts. Chaque degré de l'échelle est ensuite défini par un cas-ancre que tous connaissent. Évaluer revient alors à comparer, tel collaborateur se situant au-dessus d'un cas-ancre et en dessous d'un autre. Le livre en fait l'un de ses principes, « Les jugements comparatifs sont moins sujets au bruit que les jugements absolus. »
Les auteurs ne cachent pas le prix de cet outil. Les cas-ancres se conçoivent sur mesure pour une entreprise ou une fonction et doivent être remis à jour à mesure que les emplois évoluent. Ils retirent aussi aux évaluateurs une part de leur pouvoir d'appréciation, ce qui suscite des résistances.
L'échelle traite la note. La conversation qui l'entoure relève d'un autre geste, le feedback pensé comme une boucle tout au long de l'année.
Comment réduire le bruit dans un recrutement ou une promotion ?
En structurant le jugement avant de rencontrer la personne. L'entretien structuré prédit mieux la performance future que l'entretien libre, avec des corrélations de 0,44 à 0,57 contre 0,20 à 0,33 selon les études réunies dans le livre. En probabilité, les chances de retenir le meilleur de deux candidats passent de 56 à 61 % avec un entretien traditionnel à 65 à 69 % avec un entretien structuré. La réévaluation des méthodes de sélection publiée en 2022, postérieure au livre, abaisse la plupart de ces validités et place l'entretien structuré en tête. Pour les auteurs, structurer un jugement revient à appliquer trois principes.
- Décomposer. Une liste courte de critères, arrêtée avant de voir le premier candidat.
- Garder les jugements indépendants. Des questions prédéfinies, une note critère par critère, des notes écrites avant tout échange entre évaluateurs.
- Différer l'avis global. L'intuition garde sa place, à la fin, une fois chaque critère noté.
Le livre rapporte le cas de Google. Un audit interne de ses entretiens y avait conclu à « une absence totale de lien statistique [...], des résultats complètement aléatoires ». L'entreprise faisait parfois passer jusqu'à vingt-cinq entretiens au même candidat. Elle en a ramené le nombre à quatre. Surtout, elle a posé une règle que toutes les entreprises n'appliquent pas, chaque recruteur notant le candidat seul avant d'en parler avec les autres.
Une promotion se juge comme un recrutement
Une promotion est une décision qui revient chaque année, sur des dossiers comparables. Elle se prête à la même structuration. Dans le cas fictif qui clôt le livre, la P-DG d'une entreprise étend la méthode du recrutement au choix entre options stratégiques, au motif que « les options sont comme des candidats ». Le protocole d'évaluations intermédiaires des auteurs fixe les critères une fois pour toutes, les fait évaluer séparément puis réserve la décision globale à la fin.
Le principe de Peter tient d'abord à un défaut d'évaluation, celui qui promeut sur les résultats du poste actuel plutôt que sur les compétences du poste visé. La grille de promotion en sept critères applique cette logique de décomposition. Chaque évaluateur la remplit seul, avant toute discussion.
Dans ce même cas, la P-DG refuse de trancher par une moyenne pondérée des notes. Des décideurs qui savent qu'une formule calculera la décision changent leurs notes pour obtenir la conclusion souhaitée. Un fait décisif peut aussi surgir en cours de route sans correspondre à aucun critère, ce que le livre appelle une « jambe cassée ».
Avant la prochaine campagne de promotions, écrivez les critères du poste visé et faites noter chaque dossier séparément par au moins deux évaluateurs. L'écart entre leurs notes, relevé avant la réunion, dit déjà où se loge le bruit.
Qu'est-ce que l'hygiène de la décision pour un comité de talents ?
L'hygiène de la décision regroupe des gestes préventifs qui réduisent le bruit sans qu'on sache quelle erreur précise ils évitent. Les auteurs empruntent l'image au lavage des mains. On se lave les mains sans savoir quel microbe on écarte. « Nous appelons cette démarche de réduction du bruit l'hygiène de la décision. » Leur synthèse en énonce six principes.
- Ne pas chercher l'expression individuelle quand l'objectif du jugement est la justesse.
- Adopter la vision externe, en situant le cas parmi des cas comparables.
- Structurer le jugement en plusieurs tâches indépendantes.
- Résister aux intuitions prématurées, sans les interdire.
- Obtenir plusieurs jugements indépendants avant de les agréger.
- Privilégier les jugements comparatifs et les échelles relatives.
La discussion avant les notes fabrique du bruit
En comité, le premier qui parle oriente ceux qui suivent. Le livre décrit ces cascades où l'avis initial d'une personne, repris par des collègues hésitants, finit par passer pour la sagesse du groupe. Il décrit aussi la polarisation, un groupe qui délibère adoptant une version plus extrême de sa position de départ. Dans l'expérience des jurys simulés, la délibération rendait les décisions plus bruyantes que la simple agrégation des avis individuels.
La parade commence par une consigne simple. Chaque membre écrit sa note seul, avant toute discussion. Les auteurs recommandent ensuite la méthode estimation-discussion-estimation. Chacun estime seul, explique son estimation au groupe, puis estime de nouveau, le jugement du groupe étant la moyenne de ce second tour. En réunion, le 1-2-4-Tous installe un temps de réflexion individuelle avant l'échange. Le livre ne va pas jusque-là, mais le même raisonnement invite à faire parler en dernier la personne qui a le plus de pouvoir.
L'observateur de la décision, une piste à tester
Les auteurs proposent de désigner, avant une réunion importante, un observateur qui ne débat pas du fond et repère les biais en temps réel à l'aide d'une check-list. Son mandat doit venir des décideurs. S'autoproclamer observateur serait, selon eux, « une bien mauvaise méthode pour se faire des amis ». Ils précisent n'en connaître que des essais informels encourageants, sans étude systématique à grande échelle. L'outil se propose donc comme une hypothèse de travail bien construite. Il rejoint une idée déjà documentée, le poids du processus quand il faut décider en contexte dégradé.
Comment lancer un audit de bruit sans braquer les managers ?
En faisant des managers audités les principaux concepteurs de l'audit. L'annexe que le livre consacre à l'exercice pose cette règle d'entrée, faute de quoi ils en deviendraient les critiques les plus crédibles. Le reste du protocole se déroule en six étapes.
- Constituer l'équipe. Des experts métier crédibles auprès de leurs pairs pour construire les cas, des dirigeants impliqués dès le départ et un responsable de haut rang pour lever les obstacles.
- Choisir une tâche de jugement. Réalisable à partir d'informations écrites et aboutissant à un chiffre, qu'il s'agisse d'une note, d'un montant ou d'une probabilité.
- Rédiger les cas. Des cas crédibles tirés du métier, accompagnés d'un questionnaire sur les facteurs décisifs à remplir une fois tous les cas examinés.
- Faire écrire les attentes des dirigeants. Avant les résultats, le désaccord qu'ils attendent entre deux réponses, le désaccord acceptable et le coût d'une erreur. Obtenir leur engagement d'accepter les résultats.
- Faire juger en même temps et séparément. Tous les professionnels qualifiés, environ une demi-journée de travail allouée officiellement, anonymat garanti. On parle d'« étude du processus de prise de décision » plutôt que d'audit de bruit.
- Analyser la dispersion. La quantité totale de bruit, sa décomposition entre niveau et pattern, puis les réponses extrêmes qui signalent un besoin de formation ou de doctrine commune.
Pour une direction des ressources humaines, la tâche la plus naturelle est un dossier d'évaluation ou de promotion reconstitué à partir de situations réelles anonymisées, noté par plusieurs managers. Les écarts qui en sortent se discutent ensuite sur des faits, sans mettre personne en cause.
Faut-il viser zéro bruit dans les décisions RH ?
Les auteurs eux-mêmes ne le recommandent pas. Leur dernière partie examine ce que coûte la réduction du bruit et prend les objections au sérieux. Réduire le bruit peut coûter plus cher que le bruit lui-même. Une règle grossière supprime la dispersion en fabriquant une erreur partagée. Chacun tient aussi à être entendu comme une personne singulière. Un évaluateur privé de tout pouvoir d'appréciation perd une part de son identité professionnelle et parfois sa motivation.
Une règle trop rigide ne fait pas disparaître le jugement. Elle le déplace hors de vue, là où plus personne ne peut le mesurer. Le livre propose de choisir entre une règle et un principe selon la fréquence de la décision et la confiance accordée à ceux qui l'appliquent. Plus une décision se répète, plus une règle se justifie.
Leur position finale se lit dans une phrase de synthèse, « Sans audit de bruit, invoquer la difficulté de la réduction du bruit n'est trop souvent qu'un prétexte pour continuer à se voiler la face en ne prenant pas la mesure du problème qu'il pose. »
Ce que le livre établit et ce qu'il illustre
La charpente de Noise tient bien. L'équation de l'erreur relève de l'algèbre et la supériorité des jugements structurés s'appuie sur de nombreuses études. Certaines illustrations du bruit occasionnel, comme l'influence de la faim sur les décisions de juges, sont en revanche contestées. Elles portent sur la plus petite des composantes du bruit. Les recommandations sur l'évaluation, le recrutement et la promotion n'en dépendent pas.
Le livre dessine aussi un portrait du bon décideur qui ne ressemble pas au cliché du chef résolu. Celui-là cherche l'information qui le contredit et accepte de changer d'avis. « S'il se montre résolu et déterminé, ce doit être au terme d'un processus de décision, pas au début. »
D'où je parle
Depuis 2012, j'accompagne des équipes, des managers et des CODIR et je pratique la facilitation, dans une carrière commencée en 1998 dont quatorze ans à manager des équipes.
Questions fréquentes
Le biais est une erreur partagée. Il décale tous les jugements dans la même direction. Le bruit est la dispersion des jugements portés sur un même cas par des personnes censées juger de la même façon. Le premier se prévoit, le second ne suit aucune direction. Tous deux pèsent dans l'erreur globale.
Oui, dès que plusieurs personnes jugent des dossiers comparables, qu'il s'agisse de managers qui évaluent, de recruteurs qui se succèdent ou d'un comité de promotion. Un mini-audit sur deux ou trois cas écrits, noté séparément par chacun, suffit à mesurer l'écart.
Noise ne le propose pas. Le livre recommande un cadre de référence commun entre évaluateurs, des cas-ancres connus de tous et des jugements comparatifs plutôt que des notes absolues. Il met aussi en garde contre les questionnaires trop longs. L'effet de halo y empêche de traiter séparément les dimensions du poste.
Une règle ou un modèle appliqué de la même façon à chaque dossier ne produit pas de bruit. Le livre montre que des modèles simples font souvent un peu mieux que le jugement humain, surtout pour cette raison. Les auteurs précisent que ces exemples ne prouvent pas qu'un algorithme est juste et sans biais. Un modèle entraîné sur des décisions passées reproduit leurs biais.
Pour les participants, le livre compte environ une demi-journée de travail et recommande de l'allouer officiellement. Il faut y ajouter la préparation des cas par l'équipe projet, la réunion de lancement avec la direction puis l'analyse des résultats.
Par une mesure plutôt qu'une réforme. Choisissez deux ou trois dossiers réels d'évaluation ou de promotion, anonymisez-les puis faites-les noter séparément par plusieurs managers. Comparez les écarts avant d'en discuter ensemble. Pour construire cet exercice sur votre contexte, réservons un échange de 30 minutes.
Vos évaluations dépendent-elles de l'évaluateur ?
Que vous soyez DRH, dirigeant ou manager, un premier échange permet de repérer où le bruit pèse dans vos évaluations, vos recrutements ou vos promotions avant de choisir par où commencer.
Réserver un échange découverte (30 min)Allez plus loin
- Noise. Pourquoi nous faisons des erreurs de jugement et comment les éviter La distinction entre biais et bruit, la conduite d'un audit de bruit et les principes d'hygiène de la décision appliqués à l'évaluation, au recrutement et aux choix stratégiques. Voir le livre →
Liens affiliés

