En 1966, Marvin Minsky, chercheur en intelligence artificielle, lance avec Seymour Papert un projet d'été au MIT. Un étudiant doit relier une caméra à un ordinateur pour que la machine décrive ce qu'elle voit. Il n'ira pas très loin.
Un demi-siècle plus tard, Melanie Mitchell, informaticienne, range toujours la vision parmi « the hardest of all "easy" things ». Décrire une photo comme le ferait un humain restait, en 2019, hors de portée des meilleurs programmes. Battre les champions du monde d'échecs ou de go ne l'était plus.
Ce renversement pèse sur chaque décision d'IA qu'un comité de direction doit prendre. Le dirigeant juge ce qu'on lui montre avec sa propre échelle de difficulté, alors que la machine en suit une autre.
D'où vient l'idée que ce qui est facile pour nous est difficile pour l'IA ?
Elle naît des premières décennies de la recherche en intelligence artificielle, quand les chercheurs ont buté sur ce qu'un enfant fait sans effort. Dans Artificial Intelligence, A Guide for Thinking Humans, Mitchell rapporte que Minsky y voyait un paradoxe qu'il résumait par « Easy things are hard ». Converser en langue naturelle, décrire ce qu'on voit, apprendre un concept après quelques exemples se sont révélés plus durs pour la machine que diagnostiquer une maladie complexe, battre un champion d'échecs ou résoudre des problèmes d'algèbre.
Minsky en tirait une remarque sur nous plus que sur les machines, « In general, we're least aware of what our minds do best ». Nous ne voyons pas le travail que demande ce que nous réussissons sans y penser. Mitchell en conclut que la quête d'une intelligence artificielle a au moins éclairé la complexité et la finesse de nos propres esprits.
Un paradoxe qui joue dans les deux sens
Mitchell en donne aussi la forme symétrique. Multiplier sans erreur deux nombres de cinquante chiffres, tâche redoutable pour un humain, prend une fraction de seconde à un programme d'une ligne. Une prouesse sur une tâche difficile pour nous ne dit donc rien de la tâche voisine qui nous paraît simple.
Elle fait de la maxime le fil rouge de son livre. Elle y revient pour la vision, pour les assistants vocaux capables de réciter la biographie d'un sprinter olympique sans savoir ce que courir veut dire, puis pour l'emploi. Sur ce dernier point, elle juge en 2019 que la maxime de Minsky vaut encore pour une grande part de l'IA et que beaucoup de métiers seront plus difficiles à confier à une machine qu'on ne le croit.
Pourquoi l'IA déjoue-t-elle l'intuition d'un dirigeant ?
Il mesure la machine à la difficulté qu'il ressent lui-même. Une analyse de milliers de lignes livrée en quelques secondes impressionne, parce qu'elle aurait coûté des jours à une équipe. La lecture d'une situation ambiguë semble aller de soi, parce qu'un collaborateur la fait sans y penser. La première impression pousse à généraliser. La seconde fait oublier de vérifier.
Mitchell donne pour message à emporter de son livre une phrase qui décrit ce double mouvement, « we humans tend to overestimate AI advances and underestimate the complexity of our own intelligence ». Les deux erreurs vont ensemble. Qui sous-estime ce que demande une tâche simple surestime d'autant la machine qui semble la réussir.
L'anthropomorphisme creuse l'écart
À propos des programmes conversationnels, Mitchell décrit notre tendance à prêter compréhension et conscience à une machine sur très peu d'indices. « We are all too willing to ascribe understanding and consciousness to computers, based on little evidence », écrit-elle. Une réponse fluide et bien tournée suffit à installer l'idée qu'un système a compris la question.
En comité de direction, cette impression se forme avant toute discussion technique. Mieux vaut la nommer avant la démonstration qu'après. Ce réflexe de mise à distance relève de l'esprit critique en entreprise.
Trois affirmations qu'on entend comme une seule
Le livre aide à séparer trois énoncés qui circulent ensemble dans une présentation. Le système est performant sur cette tâche se vérifie souvent. Le système comprend relève d'une autre affirmation. Aucune démonstration ne l'établit. Le système apprend tout seul ignore le travail humain que Mitchell documente longuement, de la collecte des données à leur annotation, confiée pour la seule base ImageNet à des dizaines de milliers de travailleurs payés à la tâche. Distinguer ces trois phrases en réunion dissipe bien des malentendus sans contredire personne.
Pourquoi une démonstration brillante ne prouve-t-elle pas la robustesse ?
Une démonstration montre les cas prévus, alors que les échecs coûteux viennent des autres. Mitchell reprend à la statistique le terme de longue traîne pour désigner la masse des situations improbables une à une mais nombreuses prises ensemble. Un système entraîné sur des exemples les a rarement vues, parfois jamais. Il se trompe davantage quand elles surviennent.
Pour l'illustrer, elle dresse la liste des situations qu'une voiture autonome pourrait croiser en une journée, du feu rouge très probable au bonhomme de neige planté au milieu d'une voie rapide. Elle précise avoir imaginé ces scénarios et leurs probabilités, sa figure vaut donc illustration plutôt que mesure. Elle cite en revanche deux incidents réels. En mars 2016, des témoignages publiés en ligne signalaient que le pilote automatique de Tesla confondait avec le marquage au sol les lignes de sel répandues avant une tempête de neige. En février 2016, un prototype de voiture autonome de Google a heurté un bus en contournant des sacs de sable.
Le système apprend ce qu'il voit plutôt que ce qu'on croit lui montrer
Mitchell raconte le cas d'un réseau entraîné dans son propre groupe de recherche à reconnaître les photos contenant un animal. L'étude attentive de son fonctionnement a montré qu'il s'appuyait en partie sur les arrière-plans flous. Sur une photo de nature, le photographe fait le point sur l'animal et laisse le fond dans le flou. Le réseau avait retenu ce détail statistique au lieu de l'animal lui-même, sans que ses bons résultats au test le laissent deviner.
Reprenant une analogie du chercheur Jeff Clune, elle convoque l'image de Clever Hans, un cheval allemand du début du XXe siècle qui semblait calculer et répondait en réalité à des signaux involontaires de son questionneur. Elle laisse ouverte, sans la trancher, la question de savoir si l'apprentissage profond ne serait pas « a computational Clever Hans responding to superficial cues in the data ».
Le cas limite se teste plutôt qu'il ne se déduit
Pour un comité de direction, la conséquence est pratique. Une décision d'investissement gagne à se prendre sur les cas limites du métier concerné et sur le coût d'une erreur dans chacun d'eux plus que sur la démonstration. Ces cas, les équipes métier les connaissent. Le dossier incomplet, la demande formulée de travers, le client qui sort de toutes les cases, la donnée saisie à moitié. Les soumettre au système avant la décision coûte peu au regard de ce qu'ils coûteront après.
Avant la prochaine démonstration, demandez aux équipes qui feront le travail une courte liste des situations qui leur posent problème aujourd'hui. Faites-les passer au système en plus des exemples préparés par le fournisseur.
Comment lire une performance annoncée « au niveau humain » ?
En demandant sur quelle tâche elle a été mesurée et contre quelle référence humaine. Mitchell décrit une recette qui s'est répétée dans la recherche en IA. On définit une tâche étroite, on mesure sommairement la performance humaine sur un jeu de données, on organise une compétition jusqu'à ce qu'un programme dépasse cette mesure, puis on annonce une compétence générale. La dernière étape consiste, écrit-elle, à « claim, falsely, that the winning AI systems have human-level performance on a more general task ».
| Annonce | Ce qui avait été mesuré | Ce que la mesure ne montrait pas |
|---|---|---|
| ImageNet, 2015. Baidu puis Microsoft disent égaler ou dépasser l'humain en reconnaissance d'images. | Une mesure « top-5 » dans laquelle la bonne catégorie doit seulement figurer parmi cinq propositions. La référence humaine vient d'une seule personne, Andrej Karpathy, alors doctorant, entraînée sur 500 images puis testée sur 1 500. | Que la machine reconnaisse les objets comme un humain. Ses erreurs sont d'une autre nature (petits objets, images retouchées par des filtres, statue ou peluche de chien). |
| Traduction chinois-anglais, 2018. Microsoft annonce la « human parity » pour la traduction d'actualités. | La moyenne des notes données par des évaluateurs bilingues à des phrases isolées, tirées d'articles de presse. | La qualité sur un paragraphe entier dont les phrases dépendent les unes des autres. La part de traductions très mauvaises que la moyenne absorbe. |
| SQuAD, 2018. Des programmes de Microsoft et d'Alibaba dépassent la mesure de précision humaine établie par Stanford. | Retrouver, dans un court paragraphe, le segment de texte qui répond à la question posée. | Une compréhension de lecture. Sur des questions de sciences de niveau scolaire réunies par l'Allen Institute, des réseaux de ce type n'ont pas fait mieux que le hasard. |
| Watson, 2011. Le programme d'IBM bat deux anciens champions du jeu télévisé Jeopardy! | Des réponses à des indices d'un jeu dont les questions et les réponses attendues sont bien définies. | Que les services vendus ensuite sous la marque Watson se comportent de même. Selon Mitchell, ils n'ont guère en commun avec le programme du jeu que le nom. |
Une moyenne peut cacher les pires cas
Mitchell s'attarde sur les moyennes. Si la plupart des phrases traduites sont jugées excellentes quand beaucoup d'autres sont jugées désastreuses, la note moyenne sera honorable. Un utilisateur préférerait pourtant un système toujours correct et jamais désastreux. Elle prend aussi l'exemple des légendes d'images destinées à une personne aveugle. Celle-ci ne peut pas savoir si la description reçue fait partie des bonnes ou des absurdes, ce qui rend peu fiable un système souvent juste.
Quelles questions un CODIR pose-t-il avant d'investir dans une IA ?
Des questions sur la mesure, les données et les cas limites, à la portée d'un dirigeant sans compétence technique. Elles découlent de la manière dont Mitchell examine chaque annonce de son livre.
- Sur quelles données le système a-t-il été entraîné et qui les a annotées ?
- Sur quoi la performance annoncée a-t-elle été mesurée et comment la référence humaine a-t-elle été établie ?
- Que se passe-t-il quand l'entrée sort de ce qui a été vu à l'entraînement ?
- La performance est-elle une moyenne et que cache la queue des mauvais cas ?
- A-t-elle été mesurée sur des unités isolées (une phrase, une image) ou sur le travail réel (un dossier entier, une situation) ?
- Le système présenté est-il celui qu'on achètera ou une gamme vendue sous le même nom ?
Une promesse qui ne résiste pas à ces questions porte sur un banc d'essai plutôt que sur un métier. Aucune n'accuse le fournisseur. Elles déplacent la discussion de la démonstration vers les conditions dans lesquelles le résultat reste valable.
Un déroulé pour la prochaine démonstration
Le déroulé qui suit est une proposition de cet article, construite à partir de la lecture de Mitchell. Il tient en quatre temps.
- Avant la séance. Les équipes qui feront le travail listent les cas limites qu'elles rencontrent, avec le coût d'une erreur sur chacun.
- Pendant la démonstration. Ces cas passent dans le système en plus des exemples préparés par le fournisseur.
- Après la démonstration. Le comité pose les six questions de mesure et note celles qui restent sans réponse.
- Au moment de décider. Le comité fixe, processus par processus, le niveau d'autonomie accordé au système et la place d'un humain dans la boucle.
Quel niveau d'autonomie confier à un système d'IA ?
Un niveau fixé processus par processus, selon l'erreur acceptable, plutôt qu'une réponse unique pour toute l'entreprise. Mitchell appelle Great AI Trade-Off l'arbitrage entre deux mouvements. D'un côté, déployer largement des systèmes qui améliorent des vies et peuvent en sauver. De l'autre, rester prudent devant leurs erreurs imprévisibles, leurs biais, leur vulnérabilité au piratage et l'opacité de leurs décisions. Elle demande jusqu'où il faut exiger qu'un humain reste dans la boucle selon les applications.
Transposée en comité de direction, la question devient décidable. Sur quels processus accepte-t-on une erreur imprévisible et inexplicable ? Sur lesquels exige-t-on qu'un humain vérifie avant que la décision parte ? Le tri d'un courrier standard et l'instruction d'un dossier de crédit n'appellent pas la même réponse.
Le piège de l'autonomie partielle
Pour la voiture, Mitchell s'appuie sur les six niveaux d'autonomie définis par l'agence fédérale américaine de sécurité routière, du niveau 0 au niveau 5. Au niveau 3, le véhicule conduit seul dans certaines circonstances, le conducteur devant rester attentif pour reprendre la main à la demande. Cette technologie existe, écrit-elle en 2019, mais les humains s'accommodent très mal de l'autonomie partielle. Même prévenus qu'ils doivent surveiller, il leur arrive de ne plus le faire.
Elle relève la formule qui porte tout le poids de la grille, under certain circumstances. Personne ne sait dresser la liste complète de ces circonstances. Un agent IA qui prépare presque tout et qu'un collaborateur valide d'un clic présente une structure voisine. Une validation devenue réflexe ne protège plus de grand-chose, ce que développe l'article montrant que vérifier coûte plus cher que produire à l'ère de l'IA. La dépendance à l'IA au travail ajoute un second effet, l'érosion du savoir-faire de celui qui ne fait plus que valider.
Le risque de queue
Dans un texte que cite Mitchell, Sendhil Mullainathan, économiste, nomme ce danger tail risk. Une machine peut prendre un très grand nombre de bonnes décisions puis échouer de façon spectaculaire sur un événement absent de ses données d'entraînement. « I am far more afraid of machine stupidity than of machine intelligence », écrit-il. Mitchell place en tête de ses inquiétudes à court terme le risque que nous accordions à ces systèmes « too much autonomy without being fully aware of their limitations and vulnerabilities ».
Fixer ces limites à l'échelle d'une équipe se prépare. Le canevas Accord d'équipe avec l'IA sert à écrire ce que l'IA peut faire, ce qu'elle ne fait pas et ce que l'humain se réserve. La même question se pose à l'échelle d'une société entière, quand il s'agit de décider quels métiers restent humains.
D'où je parle
Depuis 2012, j'accompagne des équipes, des managers et des CODIR et je pratique la facilitation, dans une carrière commencée en 1998 dont quatorze ans à manager des équipes. Je travaille le sujet de l'IA en organisation depuis fin 2024.
Ce constat de 2019 vaut-il encore à l'ère des grands modèles de langage ?
En partie seulement. Paru en 2019, avant la diffusion des grands modèles de langage, le livre porte des chiffres de performance qui ont vieilli. Il ne dit rien de ces modèles, il ne peut donc pas trancher à leur sujet.
Mitchell fournit pourtant elle-même une clé de lecture. Comme beaucoup de chercheurs, elle pensait que la reconnaissance vocale n'atteindrait jamais un tel niveau sans comprendre le langage. « But we've been proven wrong », reconnaît-elle. Une tâche peut être très bien faite sans compréhension. Les erreurs résiduelles trahissent alors ce manque, comme cette phrase sur la mousse, son dessert préféré, transcrite par son téléphone avec le nom de l'élan, moose.
Sa thèse porte donc sur la fiabilité hors des conditions d'entraînement plus que sur la tâche réussie. Elle reprend une règle empirique de l'ingénierie selon laquelle les premiers 90 % d'un projet complexe prennent 10 % du temps quand les derniers 10 % en prennent 90 %. Elle l'applique à la reconnaissance vocale comme à la voiture autonome. Pour la reconnaissance vocale, ces derniers 10 % exigeront-ils une compréhension réelle ? Elle penche pour le oui, en précisant « I've been wrong before ».
Ce qui ne dépend pas d'une génération de modèles
La distinction entre une performance mesurée et une compréhension, la recette des annonces sur banc d'essai, le poids de la longue traîne, le danger de l'autonomie partielle tiennent au raisonnement plus qu'à la technique. Ils s'appliquent à un modèle de 2026 comme à un réseau de 2016. Cette lecture rejoint les tendances IA qu'un dirigeant doit anticiper en 2026. Parmi elles, l'autonomie des systèmes se gagne par la confiance et la rigueur. Elle rejoint aussi l'IA de frontière vue comme une chaîne de preuve. La question y devient de savoir à quelles conditions déléguer une action à une machine, la vérifier puis l'arrêter.
Le calendrier, lui, reste débattu. Pour la voiture pleinement autonome, Mitchell rapportait en 2019 des prédictions d'experts allant de quelques années à plusieurs décennies. Préparer son entreprise à l'AGI sans parier sur une date permet de composer avec cette incertitude. Un horizon rapproché n'exempte aucun projet de ses cas limites.
Questions fréquentes
Melanie Mitchell attribue la formule à Marvin Minsky, l'un des fondateurs de la recherche en intelligence artificielle. Elle la présente comme le paradoxe que cette recherche a mis au jour, juste après le constat de John McCarthy selon lequel l'IA s'était révélée plus difficile que prévu. Dans son livre, elle n'emploie pas d'autre nom pour ce paradoxe.
Le livre de Mitchell, paru en 2019, ne les étudie pas et ne permet donc pas de trancher. Sa méthode reste utilisable. Elle sépare la tâche réussie de la fiabilité hors des conditions d'entraînement et invite à tester chaque système sur les cas limites de votre métier.
En partant des personnes qui font le travail. Elles savent quels dossiers sont incomplets, quelles demandes arrivent mal formulées, quelles exceptions reviennent. Faites passer ces cas au système pendant la démonstration, en plus des exemples du fournisseur, puis comparez ses réponses à ce qu'aurait fait un collaborateur expérimenté.
Non. Mitchell rappelle les bénéfices réels de ces systèmes. La question porte sur le niveau d'autonomie accordé à chaque processus. Là où une erreur imprévisible reste acceptable, le système peut agir seul. Là où elle ne l'est pas, un humain vérifie avant que la décision parte.
Quand la machine fait presque tout, l'humain chargé de surveiller n'agit plus et son attention décroît. Mitchell le constate pour la voiture de niveau 3. Des conducteurs prévenus de rester attentifs cessent parfois de l'être. Une validation d'un clic sur le travail d'un agent IA expose au même glissement.
Par la liste des cas limites du processus visé et par le coût d'une erreur sur chacun, établis avec les équipes qui le font tourner. Cette liste sert à la fois de test pendant la démonstration et de base pour décider du niveau d'autonomie. Pour la construire ensemble sur votre contexte, réservons un échange de 30 minutes.
Votre comité de direction doit trancher sur un projet d'IA ?
Que vous soyez dirigeant, manager ou DRH, un premier échange permet de poser les cas limites de votre métier avant la démonstration plutôt qu'après.
Réserver un échange découverte (30 min)Allez plus loin
- L'intelligence artificielle, triomphes et déceptions Le fonctionnement des systèmes d'IA les plus célébrés, les conditions dans lesquelles leurs résultats cessent de valoir et ce qui leur manque pour comprendre. Voir le livre →
Liens affiliés

