Objectifs du chapitre
À la fin de ce chapitre, vous serez capable de:
- distinguer une question normative («que devrait faire un agent rationnel?») d'une question descriptive («que fait-il?»), et expliquer pourquoi un écart à la norme n'établit pas à lui seul une irrationalité;
- décrire ce que mesure la tâche de sélection de Wason, le contraste entre sa version abstraite et ses versions à contenu social, et les trois interprétations concurrentes de ce contraste;
- démontrer le théorème de Bayes et calculer une valeur prédictive positive à partir d'une prévalence, d'une sensibilité et d'une spécificité, puis reformuler le même problème en fréquences naturelles;
- nommer les principales heuristiques de jugement (disponibilité, représentativité, ancrage), dire pour chacune ce qui est solidement établi et ce qui ne l'est pas, et situer le cadre «deux systèmes» comme une métaphore et non comme une architecture démontrée;
- calculer une espérance, une utilité espérée et un équivalent certain, et déduire de la fonction de valeur de la théorie des perspectives le gain minimal qui rend un pari acceptable;
- juger une intervention d'architecture du choix (nudge) sur pièces: quel effet moyen attendre, comment le mesurer, et quelle question éthique elle soulève;
- représenter un problème comme un espace d'états, démontrer que la tour de Hanoï à disques exige déplacements, et distinguer escalade, analyse moyens-fins et travail à rebours;
- décrire la fixité fonctionnelle, l'effet Einstellung, le transfert analogique et ce qui distingue un expert, en donnant à chaque résultat son statut de preuve.
Deux manières d'étudier le raisonnement
Deux questions cohabitent dans ce chapitre, et les confondre est la source de presque tous les malentendus de la littérature.
La confrontation des deux est féconde: lorsque le comportement observé s'écarte systématiquement de la norme, on tient une prise sur les mécanismes. Encore faut-il interpréter l'écart correctement.
Le chapitre suit cet ordre: la déduction, où la norme est la moins discutable; l'induction et la probabilité, où le format de l'information change tout; la décision, où la norme elle-même devient un objet d'étude; enfin la résolution de problèmes, où l'on connaît le but mais pas le chemin.
Le raisonnement déductif
Validité et vérité
Le syllogisme met cette distinction à l'épreuve. «Tous les A sont des B; tous les B sont des C; donc tous les A sont des C» est valide quels que soient A, B et C. En revanche, «tous les A sont des B; certains C sont des B; donc certains C sont des A» est invalide, même si la conclusion paraît raisonnable.
Or les participants ne jugent pas seulement la forme. Depuis les travaux d'Evans, Barston et Pollard (1983), une expérience se répète avec une régularité remarquable: on présente des syllogismes en croisant deux facteurs, la validité logique et la crédibilité de la conclusion. Les participants acceptent beaucoup plus souvent les conclusions croyables que les conclusions incroyables, à validité égale, et l'effet est le plus fort là où les deux se contredisent — un syllogisme invalide à conclusion croyable est accepté par une majorité, un syllogisme valide à conclusion incroyable est rejeté par beaucoup. C'est l'effet de croyance (belief bias).
Statut: robuste. Le phénomène a été reproduit dans des dizaines d'expériences et modélisé formellement; ce qui reste discuté est son mécanisme (le contenu agit-il sur la construction du modèle mental, sur le critère de réponse, ou sur les deux?), pas son existence. Notez la structure, que nous retrouverons souvent: l'effet est solide, son explication ne l'est pas.
La tâche de sélection de Wason
En 1966, Peter Wason invente une tâche d'une simplicité trompeuse. Quatre cartes portent une lettre d'un côté et un chiffre de l'autre. La règle à tester est: «si une carte porte une voyelle sur une face, elle porte un nombre pair sur l'autre». Les faces visibles sont A, K, 4 et 7. Quelles cartes faut-il retourner, et seulement celles-là, pour savoir si la règle est violée?
La règle a la forme «si alors ». Elle est fausse dans un seul cas: vrai et faux. Il faut donc retourner la carte A (pour vérifier qu'elle ne cache pas un nombre impair) et la carte 7 (pour vérifier qu'elle ne cache pas une voyelle). La carte K est sans intérêt: la règle ne dit rien des consonnes. La carte 4 aussi: quelle que soit la lettre au dos, la règle n'est pas violée — c'est l'erreur la plus fréquente, et elle correspond à une confusion entre «si alors » et « si et seulement si ».
La proportion de participants qui donnent la sélection correcte dans cette version abstraite est faible: de l'ordre de à selon les variantes. Changez maintenant le contenu sans changer la structure logique: la règle devient «si une personne boit de l'alcool, elle a ans révolus», et les cartes indiquent d'un côté ce que boit une personne, de l'autre son âge. Les faces visibles sont «bière», «thé», « ans», « ans». Il faut retourner «bière» et « ans» — exactement et non-. Cette fois, la majorité des participants trouve la réponse: les ordres de grandeur rapportés depuis Griggs et Cox (1982) se situent entre et .
Un même schéma logique, deux comportements radicalement différents: voilà un fait expérimental solide, répliqué dans de nombreux laboratoires et sur des matériels variés. Son explication, en revanche, fait l'objet de trois familles d'hypothèses concurrentes.
- La familiarité. Le contenu concret rappellerait des situations vécues dont on a mémorisé les contre-exemples. L'hypothèse a le mérite de la simplicité, mais elle échoue sur un point: des règles déontiques totalement inventées («si un homme mange du manioc, il doit porter un tatouage facial») produisent aussi la facilitation. La familiarité n'est donc ni nécessaire ni suffisante.
- Les schémas pragmatiques de raisonnement. Cheng et Holyoak (1985) proposent que nous disposions de schémas abstraits de permission et d'obligation («pour obtenir un avantage, il faut satisfaire une condition»), acquis par l'expérience sociale mais indépendants d'un contenu particulier. Une règle qui active un tel schéma est traitée correctement; une règle purement descriptive ne l'active pas. Cette hypothèse rend compte de la facilitation par des règles inventées mais déontiques.
- Un module de détection des tricheurs. Cosmides (1989) soutient que la sélection naturelle aurait doté l'esprit humain d'un mécanisme spécialisé dans la détection des violations de contrats sociaux — quelqu'un qui prend le bénéfice sans payer le coût. C'est l'interprétation la plus contestée des trois: elle prête au résultat une charge évolutionniste que le résultat lui-même ne porte pas, ses prédictions distinctives (le rôle du seul contenu «bénéfice-coût», l'insensibilité à la formulation) ont été discutées et parfois contredites, et des explications non modulaires — schémas déontiques, pertinence, structure des utilités — rendent compte des mêmes données. Une hypothèse évolutionniste n'est pas illégitime; elle exige simplement des prédictions qui la distinguent de ses rivales, et ce point est précisément ce qui manque ici.
On teste la règle «si un dossier porte le tampon URGENT, il doit être traité le jour même». Quatre dossiers sont posés sur la table: l'un porte le tampon URGENT (on ignore sa date de traitement), l'un n'a pas de tampon, l'un a été traité le jour même (on ignore s'il portait le tampon), l'un a été traité trois jours plus tard. Lesquels faut-il examiner pour repérer une violation de la règle?
Plusieurs réponses possibles
Induction, confirmation et falsification
Le raisonnement inductif va des observations à une règle générale. Il n'offre aucune garantie logique — aucune quantité d'observations ne démontre une loi universelle — mais c'est celui que nous pratiquons presque tout le temps, en science comme dans la vie ordinaire.
Wason (1960) a construit le paradigme de référence, la tâche 2-4-6. L'expérimentateur annonce que le triplet obéit à une règle qu'il faut découvrir; le participant propose des triplets, l'expérimentateur dit seulement «conforme» ou «non conforme», et le participant annonce la règle quand il croit la tenir. La règle est en réalité «trois nombres croissants». La plupart des participants formulent une hypothèse plus étroite («des nombres pairs qui augmentent de deux»), testent des triplets qui la satisfont — , —, reçoivent des «conforme» en cascade et annoncent une règle fausse avec confiance.
Ici, une nuance est indispensable, et elle est due à Klayman et Ha (1987): la stratégie de test positif n'est pas irrationnelle en soi. Elle est même informative dans la plupart des environnements réels, notamment lorsque le phénomène cherché est rare et que l'hypothèse envisagée est plus étroite que la règle vraie. Ce qui rend la tâche 2-4-6 piégeuse est une propriété très particulière de son matériel: l'hypothèse naturelle est incluse dans la règle vraie, si bien qu'un test positif ne peut jamais produire de démenti. Changez cette structure — par exemple si l'hypothèse est plus large que la règle — et la stratégie de test positif devient efficace. La leçon n'est donc pas «testez toujours par la négative», mais: demandez-vous quel résultat serait incompatible avec votre hypothèse, et si votre test peut le produire.
Le raisonnement falsificationniste est réellement difficile, y compris pour des scientifiques entraînés, et pour une raison structurelle: une prédiction ne découle jamais d'une hypothèse seule, mais de l'hypothèse plus des hypothèses auxiliaires (le matériel fonctionne, l'échantillon est adéquat, la mesure est fidèle), si bien qu'un résultat négatif peut toujours être imputé à une auxiliaire. D'où l'importance du préenregistrement des prédictions et des critères d'échec (chapitre 3).
Le théorème de Bayes et les taux de base
Le cœur quantitatif du chapitre
Passons de la logique à la probabilité. La situation type est celle d'un diagnostic: on a une hypothèse (la personne est malade), une donnée (le test est positif), et l'on veut , la probabilité de l'hypothèse sachant la donnée.
Démonstration. Par définition de la probabilité conditionnelle, pour deux événements de probabilité non nulle,
La seconde égalité donne ; en la reportant dans la première,
Il reste à décomposer le dénominateur. Les événements et forment une partition de l'univers, donc , réunion disjointe, et par additivité
ce qui est la formule des probabilités totales. En substituant, on obtient (11.1). Pour (11.2), il suffit d'identifier , , et .
Ce résultat n'est pas un artifice d'école. Interrogés sur des problèmes de cette forme, des médecins, des étudiants en médecine et des personnels hospitaliers donnent majoritairement des réponses proches de la sensibilité — de l'ordre de ou — au lieu de la dizaine de pour cent correcte; la proportion de réponses justes dans les études classiques de ce type se compte souvent en pourcentages à un chiffre. La négligence des taux de base figure parmi les résultats robustes de cette littérature: elle a été observée dans de nombreuses populations, y compris chez des professionnels, et elle a des conséquences directes sur l'information des patients.
Remettez dans l'ordre les étapes du calcul d'une valeur prédictive positive à partir de la prévalence, de la sensibilité et de la spécificité.
Glissez les éléments pour les mettre dans le bon ordre
- Calculer le nombre de faux positifs:
- Diviser les vrais positifs par ce total:
- Calculer le nombre de vrais positifs:
- Additionner les deux pour obtenir , la probabilité totale d'un test positif
- Identifier l'hypothèse (être malade) et la donnée (test positif), puis noter la prévalence
Les fréquences naturelles
Le format de l'énoncé n'est pas neutre. Reformulons exactement le même problème, sans changer une seule valeur, mais en fréquences absolues portant sur une cohorte de référence.
Sur personnes dépistées, sont malades. Parmi ces malades, ont un test positif. Parmi les personnes non malades, environ ont malgré tout un test positif. Une personne a un test positif: quelle est la probabilité qu'elle soit malade?
Le calcul devient une lecture: il y a tests positifs, dont malades, soit . Le taux de base n'a plus besoin d'être «pris en compte»: il est déjà dans les effectifs. C'est ce que Gigerenzer et Hoffrage (1995) ont appelé le passage aux fréquences naturelles.
Statut: effet robuste et répliqué. Le gain apporté par le format en fréquences naturelles a été retrouvé dans de nombreuses études, y compris chez des médecins et des étudiants en médecine, et une synthèse méta-analytique de cette littérature (McDowell et Jacobs, 2017) situe le taux de solutions bayésiennes correctes autour de avec un énoncé en probabilités contre environ avec un énoncé en fréquences naturelles. Retenez les deux moitiés du résultat: le format multiplie les réussites par un facteur important — c'est l'une des rares applications pratiques bien établies de toute la littérature des biais, et elle est enseignée dans les facultés de médecine et utilisée dans les brochures d'information —, et une majorité de personnes échoue encore. Le format aide; il ne remplace pas la compréhension.
Chaque pastille est une personne dépistée. Les vrais positifs (en tête de grille, dans la couleur du cours) sont les malades détectés, les faux positifs (brun) les personnes saines alarmées à tort. Baissez la prévalence et regardez les faux positifs submerger les vrais: c'est la négligence des taux de base rendue visible.
Un test de dépistage a une sensibilité de et une spécificité de . On l'applique à une population où la prévalence de la maladie est de . Quelle est la valeur prédictive positive, en pourcentage?
Les heuristiques de jugement
Trois heuristiques et leur statut
La disponibilité. On estime la fréquence d'une classe d'événements par la facilité avec laquelle des exemples viennent à l'esprit. Comme cette facilité dépend de la couverture médiatique, du caractère émotionnel et de la récence autant que de la fréquence réelle, les causes de décès spectaculaires et rares (accidents d'avion, homicides) sont surestimées et les causes fréquentes et discrètes (maladies chroniques) sous-estimées. Statut: la corrélation entre saillance médiatique et fréquence perçue est bien documentée depuis les travaux de Lichtenstein et collègues (1978), et la direction de l'effet est établie; les démonstrations expérimentales fondées sur la manipulation de la difficulté de récupération ont donné des tailles d'effet variables selon les modérateurs, et méritent d'être citées avec prudence.
La représentativité. On juge la probabilité qu'un objet appartienne à une catégorie par sa ressemblance au prototype de cette catégorie (chapitre 10) — en ignorant le taux de base, la taille de l'échantillon et la fiabilité de l'information. La démonstration la plus célèbre est l'erreur de conjonction: après une description de «Linda» évoquant l'engagement militant, une majorité de participants juge plus probable qu'elle soit «caissière de banque et militante féministe» que simplement «caissière de banque», ce qui viole la règle élémentaire .
Statut: l'effet est réel et facile à reproduire, mais son interprétation est discutée, et une part du phénomène tient à la pragmatique de l'énoncé. Dans la conversation ordinaire, énoncer «caissière de banque» quand on sait qu'elle est aussi militante serait trompeur: l'auditeur comprend légitimement «caissière de banque et non militante», auquel cas sa réponse cesse d'être une erreur de probabilité. Hertwig et Gigerenzer (1999) ont montré que reformuler la question en fréquences («sur personnes comme Linda, combien sont…?») fait chuter fortement le taux de violations. Il reste un effet après ces corrections; il est plus petit que la version popularisée ne le laisse croire.
L'ancrage. Une valeur numérique présente à l'esprit avant une estimation tire la réponse dans sa direction, même lorsqu'elle est manifestement non informative. Statut: robuste pour les ancres pertinentes ou plausibles — l'ancrage figure parmi les effets qui se sont répliqués sans difficulté dans les grandes réplications multi-laboratoires évoquées au chapitre 3, avec des tailles d'effet substantielles. En revanche, les variantes les plus spectaculaires, où un nombre visiblement arbitraire (les deux derniers chiffres d'un numéro d'identité) déplacerait des évaluations monétaires, ont donné lieu à des tentatives de réplication décevantes. La distinction est instructive: le même nom d'effet recouvre des paradigmes de solidité très inégale.
«Deux systèmes»: une métaphore utile, pas une architecture
Cette prudence est indispensable, car la littérature des heuristiques et biais n'est pas d'un seul bloc. Le chapitre 3 a détaillé la crise de la réplication; ce chapitre en donne l'application locale. Sont solides: la négligence des taux de base, l'ancrage (paradigmes classiques), l'effet de croyance dans les syllogismes, les effets de cadrage, l'aversion aux pertes comme phénomène, le bénéfice des fréquences naturelles. Sont contestés, non répliqués ou fortement redimensionnés: une grande partie des effets d'amorçage comportemental, l'épuisement du moi comme explication des échecs d'autocontrôle, la «surcharge de choix» (le fait qu'un trop grand nombre d'options réduirait l'achat: la synthèse méta-analytique de cette littérature aboutit à un effet moyen proche de zéro), et l'idée que la délibération inconsciente produirait de meilleures décisions que la réflexion. La règle de lecture est constante: demandez d'où vient le chiffre, combien de fois il a été retrouvé, et par qui.
La rationalité écologique
Le programme de la rationalité écologique, développé notamment par Gigerenzer et le groupe ABC, propose un contrepoint qui n'est pas une apologie de l'erreur. Son argument est structurel: une heuristique n'est ni bonne ni mauvaise en soi, elle est adaptée ou non à une structure d'environnement. Une règle simple qui ignore délibérément de l'information peut battre un modèle sophistiqué, non par magie mais par un arbitrage statistique bien connu: en estimant moins de paramètres, elle encaisse un peu de biais et supprime beaucoup de variance, ce qui améliore la prédiction sur de nouvelles données quand celles-ci sont peu nombreuses ou bruitées. C'est exactement le raisonnement qui justifie, en statistique, de préférer un modèle parcimonieux.
Deux conséquences: la comparaison «humain contre norme» doit préciser quelle norme et dans quel environnement, une stratégie optimale dans un monde stationnaire pouvant être médiocre ailleurs; et la voie d'amélioration n'est pas seulement de corriger les personnes, mais de changer l'environnement d'information — ce que fait exactement le passage aux fréquences naturelles.
Une responsable RH lit un dossier: «Silencieux, méthodique, aime les classements et les détails.» Elle juge plus probable que cette personne soit bibliothécaire que commerciale, bien qu'elle sache que son entreprise emploie vingt fois plus de commerciaux que de bibliothécaires. Quelle est la meilleure description de ce jugement?
La décision sous risque
Espérance, utilité et aversion au risque
Avec , une loterie qui donne ou CHF à pile ou face a une espérance de CHF, une utilité espérée de , donc un équivalent certain de CHF: cet agent échangerait la loterie contre francs sûrs, et paierait donc une prime de risque de CHF. L'utilité marginale décroissante — le deuxième franc de la journée compte moins que le premier — suffit à produire l'aversion au risque, sans aucune psychologie supplémentaire.
Cette théorie est une norme excellente et une description imparfaite. Les paradoxes d'Allais (1953) montrent des violations systématiques de son axiome d'indépendance, et surtout: l'utilité espérée porte sur des niveaux de richesse finaux, alors que les gens raisonnent en variations par rapport à un point de référence. C'est le point de départ de la théorie des perspectives (Kahneman et Tversky, 1979), qui reste une théorie descriptive et non normative. (Le cours de microéconomie aborde le même appareil du côté normatif: neutralité au risque, enchères, et l'incorporation des régularités comportementales dans les modèles économiques.)
La fonction de valeur et l'aversion aux pertes
Démonstration. La valeur d'une perspective à deux issues équiprobables est la moyenne des valeurs des issues. Pour le pari ,
où l'on a mis en facteur. Le signe de est donc celui de : la perspective est refusée () si et seulement si . Si , le facteur vaut et la condition se réduit à , vraie par hypothèse: pari symétrique à espérance nulle est refusé, quelle que soit sa taille.
Pour (11.5), on considère le pari . Il est accepté lorsque
la dernière équivalence utilisant la stricte croissance de sur . Si , alors , d'où , rapport indépendant de .
Avec et , quel gain minimal (en CHF) rend acceptable un pari à pile ou face dont la perte possible est de CHF?
Cadrage, comptabilité mentale, coûts irrécupérables, dotation
Puisque la valeur porte sur des écarts à un point de référence, la manière dont on décrit une situation détermine ce qui compte comme gain ou comme perte.
- Effets de cadrage. Une même issue décrite comme « personnes seront sauvées» ou comme « personnes mourront» sur n'appelle pas les mêmes choix: les participants deviennent averses au risque dans le cadre des gains et amateurs de risque dans le cadre des pertes (Tversky et Kahneman, 1981). Statut: robuste, retrouvé dans de grandes réplications multi-laboratoires. Application immédiate: un traitement présenté par son taux de survie à cinq ans et le même traitement présenté par son taux de mortalité ne suscitent pas les mêmes décisions, chez les patients comme chez les soignants.
- Comptabilité mentale. Nous rangeons l'argent dans des «comptes» séparés (le budget vacances, l'argent gagné au jeu, le salaire) et le traitons différemment selon le compte, alors que le franc est fongible. Cela explique qu'on refuse de racheter un billet de concert perdu tout en acceptant de payer le même montant si l'on a perdu l'équivalent en espèces.
- Coûts irrécupérables (sunk costs). Une dépense déjà engagée et non récupérable ne devrait pas influencer un choix tourné vers l'avenir; elle l'influence pourtant, et l'on persiste dans un projet «pour ne pas avoir dépensé pour rien». Le phénomène est bien attesté chez l'être humain adulte; le mécanisme invoqué (éviter d'inscrire une perte au compte) relève de la même famille d'idées que le point précédent.
- Effet de dotation. Le prix auquel on accepte de vendre un objet qu'on possède dépasse celui auquel on accepterait de l'acheter. Statut: effet réel mais sensible à la procédure — voir l'encadré ci-dessus.
Ce qu'on en fait
Architecture du choix et incitations douces
Les réussites les plus solides concernent les options par défaut: l'affiliation automatique à un plan d'épargne retraite avec possibilité de sortie augmente très fortement les taux de participation, et les pays où le don d'organes est organisé par consentement présumé affichent des taux d'inscription incomparablement plus élevés que ceux où il faut s'inscrire activement. Ces effets se comptent en dizaines de points de pourcentage: ils sont massifs, mesurés sur des populations entières et robustes.
Il faut cependant tenir les deux bouts, car c'est ici que la littérature promotionnelle a le plus dérapé.
- Une méta-analyse largement citée de la littérature publiée sur les nudges a rapporté un effet moyen de taille moyenne; une réanalyse indépendante, corrigeant le biais de publication, a conclu que l'estimation devenait indiscernable de zéro une fois cette correction appliquée. Deux équipes, les mêmes études, deux conclusions: le désaccord porte sur la correction, ce qui est exactement le genre de débat que le chapitre 3 vous a appris à lire.
- Une comparaison encore plus instructive: DellaVigna et Linos (2022) ont analysé l'ensemble des essais randomisés conduits par deux grandes unités administratives aux États-Unis, portant sur des millions de personnes, sans sélection à la publication. L'effet moyen y est de l'ordre de un à deux points de pourcentage sur les taux de participation visés, contre près de neuf points dans les articles académiques publiés sur des interventions comparables. Les nudges fonctionnent; ils fonctionnent beaucoup moins que la vitrine ne le suggère, et le facteur d'écart est un cas d'école de biais de publication et de sélection des sites.
La question éthique. Un dispositif qui agit par des mécanismes dont la personne n'a pas conscience pose un problème de consentement: qui décide de la direction dans laquelle on pousse, et au nom de quoi? Trois garde-fous font consensus dans le débat: la transparence (l'existence du dispositif doit pouvoir être connue sans le rendre inopérant), la réversibilité (sortir de l'option par défaut doit rester simple et sans coût), et l'alignement sur l'intérêt de la personne et non sur celui de l'institution. Notons que l'objection «cela manipule» ne peut pas viser les seuls nudges: toute architecture de choix a un effet, y compris celle qui existe par défaut et par inadvertance. La question n'est pas s'il faut une architecture, mais laquelle et décidée par qui.
Aider une décision professionnelle
En médecine, l'application directe de ce chapitre est l'information en fréquences naturelles: valeurs prédictives, bénéfices absolus plutôt que relatifs (une réduction «de » d'un risque qui passe de à pour mille n'est pas la même chose qu'une réduction de à ), et présentation conjointe des bénéfices et des dommages. La décision partagée entre soignant et patient suppose que les deux comprennent les mêmes nombres.
En justice et dans les décisions de libération conditionnelle, la comparaison entre jugement clinique et règles statistiques est l'une des plus anciennes de la psychologie appliquée: la synthèse des travaux depuis Meehl établit qu'une règle actuarielle simple égale ou dépasse en moyenne le jugement d'expert non assisté. Ce résultat est solide, et il ne règle pas tout: un instrument de prédiction du risque hérite des biais de ses données d'apprentissage, et une même règle peut être «équitable» selon un critère statistique et inéquitable selon un autre — les débats autour des outils d'évaluation du risque de récidive l'ont montré. L'outil déplace la responsabilité, il ne la supprime pas.
Comment on améliore réellement un jugement
Quatre leviers ont fait leurs preuves, et aucun ne consiste à «faire attention».
- Changer le format de l'information: fréquences naturelles, effectifs absolus, tableaux à double entrée. C'est le levier le mieux établi de ce chapitre.
- Contraindre la procédure: listes de contrôle et protocoles explicites, qui empêchent l'oubli d'une étape sous pression. Statut nuancé: les premières évaluations à grande échelle de la liste de contrôle chirurgicale ont rapporté des réductions importantes de complications, mais des études ultérieures dans d'autres systèmes de santé n'ont pas retrouvé le même bénéfice; ce qui compte semble être moins la feuille que la manière dont l'équipe se l'approprie.
- Utiliser des règles simples et les appliquer avec constance, plutôt qu'un jugement au cas par cas qui varie d'un jour à l'autre. Une part des gains des règles actuarielles vient simplement de leur constance.
- Organiser la rétroaction. C'est le point le plus important et le plus négligé. Une intuition experte fiable se développe seulement à deux conditions, que Kahneman et Klein (2009) ont formulées conjointement malgré leurs désaccords: un environnement suffisamment régulier pour contenir des régularités apprenables, et une occasion de les apprendre par une pratique prolongée avec un retour rapide et sans ambiguïté. L'anesthésiste et le pompier remplissent ces conditions; l'analyste politique à long terme et le sélectionneur de personnel non structuré ne les remplissent pas — et leur confiance, elle, ne fait pas la différence.
La résolution de problèmes
Les sections précédentes portaient sur des jugements et des choix entre options données. Beaucoup de situations sont d'une autre nature: on connaît le point de départ et le but, mais pas le chemin. Monter un meuble en kit, démontrer un théorème, dépanner une installation, trouver un coup aux échecs. La psychologie de la résolution de problèmes étudie comment ce chemin est trouvé, et pourquoi il ne l'est parfois pas alors que toutes les pièces sont sous les yeux.
Le problème comme espace d'états
Le cas d'école est la tour de Hanoï. Trois piquets, A, B et C; sur le piquet A, disques de tailles décroissantes empilés du plus grand au plus petit. Il faut transférer la pile sur le piquet C en ne déplaçant qu'un disque à la fois — celui du sommet d'une pile — et sans jamais poser un disque sur un disque plus petit.
Démonstration. Point 1. Un état est entièrement décrit par le piquet qu'occupe chaque disque: choix pour chacun des disques, soit affectations. Chacune correspond à un seul état légal, car sur un piquet donné les disques ne peuvent être empilés que dans l'ordre des tailles décroissantes.
Point 2. Montrons d'abord que . Le grand disque doit quitter A au moins une fois. Au moment de son premier déplacement, de A vers un piquet X, les autres disques ne peuvent être ni sur A (ils seraient au-dessus de lui) ni sur X (il ne pourrait pas s'y poser): ils sont tous sur le troisième piquet. Les y amener depuis A coûte au moins déplacements. Symétriquement, au moment du dernier déplacement du grand disque, vers C, les autres sont tous sur un même piquet différent de C, et les amener ensuite sur C coûte au moins déplacements. Ces deux séries sont disjointes, et il faut au moins un déplacement du grand disque: . Inversement, la procédure récursive — transférer les petits disques sur B, déplacer le grand sur C, transférer les petits de B sur C — atteint exactement cette borne. Donc avec . Si , alors , et la formule (11.6) s'établit par récurrence.
Point 3. Dans la procédure récursive, le grand disque (rang ) bouge une fois, soit ; chacun des autres disques bouge dans les deux sous-problèmes de taille , donc deux fois plus que dans un seul. Par récurrence, le disque de rang bouge fois. Vérification: .
La figure rend visible ce que «chercher» veut dire. Le participant ne voit pas cet espace: il est quelque part sur un nœud et ne connaît que les déplacements possibles depuis là. La difficulté d'un problème dépend donc moins de la taille de l'espace que de ce qui guide le choix à chaque nœud. Elle dépend aussi de la représentation: Kotovsky, Hayes et Simon (1985) ont présenté des problèmes isomorphes à la tour de Hanoï — même espace, mêmes opérateurs, mais habillés en histoires de monstres qui se passent des globes ou en changent la taille —, et les temps de résolution variaient jusqu'à un facteur seize entre la version la plus facile, la tour elle-même, et la plus difficile, principalement parce que certaines formulations rendaient les règles plus difficiles à garder en mémoire de travail.
Les heuristiques de recherche
Explorer l'espace en entier est impossible dès qu'il est grand: le nombre de parties d'échecs possibles a été estimé par Claude Shannon à quelque . Un algorithme garantit la solution, au prix éventuel d'une recherche exhaustive; une heuristique de recherche — au même sens que les heuristiques de jugement de ce chapitre — est une règle qui restreint la recherche, rapide et souvent efficace, mais sans garantie. Trois heuristiques ont été particulièrement étudiées.
L'analyse moyens-fins est au cœur du General Problem Solver de Newell, Shaw et Simon, l'un des premiers programmes d'intelligence artificielle (fin des années 1950), conçu à partir de protocoles de participants qui pensaient à voix haute pendant qu'ils résolvaient des problèmes. L'escalade a un défaut caractéristique: elle refuse tout pas qui éloigne en apparence du but, et reste bloquée quand le chemin exige un détour. Dans les problèmes de traversée de rivière (les «missionnaires et cannibales» et leurs variantes), Thomas (1974) a observé, avec la version «hobbits et orques», que les hésitations et les erreurs se concentrent à certains états précis du chemin, notamment là où il faut ramener des personnages vers la rive de départ, ce qui semble défaire le travail accompli.
Le travail à rebours est utile quand le but est mieux déterminé que le départ. Un étang se couvre de nénuphars dont la surface double chaque jour; il est entièrement couvert le e jour. Quel jour était-il à moitié couvert? Raisonné vers l'avant, le problème invite à répondre «le e jour»; raisonné à rebours, il est immédiat: la veille du jour où il est couvert, il l'était à moitié, donc le e jour.
Combien de déplacements la solution minimale de la tour de Hanoï à six disques comporte-t-elle?
Restructuration, insight et fixation
Les psychologues de la forme, rencontrés au chapitre 6 à propos de l'organisation perceptive, ont abordé la résolution de problèmes avec la même idée qu'en perception: la difficulté tient souvent à la manière dont la situation est organisée, et la solution survient quand elle est restructurée. Wolfgang Köhler, observant des chimpanzés à Ténériffe pendant la Première Guerre mondiale, décrivait des solutions qui apparaissaient d'un coup après une période d'échec — emboîter deux bâtons pour atteindre une banane hors de portée. Karl Duncker (1945) a donné au phénomène ses paradigmes les plus durables.
Dans le problème de la bougie de Duncker, on dispose d'une bougie, d'une boîte de punaises et d'allumettes, et il faut fixer la bougie allumée au mur sans que la cire coule sur la table. La solution consiste à vider la boîte, à la punaiser au mur et à s'en servir de support. Elle est trouvée nettement plus souvent quand la boîte est présentée vide, à côté des punaises, que quand elle est présentée pleine: remplie, elle est perçue comme un contenant et non comme une étagère possible. Cette différence a été reproduite par Adamson (1952), chez qui les participants recevant la boîte vide résolvaient le problème environ deux fois plus souvent, et dans de nombreuses variantes; la fixité fonctionnelle est un phénomène robuste, dont l'ampleur dépend beaucoup du matériel.
Après la série d'entraînement de Luchins, on présente des jarres de , et litres, avec un but de litres. Quelles opérations donnent exactement litres?
Qu'est-ce qui fait d'une solution un «insight»? Les participants le sentent eux-mêmes: Metcalfe et Wiebe (1987) demandaient toutes les quinze secondes à quel point les participants se sentaient «proches» de la solution. Pour des problèmes algébriques, ce sentiment croissait progressivement; pour des problèmes d'insight, il restait bas puis bondissait juste avant la réponse. La phénoménologie de la solution soudaine est donc robuste. Que l'insight repose sur un processus spécial, distinct de la recherche ordinaire, est en revanche plausible mais discuté: une partie des chercheurs y voit une recherche ordinaire dans une représentation enfin correcte, et l'aide apportée par des indices explicites est souvent faible — dans le problème des neuf points, dire aux participants que la solution exige de sortir du carré formé par les points n'en fait réussir qu'une minorité (Weisberg et Alba, 1981). Quant à l'incubation — le bénéfice d'interrompre le travail sur un problème avant d'y revenir —, une méta-analyse (Sio et Ormerod, 2009) conclut à un effet positif mais modeste, qui dépend de la durée de préparation et de la nature de l'activité intercalée.
Le transfert analogique
Une manière efficace de résoudre un problème nouveau est d'y reconnaître un problème déjà résolu. Encore faut-il le reconnaître.
Mary Gick et Keith Holyoak (1980) ont utilisé le problème des rayons de Duncker: une tumeur inopérable doit être détruite par des rayons; à forte intensité, ils détruisent aussi les tissus sains traversés; à faible intensité, ils sont inoffensifs pour tous. La solution consiste à faire converger sur la tumeur plusieurs rayons faibles venant de directions différentes. Sans préparation, moins d'un participant sur dix la trouve. Les participants avaient lu auparavant une histoire structurellement identique: un général, ne pouvant lancer toute son armée sur une forteresse par une seule route minée, la divise en petits groupes qui convergent par plusieurs routes. Dans l'une de leurs expériences, où l'histoire était mêlée à deux autres récits, seuls de ceux qui l'avaient lue sans autre indication trouvaient la solution — et sans doute un seul sur quinze en remarquant vraiment l'analogie; quand on suggérait simplement que l'une des histoires pouvait être utile, la trouvaient. Les groupes étaient petits (quinze et douze participants), mais d'autres expériences de l'article vont dans le même sens: sans indice, une minorité fait le rapprochement; avec l'indice, une large majorité. Le goulet n'est donc pas l'application de la solution, mais sa récupération: la similarité de surface (médecine contre stratégie militaire) ne déclenche pas le rappel.
Ce résultat est robuste et il a une conséquence pédagogique directe. Gick et Holyoak (1983) ont montré que présenter deux sources de surface différente et demander de les comparer favorise l'abstraction d'un schéma («diviser une force et la faire converger»), qui se transfère ensuite bien mieux qu'une source unique. Un exemple résolu unique enseigne surtout l'exemple; plusieurs exemples comparés enseignent la structure — à rapprocher de l'effet d'espacement et des stratégies d'étude du chapitre 9.
Dans les expériences de Gick et Holyoak, une simple suggestion d'utiliser l'histoire de la forteresse fait passer le taux de solution d'environ un sur cinq à plus de neuf sur dix. Qu'en conclut-on?
L'expertise
Comment un expert résout-il mieux? Pas, d'abord, en cherchant plus. Adriaan de Groot, comparant dans les années 1940 des grands maîtres et de bons joueurs de club qui pensaient à voix haute devant une position d'échecs, trouvait qu'ils examinaient à peu près le même nombre de coups: les maîtres examinaient simplement les bons. William Chase et Herbert Simon (1973) ont précisé l'explication. Une position tirée d'une partie réelle est montrée cinq secondes, puis il faut la reconstituer: le maître replace bien plus de pièces que le débutant. Avec des pièces disposées au hasard, l'avantage disparaît presque entièrement — une réanalyse ultérieure (Gobet et Simon, 1996) en a retrouvé un petit reste. La supériorité de l'expert ne tient donc pas à une mémoire générale meilleure, mais à un vaste répertoire de configurations familières, des chunks, qui découpent la position en quelques unités chargées de sens: le mécanisme de regroupement du chapitre 9, à l'échelle de dizaines de milliers de configurations. Dans d'autres domaines, l'expertise se manifeste par la représentation du problème: Chi, Feltovich et Glaser (1981) ont montré que des experts en physique classent des problèmes selon le principe qui les résout (conservation de l'énergie), là où des étudiants débutants les classent selon les objets qui y figurent (plan incliné, poulie).
Comment devient-on expert? Ericsson, Krampe et Tesch-Römer (1993) ont mis l'accent sur la pratique délibérée — une pratique structurée, ciblée sur les faiblesses, avec rétroaction, distincte de la simple répétition —, et leurs données ont été popularisées sous la forme d'une «règle des dix mille heures» qu'Ericsson lui-même a contestée comme simplification. La méta-analyse de Macnamara, Hambrick et Oswald (2014) a estimé la part de variance des performances expliquée par la quantité de pratique délibérée: de l'ordre de pour les jeux, pour la musique, pour le sport, pour l'éducation et moins de pour les professions. Statut: que la pratique compte est robuste; qu'elle soit le déterminant principal de l'expertise est plausible mais discuté — la part qu'elle explique est substantielle mais minoritaire, varie fortement selon les domaines, et le débat porte aussi sur la définition de ce qui compte comme pratique délibérée. Rapprochez cette discussion des deux conditions de Kahneman et Klein vues plus haut: une intuition experte ne se forme que dans un environnement régulier, avec une rétroaction rapide.
Synthèse
- Deux questions distinctes structurent le domaine: ce qu'un agent devrait faire (norme) et ce qu'il fait (description). Un écart peut signaler une erreur de raisonnement, une compréhension différente de la tâche, ou une norme mal choisie: il faut trancher par l'expérience, pas par le titre.
- En déduction, le contenu envahit la forme: l'effet de croyance est robuste, et la tâche de Wason montre un contraste massif entre version abstraite (– de réussite) et version déontique (–); des trois explications concurrentes, le module de détection des tricheurs est la plus contestée.
- Le théorème de Bayes (11.1) fait dépendre du taux de base autant que de la qualité du test: avec une prévalence de , une sensibilité de et une spécificité de , la valeur prédictive positive n'est que de . La est un résultat solide, et reformuler le problème en («sur personnes…») améliore nettement les performances — effet répliqué et méta-analysé, l'une des rares applications pratiques bien établies de cette littérature, sans pour autant amener une majorité à la bonne réponse.
Exercices
Vous pouvez afficher le corrigé directement sous chaque énoncé après avoir cherché la solution.
Un test de dépistage d'une maladie professionnelle a une sensibilité de et une spécificité de . Il est proposé à l'ensemble d'un secteur, où la prévalence de la maladie est de .
- Calculez la valeur prédictive positive.
- Recalculez-la pour une population ciblée dont la prévalence est de .
- Reformulez la situation de la question 1 en fréquences naturelles sur personnes et retrouvez le résultat.
- Calculez la valeur prédictive négative dans la situation 1 et dites, en une phrase, ce que ce test permet de conclure et ce qu'il ne permet pas de conclure.
On adopte la fonction de valeur (11.4) avec et .
- Calculez et , puis la valeur d'un pari à pile ou face qui fait gagner CHF ou perdre CHF. Le pari est-il accepté?
Un agent a pour fonction d'utilité , où est un montant en CHF. On lui propose:
- A: recevoir CHF de manière certaine;
- B: recevoir ou CHF avec probabilité chacune;
Pour chacun des jugements suivants, nommez le mécanisme le plus plausible, expliquez en quoi il conduit à une erreur, et indiquez le statut empirique du phénomène invoqué.
- Après trois reportages sur des attaques de requin, un vacancier estime le risque de mourir d'une telle attaque bien supérieur à celui de mourir d'une chute dans son escalier.
- Un recruteur, à qui l'on a d'abord annoncé que «le salaire de la fourchette haute est de CHF», propose un salaire plus élevé qu'un collègue à qui l'on a annoncé CHF, pour le même poste.
- Un jury juge plus probable qu'un accusé décrit comme «solitaire, méticuleux, passionné d'armes anciennes» soit un collectionneur clandestin qu'un simple contribuable, alors que les contribuables sont mille fois plus nombreux.
- Une équipe poursuit un projet informatique manifestement condamné, «parce qu'on a déjà investi trois ans et deux millions».
Solution
1. Heuristique de disponibilité. La fréquence est estimée par la facilité de rappel d'exemples, elle-même déterminée par la couverture médiatique, la charge émotionnelle et la récence. L'erreur consiste à traiter la saillance comme une information statistique. Statut: la corrélation entre couverture médiatique et fréquence perçue, et la surestimation générale des causes de décès rares et spectaculaires, sont bien documentées depuis la fin des années 1970 et cohérentes avec de nombreuses études; les démonstrations expérimentales fondées sur la manipulation de la difficulté de récupération sont plus fragiles et dépendent de modérateurs. On peut donc affirmer la direction, pas une taille d'effet précise.
- Combien d'états légaux compte l'espace problème de la tour de Hanoï à quatre disques? Combien de déplacements comporte la solution minimale?
- Dans cette solution, combien de fois chaque disque est-il déplacé? Vérifiez que la somme redonne le résultat de la question 1.
- Le moine de la légende doit déplacer disques à raison d'un déplacement par seconde, sans erreur. Combien d'années lui faut-il? (Prenez jours par an.)
- Un résolveur utilise l'escalade avec la mesure «nombre de disques déjà sur le piquet C». Montrez sur le cas à trois disques qu'il ne peut pas suivre la solution minimale, et dites ce que l'analyse moyens-fins fait de différent.
Solution
1. Par le théorème 11.3, l'espace compte états, et la solution minimale déplacements. On peut le retrouver par la récurrence: .
Un article de magazine affirme: «La science a montré que n'importe qui devient expert dans n'importe quel domaine avec dix mille heures de pratique. Le talent est un mythe.»
- De quelle recherche cette affirmation est-elle tirée, et en quoi la «pratique délibérée» diffère-t-elle de la simple pratique?
- En vous appuyant sur la méta-analyse de Macnamara, Hambrick et Oswald (2014), dites ce que les données permettent d'affirmer sur le rôle de la pratique, et ce qu'elles ne permettent pas d'affirmer.
- Les experts aux échecs reconstituent bien mieux que les débutants une position réelle vue cinq secondes, mais presque pas mieux une position aléatoire. Que nous apprend ce résultat sur la nature de l'expertise, et pourquoi est-il pertinent pour juger l'affirmation du magazine?
- Prenez position: l'affirmation est-elle vraie, fausse, ou mal posée?
Solution
1. L'affirmation dérive des travaux d'Ericsson, Krampe et Tesch-Römer (1993) sur des violonistes, popularisés ensuite sous la forme d'une «règle des dix mille heures». La pratique délibérée est une pratique structurée, conçue pour améliorer la performance, ciblée sur les points faibles, exigeante et accompagnée d'une rétroaction — souvent guidée par un enseignant. Elle se distingue de la simple répétition d'une activité que l'on maîtrise déjà, qui maintient un niveau sans le faire progresser. Le chiffre de dix mille heures n'était pas une loi mais une moyenne approximative dans un échantillon particulier, et Ericsson lui-même a contesté sa transformation en règle.
2. Ce que l'on peut affirmer: la quantité de pratique délibérée est corrélée à la performance dans tous les domaines examinés; la pratique compte, et c'est un résultat robuste. Ce que l'on ne peut pas affirmer: qu'elle explique l'essentiel des différences. La part de variance expliquée est de l'ordre de pour les jeux, pour la musique, pour le sport, pour l'éducation et moins de pour les professions: substantielle dans certains domaines, minoritaire partout. Deux réserves supplémentaires: ce sont des sur des quantités de pratique souvent reconstituées de mémoire, ce qui n'établit pas que la pratique toute la différence (les plus doués peuvent aussi pratiquer davantage, parce qu'ils y trouvent plus de satisfaction); et la mesure dépend de la définition de la pratique délibérée, sur laquelle les auteurs ne s'accordent pas.
- Démontrez le théorème de Bayes sous la forme (11.1) à partir de la seule définition de la probabilité conditionnelle et de la formule des probabilités totales.
- En posant , montrez que la valeur prédictive positive s'écrit , puis établissez que lorsque , et que est strictement croissante en .
Références
- Kahneman, D., Système 1 / Système 2: les deux vitesses de la pensée, Flammarion, Paris, 2012 — synthèse grand public de la tradition heuristiques et biais, à lire avec les réserves indiquées dans ce chapitre (notamment sur le chapitre d'amorçage, dont l'auteur a lui-même reconnu la fragilité).
- Eysenck, M. W. et Keane, M. T., Cognitive Psychology: A Student's Handbook, 8e éd., Routledge, Londres, chapitres sur le raisonnement, le jugement et la décision — présentation équilibrée des interprétations concurrentes de la tâche de Wason.
- Gigerenzer, G., Todd, P. M. et le groupe ABC, Simple Heuristics That Make Us Smart, Oxford University Press, New York, 1999 — le programme de la rationalité écologique et l'analyse des heuristiques comme adaptations à des structures d'environnement.
- Gigerenzer, G. et Hoffrage, U., «How to improve Bayesian reasoning without instruction: frequency formats», Psychological Review, 102(4), 1995 — l'article fondateur des fréquences naturelles; voir aussi la synthèse méta-analytique de McDowell et Jacobs (2017) pour l'ampleur de l'effet.
- Kahneman, D. et Tversky, A., «Prospect theory: an analysis of decision under risk», Econometrica, 47(2), 1979, et Tversky, A. et Kahneman, D., «Advances in prospect theory: cumulative representation of uncertainty», Journal of Risk and Uncertainty, 5(4), 1992 — la fonction de valeur (11.4) et les estimations de , et .
- Thaler, R. H. et Sunstein, C. R., Nudge, Yale University Press, New Haven, 2008, à confronter à DellaVigna, S. et Linos, E., «RCTs to scale: comprehensive evidence from two nudge units», Econometrica, 90(1), 2022, et aux échanges méta-analytiques récents sur la taille réelle des effets.
- Newell, A. et Simon, H. A., Human Problem Solving, Prentice-Hall, Englewood Cliffs (NJ), 1972 — l'espace problème et l'analyse moyens-fins; Gick, M. L. et Holyoak, K. J., «Analogical problem solving», Cognitive Psychology, 12, 1980 — le transfert analogique et le problème des rayons.
- Gazzaniga, M., Heatherton, T. et Halpern, D., Psychological Science, W. W. Norton, New York, chapitre sur la pensée et la prise de décision; polycopiés de psychologie cognitive de l'UNIGE et de l'UNIL pour les versions francophones du vocabulaire.