Objectifs du chapitre
À la fin de ce chapitre, vous serez capable de:
- énoncer le problème inverse de la perception — une infinité de scènes tridimensionnelles produisent la même image rétinienne — et expliquer pourquoi il impose de traiter la perception comme une inférence contrainte;
- décrire la ségrégation figure-fond et les principes d'organisation gestaltistes, et dire exactement ce qu'ils sont: des régularités descriptives robustes dont l'explication historique a été abandonnée;
- énumérer les indices binoculaires et monoculaires de profondeur, et reconnaître ceux qu'exploite une scène donnée;
- démontrer la relation d'angle visuel , justifier son approximation aux petits angles, et l'utiliser pour calculer angles visuels, tailles d'images rétiniennes et tailles perçues;
- expliquer quantitativement les illusions de Ponzo, de la chambre d'Ames et de la lune par une erreur d'estimation de distance, en distinguant à chaque fois le phénomène (robuste) de son explication (plus ou moins assurée);
- formuler la perception comme une combinaison bayésienne d'une vraisemblance sensorielle et d'un a priori sur le monde, et calculer un exemple simple;
- décrire la rotation mentale et le balayage d'images, estimer une vitesse de rotation à partir de temps de réponse, et exposer le débat analogique / propositionnel ainsi que les données neurales qui le déplacent;
- distinguer contrôle par rétroaction et par anticipation, appliquer la loi de Fitts et dire ce que vaut sa dérivation.
Le problème fondamental
Ce que la rétine reçoit, et ce que vous voyez
Le chapitre 5 a établi comment un système sensoriel transforme une énergie physique en signal nerveux, et comment on mesure la finesse de cette transformation: seuils, lois psychophysiques, sensibilité et critère. Tout cela concerne la sensation. Le présent chapitre commence là où le précédent s'arrête, avec une question d'une autre nature: comment passe-t-on d'un signal à une scène, c'est-à-dire à des objets qui ont une taille, une forme, une place et une identité?
Le contraste entre l'entrée et la sortie est saisissant. Sur chaque rétine se forme une image bidimensionnelle, à l'envers, déformée par la courbure de l'œil, échantillonnée par une mosaïque de photorécepteurs très inégalement répartie, interrompue par une tache aveugle à l'endroit où le nerf optique quitte l'œil, brouillée par les mouvements incessants du regard, et renouvelée trois ou quatre fois par seconde par les saccades. Ce que vous éprouvez, en revanche, est un monde stable, tridimensionnel, continu, peuplé d'objets dont la taille et la couleur ne semblent pas changer quand vous vous en approchez ou que le soleil se voile.
L'écart entre les deux est le problème central de ce chapitre. Il ne se résout pas en supposant que le cerveau «lit» l'image: l'image ne contient pas la réponse.
Le problème inverse
Trois exemples suffisent à s'en convaincre.
- Taille et distance. Un objet de mètres à mètres et un objet de mètre à mètres se projettent identiquement. Aucune mesure faite sur l'image seule ne peut les départager (figure 6.2).
- Forme et orientation. Un disque incliné et une ellipse frontale donnent le même contour. Une table rectangulaire vue de biais produit sur la rétine un trapèze.
- Éclairement et réflectance. Une surface blanche dans l'ombre et une surface grise en pleine lumière peuvent renvoyer exactement la même quantité de lumière. La luminance qui arrive à l'œil est le produit de l'éclairement et de la réflectance; l'image donne le produit, la perception veut les facteurs.
Un problème mal posé ne devient soluble qu'en ajoutant des contraintes. C'est la réponse que ce chapitre défend, et qui organise toutes ses sections: le système perceptif ajoute des hypothèses sur le monde. Il suppose que les surfaces sont plutôt continues, que la lumière vient plutôt d'en haut, que les objets ne changent pas de taille en s'éloignant, que les coïncidences de point de vue sont rares. Ces hypothèses ne sont pas arbitraires: ce sont des régularités statistiques de l'environnement dans lequel l'espèce a évolué et dans lequel chacun a grandi. Elles sont vraies la plupart du temps, ce qui rend la perception remarquablement fiable; elles sont fausses de temps en temps, et ce sont les illusions.
L'organisation perceptive
Avant de pouvoir estimer la taille d'un objet ou le reconnaître, encore faut-il avoir décidé qu'il y a un objet, et lequel. Cette étape, l'organisation perceptive, consiste à regrouper les éléments de l'image en unités.
Figure et fond
L'attribution n'est pas neutre: une même image peut basculer d'une interprétation à l'autre, comme dans le vase de Rubin ou dans les figures réversibles décrites par l'école de Berlin dès les années 1910–1920. Le point important est qu'on ne voit jamais les deux à la fois: l'organisation perceptive produit une interprétation, pas une superposition d'interprétations. Plusieurs facteurs favorisent statistiquement le statut de figure: être la plus petite des deux régions, être entourée par l'autre, être en bas plutôt qu'en haut du champ, présenter des contours convexes, être symétrique. Ce sont, là encore, des régularités du monde: dans une scène ordinaire, les objets sont plus petits que le décor et le décor entoure les objets.
Les principes d'organisation
Les psychologues de la forme (Gestaltpsychologie) — Max Wertheimer, Wolfgang Köhler, Kurt Koffka — ont dressé dans les années 1920 un catalogue de règles décrivant quels éléments se groupent avec quels autres. La figure 6.1 en illustre six, chacune produite en ne changeant qu'un paramètre d'une grille d'éléments par ailleurs identiques.
- Proximité: les éléments proches se groupent. Le premier panneau ne montre pas six colonnes mais trois paires, uniquement parce que l'espacement à l'intérieur d'une paire est plus petit qu'entre les paires.
- Similitude: à espacement rigoureusement constant, les éléments qui se ressemblent (couleur, forme, taille, orientation) se groupent.
- Bonne continuation: on voit deux trajets qui se croisent, non quatre segments qui se rencontrent. Le regroupement suit la trajectoire la plus lisse.
- Clôture: un contour interrompu est complété; on voit un cercle troué plutôt qu'une collection d'arcs.
- Destin commun: les éléments qui bougent ensemble, dans la même direction et à la même vitesse, forment une unité. C'est le principe le plus puissant de tous, et le seul qui exige le temps.
- Région commune: appartenir à un même enclos l'emporte sur la proximité; dans le dernier panneau, les distances entre voisins sont partout identiques.
Deux principes complètent souvent la liste: la connexité (des éléments reliés par un trait se groupent) et la prégnance ou Prägnanz (l'organisation retenue est la plus simple, la plus régulière, la plus stable compatible avec l'image).
Quel est le statut de ces principes?
Ici, il faut être précis, parce que les manuels sont souvent flous.
Les phénomènes sont robustes. Ce sont des démonstrations reproductibles par n'importe qui, immédiatement, et quantifiables: on peut faire varier l'espacement ou le contraste et mesurer à quel point le regroupement bascule. Un siècle d'expériences ne les a pas ébranlés. Ce ne sont pas des «effets» au sens fragile du terme, sensibles à la taille d'échantillon; ce sont des faits perceptifs.
L'explication d'origine est dépassée. Les gestaltistes ne se contentaient pas de décrire: ils proposaient une théorie physiologique, l'isomorphisme psychophysique, selon laquelle des champs électriques continus dans le cortex adopteraient spontanément la configuration de moindre énergie, comme une bulle de savon prend la forme sphérique. Cette hypothèse a été testée — notamment par des expériences visant à perturber ces prétendus champs — et n'a pas résisté. Aucun mécanisme gestaltiste n'a été identifié. Autrement dit: les gestaltistes ont légué un excellent catalogue de phénomènes et une explication fausse.
La reformulation moderne est probabiliste. L'approche dominante aujourd'hui, cohérente avec tout le reste du chapitre, consiste à voir ces principes comme des stratégies qui exploitent des régularités statistiques des scènes naturelles. Dans le monde réel, les points d'une même surface sont proches les uns des autres (proximité), ont une réflectance semblable (similitude), leurs contours varient lentement (bonne continuation) et se déplacent solidairement (destin commun). Des travaux ont mesuré ces statistiques directement sur des bases de photographies de scènes naturelles avec segmentation manuelle, et retrouvé les dépendances que les principes prédisent. Cette reformulation est bien étayée pour la proximité et la bonne continuation; elle reste programmatique pour la prégnance, dont personne n'a donné de mesure de «simplicité» indépendante et non circulaire. Dire «cette organisation est la plus simple» sans définir la simplicité avant d'observer le percept ne prédit rien.
Un panneau montre une grille de points à espacement rigoureusement uniforme, avec un rectangle gris clair dessiné derrière les trois colonnes de gauche. Les observateurs rapportent voir deux groupes. Quel principe est en jeu, et quel est le statut scientifique correct de ce constat?
La perception de la profondeur
La rétine est une surface: la troisième dimension doit être reconstruite. Le système visuel y parvient en combinant un grand nombre d'indices (depth cues), chacun peu fiable isolément, très fiable ensemble.
Indices binoculaires
Les deux yeux, séparés d'environ cm chez l'adulte, reçoivent deux images légèrement différentes.
La disparité est un indice quantitatif: elle donne une profondeur métrique, à condition de connaître la distance de fixation. Un calcul simple en montre à la fois la puissance et la limite. Deux points situés aux distances et produisent une différence d'angle de vergence
où est l'écart interoculaire. Avec cm, deux objets distants de cm l'un de l'autre produisent une disparité de secondes d'arc à mètres, mais de seconde d'arc à mètres. Comme le seuil de stéréoacuité d'un bon observateur est de l'ordre de quelques secondes d'arc, la stéréopsie est excellente à distance de bras et devient inutilisable au-delà de quelques dizaines de mètres: sa portée décroît comme . C'est une raison structurelle, non une imperfection: la vision binoculaire est un instrument de préhension, pas de navigation lointaine.
La convergence — l'angle dont les deux yeux tournent vers l'intérieur pour fixer un point — fournit un second indice binoculaire, informatif seulement à courte distance (environ deux mètres), pour la même raison géométrique.
Indices monoculaires
Un œil unique dispose déjà de la plus grande partie de l'information. Ces indices, exploités par les peintres depuis la Renaissance, sont dits picturaux lorsqu'ils survivent dans une image fixe.
- Perspective linéaire: les lignes parallèles du monde convergent dans l'image vers un point de fuite. Le degré de convergence code la distance.
- Gradient de texture: un sol texturé de manière homogène produit des éléments d'autant plus petits et d'autant plus serrés qu'ils sont loin. La densité croît comme et la taille projetée décroît comme .
- Occlusion (ou interposition): un objet qui en masque partiellement un autre est devant. C'est l'indice le plus fiable, mais il est purement ordinal: il dit qui est devant, jamais de combien.
- Taille relative: à taille physique égale, l'objet dont l'image est plus petite est plus loin. Sur la figure, les six arbres ont la même hauteur réelle.
- Taille familière: si l'on connaît la taille réelle de l'objet (une voiture, une personne, une porte), l'angle visuel donne directement la distance. C'est l'inversion de la relation du théorème 6.1.
- Hauteur dans le champ visuel: au-dessous de l'horizon, un objet posé au sol paraît d'autant plus loin qu'il est haut dans l'image; au-dessus de l'horizon, la règle s'inverse.
- Perspective aérienne: la diffusion atmosphérique réduit le contraste et bleuit les objets lointains. Indice grossier, mais très saillant en montagne — et trompeur: par temps exceptionnellement clair, les Alpes vues du Plateau paraissent anormalement proches.
- Parallaxe de mouvement: lorsque l'observateur se déplace, les objets proches défilent vite et en sens inverse du mouvement, les objets lointains lentement. Le rapport des vitesses angulaires donne le rapport des distances. C'est un indice monoculaire quantitatif, et sa géométrie est la même que celle de la disparité, le déplacement de la tête remplaçant l'écart des yeux.
- Ombres portées et ombrage: la position d'une ombre portée indique la hauteur d'un objet au-dessus d'un plan; le dégradé d'ombrage renseigne sur le relief, sous une hypothèse d'éclairage que nous quantifierons plus loin.
Vous marchez sur un quai de gare et regardez un train à l'arrêt sur la voie d'en face. Classez ces indices de profondeur du plus fiable au moins fiable POUR CETTE SCÈNE, sachant que le train est à environ 12 mètres, que vous vous déplacez, et que la scène est riche en surfaces texturées.
Glissez les éléments pour les mettre dans le bon ordre
- Disparité rétinienne: encore exploitable à m, mais sa précision décroît en
- Convergence: quasiment sans information au-delà de deux mètres
- Parallaxe de mouvement: votre déplacement latéral donne directement le rapport des distances
- Perspective linéaire et gradient de texture du quai: informatifs, mais dépendent de l'hypothèse d'un sol régulier
- Occlusion: le train masque le bâtiment derrière lui — information certaine, mais seulement ordinale
Taille, distance et constances
Les constances perceptives
Les constances sont la preuve la plus directe que la perception ne lit pas l'image: elles consistent précisément à voir autre chose que ce que l'image contient. Elles ne sont d'ailleurs jamais parfaites — c'est ce qui permet de les étudier. Le cas de la taille est le plus simple à formaliser, et c'est le cœur quantitatif de ce chapitre.
L'angle visuel
Démonstration. Plaçons le point nodal de l'œil à l'origine et l'objet, de taille , perpendiculairement à l'axe optique, centré sur lui, à la distance . Ses deux extrémités sont aux points de coordonnées et . Le rayon qui joint l'origine à l'extrémité supérieure fait avec l'axe un angle tel que , soit . Par symétrie, le rayon inférieur fait le même angle de l'autre côté, donc l'angle total sous-tendu vaut , ce qui est la première partie de (6.2).
Pour l'approximation, on utilise le développement limité au voisinage de . Avec ,
L'erreur relative commise en remplaçant par vaut donc environ : elle est de pour , de pour , de pour et de pour . L'approximation est donc excellente pour la quasi-totalité des objets de la vie courante, et devient discutable seulement pour des objets qui occupent une large portion du champ.
Enfin, si , alors et, la fonction étant injective, : les deux objets se projettent au même endroit. La relation (6.3) s'obtient en résolvant (6.2) en à angle donné: , où l'on remplace la distance physique par la distance estimée par l'observateur.
Un objet de taille S à la distance D sous-tend l'angle θ = 2 arctan(S / 2D): c'est tout ce que la rétine fournit. La taille perçue vaut θ multiplié par la distance estimée. Faites varier l'erreur d'estimation de la distance: l'objet perçu (en pointillé) glisse le long des mêmes rayons, et l'erreur de taille perçue reproduit exactement l'erreur de distance.
Un panneau de signalisation circulaire de cm de diamètre est vu à mètres. Quel angle visuel sous-tend-il, en degrés?
Les illusions comme fenêtres sur le mécanisme
Une illusion n'est pas une défaillance: c'est le résultat de l'application d'une règle normalement utile à une configuration pour laquelle elle n'a pas été faite. C'est pourquoi les illusions sont un instrument de recherche: elles rendent visible une hypothèse que le système applique sans le dire. Encore faut-il ne pas confondre le phénomène et son explication.
L'illusion de Ponzo
Deux barres horizontales de longueur physique identique sont superposées sur deux lignes obliques convergentes, façon rails de chemin de fer. La barre du haut, plus proche du point de convergence, paraît plus longue.
Statut. Phénomène robuste, reproductible, dont l'amplitude dépend fortement des paramètres (angle des obliques, richesse du contexte de profondeur) et se compte en pourcentages de la longueur, non en facteurs. Explication solidement soutenue: les lignes convergentes constituent un indice de perspective linéaire, qui attribue à la barre supérieure une distance implicite plus grande. Or les deux barres sous-tendent le même angle visuel: par (6.3), celle à qui l'on attribue la plus grande distance doit être perçue plus grande. Si le contexte implique une distance fois plus grande, la taille perçue devrait être fois plus grande, soit . L'explication est ici quantitative et testable, et c'est ce qui fait sa force: on peut manipuler la profondeur implicite et prédire la direction et l'ordre de grandeur de l'effet.
La chambre d'Ames
Une chambre construite par Adelbert Ames dans les années 1940 a la forme d'un trapèze irrégulier: le coin gauche est environ deux fois plus éloigné de l'œilleton que le coin droit, mais les murs, les fenêtres et le carrelage sont peints de manière à produire, depuis ce point de vue unique, exactement l'image d'une pièce rectangulaire. Deux personnes de même taille placées dans les deux coins paraissent alors, l'une naine, l'autre géante.
Statut. Phénomène robuste et parfaitement compris: la construction géométrique est connue, l'effet est reproductible, et son explication est acquise. Le système applique une hypothèse — «cette pièce est rectangulaire, donc les deux coins sont à la même distance» — qui est fausse ici, et cette hypothèse écrase l'indice de taille familière.
L'illusion de Müller-Lyer
Deux segments de même longueur, l'un terminé par des ailettes divergentes, l'autre par des ailettes convergentes, paraissent inégaux: celui aux ailettes divergentes paraît le plus long. L'ampleur classique, pour des configurations usuelles, est de l'ordre de , mais elle dépend fortement de l'angle des ailettes.
Statut. Phénomène robuste; explication débattue, et il faut le dire. L'interprétation la plus connue, dite «de la perspective» ou de la scène charpentée (Gregory), propose que les ailettes divergentes évoquent un coin de pièce vu de l'intérieur — donc éloigné — et les ailettes convergentes une arête de bâtiment vue de l'extérieur — donc proche —, l'illusion résultant à nouveau de (6.3). Cette explication est une hypothèse parmi plusieurs, pas la vérité établie, pour au moins trois raisons: l'illusion persiste avec des terminaisons (cercles, arcs) qui n'évoquent aucune arête; sa magnitude ne suit pas toujours la profondeur implicite manipulée expérimentalement; et des explications concurrentes rendent compte d'une partie des données, notamment celles fondées sur une assimilation de l'étendue globale de la figure ou sur le filtrage passe-bas des premières étapes visuelles, qui déplace la position apparente des extrémités du segment. Les comparaisons interculturelles souvent invoquées à l'appui de l'hypothèse de la scène charpentée — l'illusion serait plus forte chez les habitants d'environnements bâtis rectilignes — reposent sur des données anciennes, hétérogènes dans leurs méthodes, et n'ont pas fait l'objet de réplications modernes préenregistrées: elles suggèrent une piste, elles ne l'établissent pas.
L'illusion de la lune
La lune paraît nettement plus grande près de l'horizon qu'au zénith, alors que son angle visuel est le même — il est même très légèrement plus petit à l'horizon, l'observateur étant plus éloigné d'un rayon terrestre. Le phénomène est connu depuis l'Antiquité et se photographie: l'image est identique, la perception ne l'est pas.
Statut. Phénomène robuste; explication toujours discutée après des siècles. L'explication la plus ancienne, dite de la distance apparente, invoque à nouveau (6.3): le terrain qui s'interpose jusqu'à l'horizon fournit une chaîne d'indices de distance absente au zénith, la lune de l'horizon se voit attribuer une distance plus grande, donc une taille perçue plus grande. Si la distance estimée est fois plus grande, la taille perçue l'est aussi, soit .
Cette explication rencontre une objection sérieuse, le paradoxe taille-distance: interrogés, beaucoup d'observateurs déclarent que la lune de l'horizon leur paraît plus proche, et non plus lointaine — l'inverse de ce que le modèle suppose. On répond parfois que le jugement verbal de distance porte sur le percept déjà constitué (un objet plus grand est jugé plus proche) et non sur la distance qui a servi à le construire, mais cette réponse rend le modèle difficile à réfuter, ce qui est un défaut. D'autres explications, incompatibles entre elles, restent en lice: rôle de l'élévation du regard, de la convergence oculaire, de la comparaison avec les objets terrestres proches de l'horizon. Aucune ne fait consensus. C'est un bon exemple d'un phénomène perceptif que tout le monde peut observer et que personne n'explique de façon décisive.
Parmi les affirmations suivantes sur les illusions géométriques, lesquelles sont correctes?
Plusieurs réponses possibles
La perception comme inférence
Vraisemblance, a priori, percept
Rassemblons ce qui précède. Le problème inverse n'a pas de solution unique; le système ajoute des contraintes tirées de régularités du monde; les illusions apparaissent quand ces contraintes sont fausses. Ce schéma a une écriture naturelle: celle des probabilités conditionnelles.
L'apport principal de cette écriture est un principe de pondération: plus une source d'information est fiable, plus elle pèse. Une vraisemblance étroite (signal net) domine l'a priori; une vraisemblance plate (signal bruité, obscurité, brouillard) laisse l'a priori décider. C'est exactement ce que l'on observe: dans le brouillard, les jugements de distance dérivent vers ce que l'on s'attend à voir.
Un a priori chiffrable: la lumière vient d'en haut
La démonstration expérimentale est facile à faire soi-même: retournez la photographie d'un cratère ou d'un relief éclairé de biais, et les creux deviennent des bosses. Cet a priori est robuste et se manipule: en fournissant un indice d'éclairage explicite (une source visible, un objet dont l'ombre trahit la direction de la lumière), on déplace la frontière entre les deux percepts. On observe aussi que l'a priori n'est pas exactement «vers le haut» mais légèrement décalé vers la gauche du haut chez la plupart des observateurs; l'existence de ce biais est bien établie, son origine ne l'est pas.
Ce que le cadre bayésien vaut, et ce qu'il ne prouve pas
Le cadre bayésien est aujourd'hui dominant comme cadre descriptif de la perception, et pour de bonnes raisons: il rend compte quantitativement de l'intégration d'indices multiples, il prédit le sens et souvent l'ampleur des biais, et il unifie des domaines aussi éloignés que la stéréopsie, la perception du mouvement et l'audition spatiale. Une réserve importante doit toutefois l'accompagner. Montrer que le comportement d'un observateur coïncide avec les prédictions d'un modèle bayésien ne démontre pas que le cerveau calcule des distributions de probabilité: c'est un argument d'adéquation au niveau computationnel, pas une preuve de mécanisme neuronal. De plus, un modèle bayésien comporte des degrés de liberté — le choix de l'a priori, celui de la fonction de coût — qui lui permettent souvent de s'ajuster après coup. Un modèle bayésien n'a de valeur explicative que si son a priori est mesuré indépendamment, par exemple sur les statistiques de scènes naturelles, et non ajusté sur les données qu'il doit expliquer.
Ascendant, descendant, et le poids du contexte
Le contexte agit de manière massive. Le même tracé ambigu se lit comme la lettre B au milieu de A, B, C et comme le chiffre 13 au milieu de 12, 13, 14. Un mot dégradé se lit sans difficulté dans une phrase et pas isolément. Un son masqué par une toux est «entendu» à sa place dans une phrase familière (restauration phonémique). Ces effets sont robustes et faciles à démontrer en classe. Le cadre bayésien leur donne une lecture directe: le contexte est un a priori, et il pèse d'autant plus que la donnée sensorielle est dégradée.
Une nuance s'impose cependant. Une littérature abondante a prétendu montrer que les motivations et les désirs modifient la perception elle-même — la fameuse new look des années 1950, et sa reprise contemporaine (une colline paraîtrait plus raide avec un sac lourd, une pièce de monnaie plus grande à un enfant pauvre). Ces résultats sont contestés: une bonne partie s'explique par des effets de demande expérimentale et par le fait que la consigne porte sur un jugement verbal, non sur le percept, et les tentatives de réplication avec des mesures moins suggestibles ont donné des résultats faibles ou nuls. Il faut distinguer ce que l'on voit de ce que l'on répond, et cette distinction est méthodologique avant d'être théorique.
Reconnaître un visage
La reconnaissance des visages est le cas où la spécialisation du traitement est la mieux établie.
- Les visages sont traités de manière holistique: on ne les décompose pas spontanément en traits indépendants. La preuve la plus nette est l'effet d'inversion: la performance de reconnaissance chute beaucoup plus pour les visages retournés que pour les autres objets retournés. Ce résultat est robuste et répliqué.
- Une région du gyrus fusiforme répond plus fortement aux visages qu'aux autres catégories. Le fait est solide; son interprétation l'est moins: on discute encore de savoir si cette région est spécifique aux visages ou spécialisée dans la discrimination fine à l'intérieur d'une catégorie d'expertise.
- La prosopagnosie — l'incapacité à reconnaître les visages, y compris familiers, avec une vision et une intelligence par ailleurs préservées — s'observe après lésion des régions occipito-temporales ventrales, et sous une forme développementale, sans lésion, chez une petite fraction de la population. Les patients reconnaissent leurs proches à la voix, à la démarche, à la coiffure. Le trouble est bien documenté; il montre qu'une fonction perceptive peut être atteinte de façon sélective, ce qui est l'argument classique en faveur d'une certaine spécialisation fonctionnelle.
Un observateur combine deux estimations indépendantes de la position d'une source: la vision, d'écart-type , et l'audition, d'écart-type . La combinaison optimale pondère chaque source par sa fiabilité . Si l'image est vue à et le son entendu à , à quelle position (en degrés) le percept unifié se situe-t-il?
L'imagerie mentale: percevoir sans stimulus
Répondez sans regarder: la poignée de la porte d'entrée de votre logement est-elle à gauche ou à droite? Combien de fenêtres compte la façade de votre immeuble? La plupart des gens disent qu'ils «revoient» la porte ou la façade, et qu'ils lisent la réponse sur cette image intérieure. Tout ce chapitre a traité la perception comme une inférence à partir d'un signal; l'imagerie pose la question inverse: que se passe-t-il quand le système perceptif travaille sans signal?
Le témoignage introspectif ne tranche pas: «je vois une image» décrit une expérience, pas le format de ce qui la produit. La psychologie cognitive a donc cherché des signatures comportementales du format, et les plus célèbres sont chronométriques.
La rotation mentale
Roger Shepard et Jacqueline Metzler (1971) présentaient des paires de dessins en perspective d'objets tridimensionnels faits de dix cubes assemblés. Dans la moitié des essais, le second objet était le même que le premier, tourné d'un angle compris entre et ; dans l'autre moitié, c'était son image en miroir, qu'aucune rotation ne peut superposer à l'original. Les participants devaient répondre aussi vite que possible «même» ou «différent». Le résultat est l'une des fonctions les plus nettes de toute la psychologie cognitive: pour les réponses «même», le temps de réponse croît linéairement avec l'écart angulaire, d'environ une seconde à jusqu'à quatre secondes et plus à . Tout se passe comme si les participants faisaient tourner une représentation de l'objet à vitesse constante, de l'ordre de par seconde, jusqu'à l'aligner sur l'autre. Détail décisif: la pente est pratiquement la même pour une rotation dans le plan de l'image et pour une rotation en profondeur, alors que dans ce second cas l'image bidimensionnelle change de forme. Ce qui tourne n'est donc pas un dessin plat, mais une représentation de l'objet en volume.
Lynn Cooper et Roger Shepard (1973) ont étendu le paradigme à des lettres et des chiffres présentés à l'endroit ou en miroir et inclinés de à : il fallait dire si le caractère était normal ou inversé. Le temps de réponse est maximal à et symétrique autour de cette valeur — une lettre inclinée de est traitée aussi vite qu'une lettre inclinée de . La représentation est donc tournée par le chemin le plus court. Avec ce matériel très familier, la fonction n'est pas strictement linéaire: elle est presque plate près de la verticale et s'accentue au-delà, ce qui suggère que de petites inclinaisons sont absorbées sans rotation.
Démonstration. Décomposons le temps de réponse en étapes successives: encoder les deux figures, faire tourner la représentation, comparer, produire la réponse. Seule la deuxième dépend de l'angle; notons la somme des trois autres. Une rotation d'amplitude à vitesse angulaire constante dure , par définition de la vitesse. Sur un cercle, deux orientations séparées de le sont aussi de dans l'autre sens; si la rotation suit le chemin le plus court, son amplitude est , d'où . Cette fonction est affine en sur , ce qui établit (i); comme prend la même valeur en et en , elle est symétrique autour de , ce qui établit (ii); la pente vaut , ce qui établit (iii).
Le théorème est une conséquence triviale de ses hypothèses, et c'est ce qui fait son intérêt: il traduit une hypothèse sur le processus (une transformation continue, qui passe par les orientations intermédiaires) en une prédiction chiffrée sur un temps de réponse. Une représentation purement descriptive n'aurait aucune raison de mettre plus de temps à «comparer» deux descriptions quand l'angle double.
Le balayage d'une image mentale
Stephen Kosslyn a montré une seconde signature, spatiale celle-là. Dans l'expérience de Kosslyn, Ball et Reiser (1978), les participants mémorisaient la carte d'une île imaginaire portant sept repères (une hutte, un arbre, un rocher, un puits, un lac, une plage, une prairie). Ils devaient ensuite, les yeux fermés, se représenter la carte, fixer mentalement un repère, puis «déplacer un point» jusqu'à un second repère et appuyer sur une touche à l'arrivée. Sur les vingt et une paires possibles, le temps de balayage croît linéairement avec la distance qui sépare les deux repères sur la carte. Dans la même veine, un détail est vérifié plus lentement sur un animal imaginé en petit (un lapin imaginé à côté d'un éléphant) que sur le même animal imaginé en grand (à côté d'une mouche). Distances et tailles semblent donc avoir, dans l'image, des conséquences métriques — exactement ce qu'exige une représentation analogique.
Le débat sur l'imagerie
Zenon Pylyshyn (1973, 1981) a opposé à ces résultats une objection de principe qui a structuré le domaine pendant trente ans. Selon lui, l'impression d'image est un épiphénomène: le format sous-jacent est propositionnel, et les fonctions chronométriques ne révèlent pas une propriété de l'architecture, mais la connaissance tacite que les participants ont du monde. Chacun sait qu'il faut plus de temps pour parcourir une plus grande distance ou pour tourner un objet plus loin; prié de «balayer» ou de «tourner» une image, le participant simule ce qu'il sait, et produit sans le vouloir la fonction attendue. Deux éléments ont donné du poids à l'objection. D'une part, Intons-Peterson (1983) a montré que les attentes communiquées par l'expérimentateur pouvaient modifier les temps de balayage: les caractéristiques de demande (chapitre 2) ne sont pas une hypothèse d'école dans ce paradigme. D'autre part, John Anderson (1978) a fait valoir un argument d'identifiabilité: pour tout modèle analogique, on peut construire un modèle propositionnel muni de processus adéquats qui produit les mêmes temps de réponse; les données comportementales seules ne peuvent donc pas départager les deux formats.
Les défenseurs de l'imagerie analogique ont répondu sur le terrain expérimental — Finke et Pinker (1982) ont obtenu des fonctions de balayage linéaires dans une tâche où les participants n'étaient pas invités à balayer et ne pouvaient guère anticiper l'hypothèse — puis, surtout, en changeant de type de données.
Ce que l'imagerie partage avec la perception
Si l'image mentale est une représentation analogique, elle doit utiliser au moins en partie la machinerie de la perception visuelle — en particulier les aires visuelles organisées de manière rétinotopique, où des points voisins du champ visuel sont représentés par des neurones voisins (chapitre 4). Trois types de données vont dans ce sens.
- Activation topographique. Kosslyn et ses collègues (1995) ont observé en imagerie cérébrale que se représenter un objet en grand ou en petit déplace l'activation dans le cortex visuel primaire comme le ferait la perception d'un objet de taille différente. Le résultat est plausible mais discuté dans sa généralité: une méta-analyse ultérieure de la même équipe a montré que l'activation des aires visuelles précoces dépend de la tâche, et qu'elle apparaît surtout quand l'image doit être examinée en détail.
- Perturbation causale. Une stimulation magnétique transcrânienne répétée appliquée au cortex occipital dégrade la performance à la fois dans une version perceptive et dans une version imagée de la même tâche (Kosslyn et coll., 1999). C'est un argument plus fort qu'une simple corrélation, puisque la région est perturbée, et non seulement observée.
- Neuropsychologie. Bisiach et Luzzatti (1978) ont demandé à des patients présentant une négligence spatiale unilatérale gauche, consécutive à une lésion pariétale droite, de décrire de mémoire la place du Dôme de Milan, qu'ils connaissaient bien. Imaginant la place depuis la cathédrale, ils omettaient les bâtiments situés à gauche de ce point de vue; invités à l'imaginer depuis le côté opposé, ils citaient ces mêmes bâtiments, désormais à droite, et omettaient les autres. La négligence portait donc sur la moitié gauche de l'image, pas sur une connaissance perdue. Le cas est classique et a été retrouvé chez d'autres patients, sans l'être chez tous les patients négligents.
Le recouvrement n'est cependant pas une identité. Des doubles dissociations existent: Behrmann, Winocur et Moscovitch (1992) ont décrit un patient incapable de reconnaître visuellement des objets courants, mais capable de les dessiner de mémoire en détail — sans reconnaître ensuite son propre dessin —, et l'on connaît le profil inverse, une imagerie perturbée avec une perception préservée. L'interprétation la plus économique est un recouvrement partiel: imagerie et perception partagent une grande partie des aires de haut niveau et, selon la tâche, certaines aires précoces, sans se confondre.
Enfin, l'imagerie varie beaucoup d'une personne à l'autre. Le terme d'aphantasie a été proposé en 2015 par Adam Zeman et ses collègues pour désigner l'absence rapportée d'imagerie visuelle volontaire, qui concernerait de l'ordre de à de la population selon le questionnaire et le seuil retenus — dans une grande enquête par questionnaire, avec un seuil large et pour une absence totale d'imagerie (Dance, Ipser et Simner, 2022). Plusieurs études rapportent que des personnes aphantasiques réussissent les tâches de rotation mentale, avec des stratégies décrites comme non visuelles; c'est un résultat récent et encore discuté, mais il rappelle la leçon du débat: la performance chronométrique et l'expérience subjective de l'image ne sont pas la même chose.
Où en est le débat? Il n'est pas clos au sens strict, mais il s'est déplacé. Peu de chercheurs soutiennent encore que toute représentation mentale est propositionnelle, ou que l'image est une photographie intérieure. La position la plus partagée est que le cerveau dispose de représentations à organisation spatiale, exploitées par l'imagerie et en partie communes avec la perception, et que la connaissance tacite et la demande expérimentale contribuent à certains effets sans les expliquer tous.
Selon l'objection de la connaissance tacite (Pylyshyn), les fonctions linéaires de rotation et de balayage reflètent ce que les participants savent du monde physique, et non le format de leurs représentations. Lequel de ces résultats est le PLUS difficile à expliquer par cette objection?
Perception, action et limites du système
Percevoir en bougeant
La perception n'est pas la contemplation d'une image: c'est une activité. Les yeux effectuent trois à quatre saccades par seconde, la tête et le corps se déplacent, et ce mouvement est une source d'information, non un bruit à corriger. La parallaxe de mouvement en est l'exemple le plus net; le flux optique — le champ des vitesses apparentes engendré par le déplacement de l'observateur — en est un autre, dont le point d'expansion indique la direction de la marche. James Gibson a fait de ce constat le cœur de son approche écologique: l'information nécessaire à l'action serait directement disponible dans le flux, sans inférence. La thèse forte de Gibson (une perception «directe», sans traitement intermédiaire) n'est pas retenue aujourd'hui; son apport durable est d'avoir montré que l'information disponible pour un observateur mobile est bien plus riche que celle d'une image fixe, ce que la formulation inférentielle intègre sans difficulté.
Agir: programmes moteurs, rétroaction et anticipation
Percevoir sert à agir, et l'action pose au système un problème de temps que la perception seule ne pose pas. Une boucle de correction visuelle — voir l'écart entre la main et la cible, calculer une correction, l'envoyer aux muscles — prend de l'ordre de à millisecondes. Or un coup droit au tennis, une frappe au clavier ou un trille au piano se jouent en quelques dizaines de millisecondes par élément: ils sont terminés avant qu'un retour sensoriel ait pu les modifier. Deux modes de contrôle coexistent donc.
Trois observations soutiennent l'existence de programmes préparés. Le temps de réaction avant un mouvement augmente avec la complexité du mouvement à exécuter, alors même que le signal de départ est identique (Henry et Rogers, 1960): la préparation prend du temps, et elle a lieu avant le premier geste. Des patients privés de toute proprioception par une neuropathie peuvent encore déclencher des mouvements appris, mais leurs mouvements lents et précis se désorganisent dès qu'ils ne voient plus leurs membres: le programme suffit à lancer le geste, la rétroaction est nécessaire pour le régler. Enfin, l'équivalence motrice: une signature tracée au stylo, à la craie au tableau ou avec le pied dans le sable conserve sa forme, bien que des muscles entièrement différents l'exécutent. Richard Schmidt (1975) en a tiré l'idée d'un programme moteur généralisé, qui fixerait l'ordre des composantes et leur minutage relatif, les muscles et l'amplitude étant choisis à chaque exécution. L'existence d'une préparation est robuste; l'invariance stricte du minutage relatif que prédit la version de Schmidt est discutée, car elle se vérifie dans certaines tâches et pas dans d'autres.
Le contrôle anticipé n'est pas pour autant un pilotage à l'aveugle. Le système moteur prédit les conséquences sensorielles de ses propres commandes, à partir d'une copie de la commande envoyée (la copie d'efférence, décrite par von Holst et Mittelstaedt en 1950). Cette prédiction explique deux faits familiers. Le monde ne «saute» pas à chaque saccade, alors que l'image rétinienne se déplace brutalement: le déplacement prédit est soustrait du déplacement reçu. Et l'on ne peut pas se chatouiller soi-même: une stimulation tactile autoproduite est perçue comme nettement moins intense que la même stimulation produite par autrui, et l'écart diminue quand on introduit, par un dispositif robotisé, un délai ou une rotation entre le geste et le contact — la prédiction cesse alors de correspondre au signal (Sarah-Jayne Blakemore et ses collègues, 1998 et 1999). L'atténuation des sensations autoproduites est un résultat robuste; son attribution précise au cervelet, plus fréquemment avancée que démontrée, est plausible mais discutée.
La loi de Fitts
Plus on vise petit et loin, plus le geste est lent: personne n'en doute. Ce qui est remarquable, c'est que ce compromis vitesse-précision obéisse à une loi quantitative simple. Paul Fitts (1954) faisait frapper alternativement, aussi vite que possible, deux bandes de largeur séparées d'une distance , en faisant varier les deux.
Démonstration (dans le modèle des corrections itératives). Supposons que le mouvement soit une suite de sous-mouvements de durée constante , chacun réduisant la distance restante à une fraction constante () de ce qu'elle était — chaque correction étant aussi imprécise, en proportion, que la précédente. Après sous-mouvements, la distance restante vaut . La cible est atteinte quand cette distance ne dépasse pas la demi-largeur:
l'inégalité changeant de sens parce que . En ajoutant un temps fixe pour la préparation et l'arrêt, , avec . La seule dépendance en et passe par , d'où l'invariance par changement d'échelle.
Cette dérivation, due à Crossman et Goodeve, explique pourquoi la loi est logarithmique: chaque correction divise l'erreur par un facteur constant, et le nombre de divisions nécessaires est un logarithme. Mais il faut en dire le statut. Le modèle est réfuté dans le détail: il prédit un temps en escalier (le nombre de corrections est entier), alors que les données sont lisses, et les enregistrements cinématiques montrent généralement un grand mouvement initial suivi d'une ou deux corrections seulement, non d'une longue série. Les modèles actuels (sous-mouvements stochastiques optimisés, contrôle optimal) retrouvent la même forme logarithmique par d'autres voies. La loi est robuste, sa dérivation la plus simple est didactique. C'est un cas exemplaire de la distinction entre un effet et son explication.
La loi elle-même compte parmi les relations quantitatives les mieux établies de la psychologie: retrouvée avec la main, le bras, le pied, la tête, la souris, le pavé tactile ou l'écran tactile, avec des ajustements linéaires qui expliquent typiquement plus de de la variance des temps moyens par condition. Deux réserves de lecture: cette qualité d'ajustement porte sur des moyennes de conditions, pas sur chaque essai d'un individu; et les constantes et dépendent du dispositif, de sorte que l'on ne compare des indices de difficulté qu'à dispositif constant. En ergonomie, on utilise souvent la variante , proposée par MacKenzie et retenue par la norme ISO 9241-9 sur l'évaluation des dispositifs de pointage; elle évite des indices négatifs pour des cibles très larges et très proches, et donne une loi de même forme.
Avec ms et ms par bit, quel est le temps de mouvement prédit, en millisecondes, pour atteindre une cible de mm de large située à mm?
Voir pour agir
La perception guidant l'action n'est pas nécessairement celle que l'on rapporte. Melvyn Goodale et David Milner ont proposé de distinguer, dans le cortex visuel, une voie ventrale (occipito-temporale) qui sert à reconnaître et à identifier — «voir quoi» — et une voie dorsale (occipito-pariétale) qui sert à guider les gestes en temps réel — «voir comment». Leur argument central est neuropsychologique: la patiente D. F., atteinte d'une agnosie visuelle des formes après une intoxication au monoxyde de carbone, ne parvenait pas à indiquer verbalement ni à reproduire de la main l'orientation d'une fente, mais y glissait une carte avec une orientation correcte du poignet (Goodale et coll., 1991). La dissociation chez D. F. est robuste, et l'existence de deux grandes voies anatomiques n'est pas contestée. La thèse plus forte selon laquelle l'action échapperait aux illusions qui trompent la perception — l'ouverture de la pince entre pouce et index ne serait pas affectée par une illusion de taille qui modifie pourtant le jugement (Aglioti, DeSouza et Goodale, 1995) — est contestée: des réanalyses ont montré qu'une fois les deux mesures rendues comparables, l'action est influencée par l'illusion à peu près autant que le jugement (Franz et coll., 2000). Les deux voies interagissent bien plus qu'une stricte séparation ne le laisse croire.
Le couplage perception-action a aussi une forme quantitative. Lorsqu'un objet de taille s'approche à vitesse constante , son angle visuel grandit, et le rapport de cet angle à sa vitesse d'expansion donne directement le temps avant contact:
La taille réelle et la distance se simplifient: un observateur peut connaître le temps qui le sépare d'une collision sans savoir ni à quelle distance est l'objet, ni à quelle vitesse il vient. Un véhicule de m de large vu à m sous-tend rad; s'il approche à m/s, l'angle croît de rad par seconde, d'où s, soit exactement . David Lee (1976) a proposé que le freinage et l'interception soient réglés sur cette variable optique; l'identité géométrique est exacte, mais que les êtres humains utilisent est : elle suppose une vitesse constante, et les jugements de temps avant contact montrent l'influence d'autres indices, notamment de la taille et de la distance connues.
L'intégration des sens
Percevoir un événement, c'est souvent le percevoir par plusieurs canaux à la fois. Le système ne juxtapose pas les modalités: il les fusionne, et la pondération suit la fiabilité, comme dans la question 6.5.
- L'effet ventriloque: quand une image et un son proviennent de positions légèrement différentes mais sont perçus comme un même événement, la position perçue du son est attirée vers l'image. Le phénomène est robuste, et la pondération par la fiabilité relative des modalités a été vérifiée en dégradant expérimentalement la vision: la capture visuelle diminue précisément comme le modèle le prédit.
- L'effet McGurk: un son /ba/ présenté avec le film d'un visage articulant /ga/ est souvent entendu comme /da/. Le phénomène existe et est facile à démontrer, mais son ampleur est bien plus variable qu'on ne le dit: la proportion de participants qui rapportent la syllabe fusionnée varie énormément selon les stimuli, la langue, l'âge et la consigne, si bien qu'un chiffre unique du type « des gens» est trompeur. Direction établie, magnitude très variable.
- L'adaptation et la recalibration: exposé à des prismes qui décalent le champ visuel, un observateur se trompe d'abord en pointant une cible, puis se recalibre en quelques dizaines d'essais, et présente un effet consécutif inverse quand on retire les prismes. Cet apprentissage sensorimoteur est robuste et rapide.
Ce que l'on ne perçoit pas
Il faut terminer par une limite, car tout ce chapitre pourrait laisser croire que la perception construit une représentation complète de la scène. Elle ne le fait pas. Le système construit ce dont il a besoin, quand il en a besoin, là où le regard se porte — et l'impression de richesse de notre expérience visuelle excède largement l'information effectivement représentée à un instant donné. Les démonstrations les plus frappantes de cet écart, la cécité au changement et la cécité inattentionnelle, comptent parmi les résultats les mieux établis de la psychologie: des modifications importantes d'une scène passent inaperçues lorsqu'elles se produisent pendant une saccade, une coupure de plan ou une brève interruption. Ce que nous voyons dépend de ce à quoi nous prêtons attention, et c'est l'objet du chapitre 7.
Synthèse
- La perception résout un problème inverse mal posé: une infinité de scènes produisent la même image rétinienne. La solution passe par l'ajout de contraintes tirées des régularités du monde — ce qui rend la perception fiable la plupart du temps et faillible dans les cas atypiques.
- L'organisation perceptive (figure-fond, proximité, similitude, bonne continuation, clôture, destin commun, région commune) est un ensemble de phénomènes robustes, dont l'explication gestaltiste d'origine par des champs corticaux a été abandonnée et dont la reformulation actuelle est probabiliste.
- La profondeur est reconstruite à partir d'indices binoculaires (disparité, dont la précision décroît en ; convergence) et monoculaires (perspective linéaire, gradient de texture, occlusion, taille relative et familière, hauteur dans le champ, perspective aérienne, parallaxe de mouvement, ombrage).
- L'angle visuel est tout ce que la rétine mesure; deux objets de même rapport y sont indiscernables. La taille perçue exige une distance estimée: , et une erreur relative sur la distance se transmet intégralement à la taille perçue.
Un livre de cm de hauteur est tenu à cm des yeux. Quel angle visuel sous-tend-il verticalement, en degrés?
Exercices
Vous pouvez afficher le corrigé directement sous chaque énoncé après avoir cherché la solution.
Un panneau de signalisation circulaire a un diamètre de cm. On prendra une distance point nodal – rétine de mm.
- Calculez son angle visuel à mètres, en degrés, puis la hauteur de son image rétinienne en millimètres.
- À quelle distance ce panneau sous-tend-il exactement , c'est-à-dire à peu près l'angle de la pleine lune?
- Un second panneau, de cm de diamètre, est placé à mètres. Les deux panneaux sont-ils distinguables sur la seule base de leur image rétinienne? Justifiez par le théorème 6.1.
- Vérifiez sur la question 1 la qualité de l'approximation et comparez à la majoration .
Un piéton de m traverse la route à mètres d'un automobiliste. On admettra que l'automobiliste dispose d'un angle visuel exact, mais que son estimation de la distance est erronée.
- Calculez l'angle visuel du piéton, en degrés, et la hauteur de son image rétinienne.
- L'automobiliste surestime la distance de . Quelle taille attribue-t-il au piéton? Le percevra-t-il comme un adulte ou comme un enfant?
- Montrez, en toute généralité, qu'une erreur relative sur la distance estimée produit exactement l'erreur relative sur la taille perçue.
- Le brouillard réduit le contraste et donc la fiabilité des indices de distance. En vous appuyant sur le cadre bayésien, dites dans quel sens l'erreur devrait aller et pourquoi. Quelle conséquence pratique en tirez-vous pour la conduite?
Solution
Voici la description d'une scène. «Depuis la terrasse d'un café de Lausanne, vous regardez vers le lac. Au premier plan, deux tables identiques: la plus proche masque partiellement le pied de la seconde. Le dallage de la terrasse, fait de carreaux carrés tous identiques, se resserre à mesure qu'il s'éloigne. Au-delà, la surface du lac, puis les Alpes de Savoie, bleutées et peu contrastées, qui occupent le haut du champ juste sous l'horizon. Un bateau traverse lentement le champ. Vous vous levez et faites deux pas de côté: les tables se déplacent nettement par rapport au rivage, les montagnes ne bougent pas.»
- Dressez la liste des indices de profondeur exploités, en citant pour chacun l'élément de la description qui le porte.
- Lesquels sont ordinaux (ils ordonnent seulement) et lesquels sont métriques (ils peuvent fournir un rapport ou une distance)?
- Quels indices survivraient à une photographie de la scène? Lesquels disparaîtraient?
- Le lendemain, un foehn exceptionnel rend l'air parfaitement transparent et les Alpes paraissent «toutes proches». Expliquez cette impression avec le vocabulaire du chapitre.
Solution
1. — Occlusion: «la plus proche masque partiellement le pied de la seconde». — Taille relative: les deux tables sont identiques, donc la différence de taille projetée est de l'information de distance. — Gradient de texture: le dallage de carreaux identiques «se resserre». — Perspective linéaire: les joints du dallage, parallèles dans le monde, convergent dans l'image (implicite dans un dallage carré régulier). — Hauteur dans le champ visuel: les montagnes «occupent le haut du champ juste sous l'horizon», donc très loin. — Perspective aérienne: elles sont «bleutées et peu contrastées». — Parallaxe de mouvement: «vous faites deux pas de côté: les tables se déplacent nettement, les montagnes ne bougent pas». — Disparité rétinienne et convergence: exploitables sur les tables du premier plan, sans effet sur le lac et les montagnes. — : une table, un bateau ont des tailles typiques connues.
Pour chacune des trois situations suivantes, nommez la règle perceptive normalement adaptative qui est mise en défaut, indiquez ce qu'elle suppose du monde, et dites si l'explication proposée est acquise, bien soutenue ou débattue.
- Dans la chambre d'Ames, deux adultes de même taille paraissent l'un géant, l'autre nain.
- Dans une figure de Ponzo, deux barres identiques posées sur des rails convergents paraissent inégales.
- La photographie d'un cratère lunaire, retournée de , montre un dôme.
Puis répondez: pourquoi l'existence de ces illusions n'est-elle pas un argument contre la fiabilité de la perception?
Solution
1. Chambre d'Ames. Règle mise en défaut: l'hypothèse de rectangularité des pièces, qui permet d'inférer que les deux coins sont à la même distance, combinée à l'invariance taille-distance (6.3). Ce que la règle suppose du monde: que les pièces habitées sont des parallélépipèdes — hypothèse à peu près toujours vraie dans un environnement bâti. Statut: acquis. La géométrie de la chambre est connue par construction, l'effet se calcule (exemple 6.2: une personne à m jugée à m paraît mesurer m au lieu de m), et il disparaît lorsqu'on donne à l'observateur une information de distance indépendante, par exemple en le laissant regarder à deux yeux ou en déplaçant la tête.
Un participant (données fictives) juge des paires de figures tridimensionnelles, identiques ou en miroir. Pour les réponses «même» correctes, ses temps moyens sont:
| Angle | |||||
|---|---|---|---|---|---|
| (s) |
Sur une tablette, deux conditions de pointage ont donné les temps moyens suivants: ms pour un indice de difficulté de bits, ms pour bits.
- Estimez les constantes et de la loi de Fitts pour ce dispositif.
- Un bouton de mm de large est situé à mm du point de départ du doigt. Calculez l'indice de difficulté et le temps prédit.
- Le concepteur hésite entre doubler la largeur du bouton et le rapprocher de moitié. Comparez les deux options et expliquez le résultat.
- Peut-on utiliser les constantes et de la question 1 pour prédire des temps avec une souris d'ordinateur? Justifiez.
- Établissez la relation et son approximation , en précisant l'ordre de grandeur de l'erreur commise. Déduisez-en la relation d'invariance taille-distance pour les petits angles.
Références
- Goldstein, E. B. et Brockmole, J. R., Sensation and Perception, 11e éd., Cengage, Boston, chapitres sur l'organisation perceptive, la perception de la profondeur et de la taille.
- Palmer, S. E., Vision Science: Photons to Phenomenology, MIT Press, Cambridge (MA), 1999 — référence sur l'organisation perceptive et sur le statut des principes gestaltistes.
- Gazzaniga, M. S., Heatherton, T. F. et Halpern, D. F., Psychological Science, Norton, New York, chapitre «Sensation and Perception».
- Eysenck, M. W. et Keane, M. T., Cognitive Psychology: A Student's Handbook, Routledge, Londres, chapitres sur la perception visuelle de base et la reconnaissance des objets.
- Schacter, D. L., Gilbert, D. T. et Wegner, D. M., Psychologie, De Boeck Supérieur, Louvain-la-Neuve, chapitre «Sensation et perception».
- Kosslyn, S. M., Thompson, W. L. et Ganis, G., The Case for Mental Imagery, Oxford University Press, New York, 2006 — la défense du format analogique; à lire avec Pylyshyn, Z. W., «Mental imagery: In search of a theory», Behavioral and Brain Sciences, 25, 2002, pour la position adverse.
- Shepard, R. N. et Metzler, J., «Mental rotation of three-dimensional objects», Science, 171, 1971; Fitts, P. M., «The information capacity of the human motor system in controlling the amplitude of movement», Journal of Experimental Psychology, 47, 1954.
- Dance, C. J., Ipser, A. et Simner, J., «The prevalence of aphantasia (imagery weakness) in the general population», Consciousness and Cognition, 97, 2022.
- Polycopiés et supports de cours de psychologie générale, Université de Genève (FPSE) et Université de Lausanne (SSP).