Cette annexe est la contrepartie pratique du chapitre 3. Celui-ci établit les outils — fidélité, validité, valeur , taille d'effet, puissance, valeur prédictive; celle-ci les met dans l'ordre où l'on s'en sert quand on a un article devant soi et vingt minutes pour décider ce qu'on en fait.
Pourquoi lire l'article plutôt que son résumé? Parce que le résumé est la partie que ses auteurs écrivent en dernier, en sachant qu'elle sera la seule lue, et qu'elle est de ce fait la plus optimiste. Il annonce des conclusions; il ne contient presque jamais l'effectif par groupe, presque jamais l'intervalle de confiance, et jamais les décisions d'analyse qui ont fait la différence entre un résultat et rien du tout — c'est-à-dire exactement les trois choses qui déterminent la confiance qu'un résultat mérite.
Il faut dire aussitôt ce que cette annexe n'enseigne pas. Elle n'enseigne pas à tout rejeter. Le scepticisme systématique est aussi paresseux que la crédulité et coûte moins cher: il permet de ne jamais avoir tort, parce qu'il ne s'engage sur rien. La compétence visée est autre, et plus difficile: calibrer sa confiance. Une affirmation bien répliquée sur de grands effectifs mérite d'être tenue pour vraie et enseignée comme telle; une affirmation issue d'une expérience unique sur trente personnes mérite d'être retenue comme une hypothèse intéressante; une affirmation contredite par des réplications préenregistrées mérite d'être abandonnée. Ce sont trois traitements différents, et savoir lequel appliquer est ce qui distingue un lecteur formé d'un lecteur qui a des opinions.
D'où la règle qui structure toute l'annexe, et à laquelle chaque section revient:
Cette troisième clause est la plus exigeante. «Je crois que cet effet est réel» n'engage à rien; «je crois que cet effet est réel, et une réplication préenregistrée de 200 participants par groupe qui trouverait un intervalle de confiance contenant zéro me ferait changer d'avis» est une position que la réalité peut corriger. Prenez l'habitude de formuler la seconde.
Anatomie d'un article
Un article empirique de psychologie suit presque toujours la structure IMRAD: introduction, méthode, résultats, discussion, précédés d'un résumé. Chaque section a une fonction déclarée et une fonction réelle, et le lecteur pressé doit connaître les deux.
L'introduction situe la question et annonce l'hypothèse. Ce qu'on y cherche vraiment tient en une phrase: quelle prédiction précise a été faite, et quand? Une introduction qui se termine par «nous avons examiné si la musique influence la créativité» n'annonce aucune prédiction; une introduction qui annonce «nous prédisons un avantage de 0,4 écart-type pour la condition A» en annonce une, et se rend réfutable. Le théorème 1.1 donne la mesure exacte de cette différence: l'information d'une prédiction vaut bits, où est la part des résultats possibles qu'elle exclut. Une hypothèse qui n'exclut rien apporte zéro bit, quel que soit le nombre d'astérisques du tableau qui la «confirme».
La méthode est la section décisive et la moins lue. On y cherche, dans cet ordre: le devis (corrélationnel, expérimental, quasi expérimental), le nombre de participants par groupe et sa justification, qui sont ces participants, comment les variables ont été opérationnalisées, et quels critères d'exclusion étaient prévus. Une méthode bien écrite permet de refaire l'étude; une méthode qui ne le permet pas est déjà un renseignement.
Les résultats rapportent ce qui a été mesuré. On y cherche des tailles d'effet avec leurs intervalles de confiance, et le nombre de tests conduits. L'écart entre les analyses annoncées dans l'introduction et celles qui apparaissent ici pour la première fois est le lieu où se logent les degrés de liberté du chercheur (chapitre 3).
La discussion interprète. C'est la section la plus agréable à lire et la moins contraignante pour ses auteurs: rien n'y est vérifié. On y cherche une seule chose — l'écart entre ce qui a été mesuré et ce qui est affirmé.
Trois annexes documentaires changent tout quand elles existent. Le préenregistrement est un dépôt horodaté et public, antérieur à la collecte, contenant les hypothèses, l'effectif visé, les critères d'exclusion et le plan d'analyse; il permet de vérifier que les analyses rapportées sont celles qui étaient prévues, et il transforme les autres en analyses exploratoires, ce qu'elles n'ont pas à cacher. Les données supplémentaires (supplementary materials) contiennent le matériel, les consignes, les analyses secondaires et souvent les mesures qui n'ont pas marché. Le dépôt de données (data repository) donne les données brutes et le code d'analyse, et permet la vérification indépendante.
Leur absence ne prouve rien de mal — beaucoup d'excellents travaux, notamment antérieurs à 2015, n'en ont aucun. Mais elle a une conséquence précise: elle vous prive du moyen de départager une analyse confirmatoire d'une analyse exploratoire, et vous oblige donc à traiter toutes les analyses comme potentiellement exploratoires. Ce n'est pas une accusation mais une conséquence logique, et il faut la tirer sans état d'âme.
L'ordre de lecture n'est pas l'ordre d'impression
L'ordre efficace est celui-ci: la question et la prédiction (fin de l'introduction), puis la méthode, puis le préenregistrement s'il existe, puis les figures et les tableaux, puis le texte des résultats, puis la discussion — et le résumé en dernier.
C'est la seule inversion vraiment contre-intuitive, et c'est la plus utile. Lu en premier, le résumé installe une conclusion dans votre tête et vous lisez ensuite la méthode en cherchant à la confirmer. Lu en dernier, il devient un test: l'écart entre ce qu'il affirme et ce que vous venez d'établir vous-même est souvent la principale information de l'article.
Remettez dans l'ordre de lecture efficace les sept étapes de la lecture d'un article empirique.
Glissez les éléments pour les mettre dans le bon ordre
- Lire le résumé en dernier et le confronter à ce que vous venez d'établir
- Lire la discussion en séparant ce qui a été mesuré de ce qui est interprété
- Examiner les figures et les tableaux: tailles d'effet, intervalles de confiance, mesures de dispersion
- Lire la fin de l'introduction: quelle question, et quelle prédiction précise a été annoncée
- Ouvrir le préenregistrement s'il existe et le comparer à la méthode publiée
- Lire le texte des résultats en vérifiant qu'il rapporte les analyses prévues et en comptant les tests
- Lire la méthode: devis, effectif par groupe, participants, opérationnalisation, exclusions prévues
Les huit questions à poser
Voici le cœur de l'annexe. Ces huit questions sont ordonnées: chacune n'a de sens que si les précédentes ont reçu une réponse acceptable. Il est inutile de discuter la taille d'effet d'une étude dont le devis n'autorise pas l'inférence annoncée.
1. Quelle est la question, et quelle prédiction précise a été faite? Le geste: trouvez la dernière phrase de l'introduction et récrivez-la sous la forme «si l'hypothèse est vraie, alors on doit observer …, et si elle est fausse, on doit observer …». Si la seconde moitié est impossible à écrire, la prédiction n'exclut rien. L'erreur évitée: prendre pour une confirmation théorique ce qui n'est que la constatation qu'il s'est passé quelque chose. Par le théorème 1.1, une prédiction qui autorise tous les résultats apporte bit d'information, et cent réplications de zéro bit font toujours zéro.
2. Le devis permet-il l'inférence annoncée? Le geste: classez l'étude en trois cases — corrélationnelle (on observe deux variables), expérimentale (on manipule et on randomise), quasi expérimentale (on exploite une variation non contrôlée par le chercheur) — puis vérifiez que le verbe de la conclusion correspond. «Est associé à» pour la première, «cause» ou «augmente» pour la deuxième seulement. L'erreur évitée: la conclusion causale sur un devis corrélationnel, qui reste la faute la plus fréquente de toute la littérature de vulgarisation. Le chapitre 2 montre pourquoi: une corrélation observée peut être entièrement produite par un confondant, sans qu'aucune flèche ne relie les deux variables.
3. Qui a été mesuré, comment, et sur qui généralise-t-on? Le geste: cherchez la première phrase de la section «participants», notez la population réelle (âge, pays, mode de recrutement), puis relisez la dernière phrase du résumé et comparez les deux populations. L'erreur évitée: la généralisation à une population non échantillonnée. Le chapitre 2 documente le profil WEIRD de la littérature: l'écrasante majorité des participants publiés vient de pays occidentaux, et souvent d'étudiants de premier cycle. La leçon n'est pas que ces résultats sont faux, c'est que la généralisation est une hypothèse empirique, qu'il faut avoir testée pour l'affirmer.
4. La mesure est-elle fidèle et valide? Le geste: trouvez comment le construit a été opérationnalisé, et demandez-vous ce que l'instrument mesurerait chez quelqu'un qui n'aurait pas le trait visé. Cherchez un indice de fidélité, et cherchez surtout si la validité de l'instrument a été établie ailleurs que dans cet article. L'erreur évitée: attribuer à une théorie le succès ou l'échec d'un questionnaire. Rappel du chapitre 3: la fidélité borne la validité, , et une mesure parfaitement fidèle peut être parfaitement invalide — auquel cas aucun effectif ne corrige quoi que ce soit, parce que l'erreur est systématique.
5. Quelle est la taille d'effet, avec son intervalle de confiance, et que représente-t-elle concrètement? Le geste: cherchez un , un ou une différence brute avec son unité, et son . Puis traduisez: par le théorème 3.1, . Un signifie qu'un individu du groupe traité dépasse un individu du groupe témoin dans des cas au lieu de , et que les deux distributions se recouvrent encore sur de leur aire. lire «significatif» comme «important». La valeur dépend conjointement de l'effet et de l'effectif; elle ne mesure aucune magnitude.
6. Quelle était la puissance, et l'effectif est-il compatible avec l'effet annoncé? Le geste: relevez par groupe et calculez de tête l'effectif qu'il aurait fallu, pour de puissance au seuil bilatéral de : pour , pour , pour . Comparez. prendre pour une prouesse ce qui est un signal d'alarme. Le mécanisme, détaillé au chapitre 3, est purement arithmétique: avec par groupe, le seuil de significativité n'est franchi que si l'effet estimé dépasse , de sorte qu'un effet réel de ne peut être publié qu'en étant multiplié par deux ou trois. La petitesse de l'échantillon ne rend pas l'effet plus grand: elle interdit à l'étude de publier autre chose qu'un grand effet.
7. L'étude était-elle préenregistrée, et les analyses rapportées sont-elles celles qui étaient prévues? Le geste: cherchez un lien de dépôt; s'il existe, ouvrez-le et comparez trois choses — la variable dépendante primaire, l'effectif annoncé, les critères d'exclusion. S'il n'existe pas, notez-le et traitez l'ensemble des analyses comme exploratoires. L'erreur évitée: lire comme une confirmation ce qui est une exploration. C'est le HARKing du chapitre 3, et il n'est presque jamais malhonnête: il consiste à raconter après coup une histoire cohérente, ce que tout cerveau humain fait spontanément.
8. Le résultat a-t-il été répliqué, par qui, et avec quel effectif? Le geste: cherchez le titre de l'étude dans un moteur de recherche académique, triez par date, et regardez si une réplication directe existe — en notant qui l'a conduite (l'équipe d'origine ou une équipe indépendante) et avec combien de participants. L'erreur évitée: traiter une étude isolée comme un fait établi. C'est la question la plus importante des huit, et c'est la seule qui ne se répond pas dans l'article: aucune étude, si bien conduite soit-elle, ne peut établir seule sa propre robustesse.
Cas construit pour la question. Un article rapporte, sur 19 participants par groupe, un effet de avec , et conclut que l'effet est «très important». Quelle lecture est la plus raisonnable?
Les signaux d'alerte
Le tableau qui suit énumère des configurations dont la présence justifie un examen plus attentif. Insistons d'emblée, et la colonne de droite le rappelle à chaque ligne: aucun de ces signaux n'est une preuve de faute. Chacun a des explications parfaitement innocentes, et un article irréprochable peut en présenter plusieurs. Ce qu'un signal indique, c'est qu'une vérification est nécessaire avant d'accorder sa confiance — pas qu'il faut soupçonner ses auteurs.
| Signal | Ce qu'il peut indiquer | Ce qu'il faut vérifier |
|---|---|---|
| Effectif très petit avec un effet spectaculaire | malédiction du vainqueur: seules les estimations gonflées franchissent le seuil | l'intervalle de confiance, et l'existence d'une réplication à grand effectif |
| Plusieurs valeurs juste sous dans le même article | une distribution de valeurs improbable si l'effet est réel et l'analyse fixée | le préenregistrement, le nombre total de tests conduits, la puissance déclarée |
| Aucune taille d'effet rapportée | rapportage dichotomique «significatif / non significatif» | si ou est calculable depuis les moyennes, les écarts-types et les effectifs donnés |
| Nombre de variables dépendantes non déclaré | choix de la variable dépendante après avoir vu les résultats | les données supplémentaires, le préenregistrement, la section «mesures» |
| Exclusions de participants décrites après les résultats | critère d'exclusion choisi en fonction de son effet sur la valeur | si le critère porte sur la variable dépendante, et si l'analyse tient sans exclusion |
Tableau B.1 — Dix signaux d'alerte, ce qu'ils peuvent indiquer et la vérification qu'ils appellent. Un signal appelle une vérification; il ne constitue jamais, à lui seul, un verdict.
Ces signaux ne sont pas indépendants: ils apparaissent en grappes, parce qu'ils découlent souvent d'une même cause — un effectif insuffisant, qui rend nécessaire une latitude analytique pour obtenir un résultat publiable. Le dernier est d'une autre nature: il ne concerne pas les auteurs mais la chaîne de communication, et c'est l'objet de la section suivante.
De l'article au titre de presse
Voici l'exercice le plus formateur de l'annexe. Il ne demande aucun calcul, et il change durablement la manière dont on lit un journal.
La leçon opérationnelle: quand vous lisez un titre, ne cherchez pas s'il est «vrai», demandez quelle information a été retirée à chaque étape. Les quatre pertes de l'exemple sont les quatre les plus fréquentes, et vous les retrouverez presque à chaque fois.
Exemple construit pour la question, qui ne renvoie à aucune publication existante. Un titre annonce: «Le stress détruit la mémoire». L'article correspondant rapporte que, dans un échantillon de 88 étudiants, un test de rappel de mots administré juste après une tâche de stress social donne en moyenne mot rappelé de moins sur 20 que dans la condition témoin. Quelles déformations le titre contient-il?
Plusieurs réponses possibles
La hiérarchie des preuves
Trois commentaires, dont deux corrigent des lectures naïves de ce genre de schéma.
Pourquoi une réplication multi-sites préenregistrée pèse plus qu'une expérience unique brillante. Non pas parce qu'elle est plus grande — la taille seule ne fait rien —, mais parce qu'elle neutralise séparément les trois mécanismes qui produisent les faux résultats. Le préenregistrement supprime les degrés de liberté du chercheur, puisque le plan d'analyse est fixé avant les données. L'effectif cumulé porte la puissance à un niveau où l'estimation n'est plus sélectionnée par le seuil, ce qui élimine la malédiction du vainqueur. Et la multiplicité des sites teste ce qu'une expérience unique ne peut pas tester: la stabilité de l'effet entre laboratoires, populations et expérimentateurs. Une expérience unique, même conduite avec un soin exemplaire, ne peut établir aucun de ces trois points sur elle-même.
Pourquoi une méta-analyse n'est pas automatiquement au sommet. C'est le contresens le plus répandu sur les hiérarchies de preuve. Une méta-analyse combine les résultats existants en les pondérant par leur précision; elle hérite donc des biais de ce qu'elle agrège. Si le biais de publication a filtré les résultats nuls, l'agrégation ne fait qu'accorder un intervalle de confiance étroit à un chiffre faux — une méta-analyse d'études biaisées est une moyenne de biais, et sa précision apparente la rend plus dangereuse, pas moins. D'où l'étage supérieur de la figure: non pas «méta-analyse», mais méta-analyse de rapports enregistrés, où la revue accepte chaque protocole avant la collecte et s'engage à publier quel que soit le résultat, ce qui supprime à la source le filtre qu'aucune correction ne rattrape après coup. Devant une méta-analyse ordinaire, on regarde le funnel plot, l'hétérogénéité, et l'estimation restreinte aux seules études préenregistrées (chapitre 3).
Ce qu'une étude de cas établit malgré son rang. L'étage le plus bas n'est pas l'étage du néant. Un cas unique peut établir de façon décisive l'existence d'une dissociation, et cet argument est logique, non statistique: si un patient échoue à mémoriser des faits nouveaux tout en apprenant une habileté motrice, alors ces deux capacités ne peuvent pas reposer sur un seul et même système, et aucune taille d'échantillon n'est requise pour le conclure (chapitre 4). Une double dissociation est plus forte encore, car elle exclut l'explication par la simple difficulté des tâches. Un cas suffit à réfuter une affirmation universelle; il ne suffit jamais à en établir une. C'est la raison pour laquelle la hiérarchie doit se lire comme un classement de ce que chaque niveau autorise à conclure, et non comme un classement de la valeur des travaux.
Où en sont les grands classiques
Le tableau qui suit rassemble, sans les réécrire, les statuts établis dans les chapitres du cours pour les résultats les plus souvent cités hors de la discipline. Chaque ligne renvoie au chapitre qui l'établit et où se trouvent l'argument et les nuances; ce tableau n'est qu'un index.
| Résultat | Ce qu'on en dit couramment | Où en est la preuve | Chapitre |
|---|---|---|---|
| Épuisement du moi | «la volonté est une ressource qui s'épuise» | contesté ou non répliqué: n'a pas survécu à une réplication multi-laboratoires préenregistrée | 3, 11 |
| Postures de pouvoir | «deux minutes de posture modifient hormones et prise de risque» | effets hormonaux et comportementaux non retrouvés à plus grand effectif (contesté); seul subsiste un effet subjectif de sentiment de puissance, plausible mais discuté | 1, 3 |
| Rétroaction faciale | «sourire rend heureux» | la version forte a échoué en réplication multi-laboratoires; il ne subsiste au mieux qu'un effet petit et conditionnel | 12 |
| Effet Mozart | «écouter Mozart rend les enfants plus intelligents» | contesté: l'effet initial était un bref effet d'éveil et d'humeur, non spécifique à Mozart | 2 |
| Test du marshmallow | «savoir attendre à quatre ans prédit la réussite» | pouvoir prédictif fortement réduit une fois le milieu socio-économique pris en compte | 3 |
| Prison de Stanford | «la situation transforme n'importe qui en bourreau» | contesté, méthode compromise (consignes explicites aux gardiens): ne peut pas servir de preuve, reste un matériel pédagogique | 2 |
| Obéissance de Milgram | «65 % des gens vont jusqu'au choc maximal» | le phénomène est plausible et convergent; la valeur de et l'interprétation en obéissance pure sont discutées (variantes, archives) | 2 |
| Impuissance apprise | «l'animal apprend qu'il est impuissant» | le phénomène comportemental est robuste, son interprétation d'origine a été révisée par ses auteurs en 2016: c'est la détection du contrôle qui est apprise | 12 |
| Menace du stéréotype | «rappeler un stéréotype fait chuter la performance» | effets faibles ou nuls dans les grandes réplications | 3 |
| État d'esprit de développement | «changer d'état d'esprit transforme la réussite scolaire» | effets moyens très faibles dans les grands essais préenregistrés, concentrés sur certains sous-groupes | 3 |
| Entraînement cérébral | «les jeux d'entraînement rendent plus intelligent» |
Tableau B.2 — Index des statuts probatoires établis par le cours. La colonne «chapitre» renvoie à l'endroit où l'argument est développé; cette annexe n'établit aucun statut par elle-même.
Ce tableau est déprimant si on le lit seul, et il ne doit pas l'être. Le cours s'appuie sur une liste au moins aussi longue de résultats robustes: effet d'espacement et effet de test, courbe d'oubli, limites de la mémoire de travail, effet de désinformation, cécité au changement, loi de Weber, détection du signal, conditionnements classique et opérant, modèle de Rescorla-Wagner, loi d'appariement, négligence des taux de base, aversion aux pertes, loi de Zipf, effets de typicalité. Que la discipline sache dire lesquels de ses classiques ne tiennent pas est le signe qu'elle fonctionne, pas qu'elle échoue.
Que faire quand on ne sait pas
Il restera beaucoup de cas où les huit questions ne suffisent pas à trancher. La conduite honnête tient en cinq points.
Distinguer «faux» de «non établi». Ce sont deux verdicts différents, appuyés sur des preuves différentes. «Non établi» signifie que les données disponibles ne permettent pas de conclure — l'effet peut exister. «Faux» exige une preuve positive de l'absence: un intervalle de confiance étroit autour de zéro, un test d'équivalence, une série de réplications bien dimensionnées et convergentes. Le chapitre 3 le formule ainsi: l'absence de preuve n'est pas la preuve de l'absence, et un résultat non significatif obtenu sur trente personnes ne prouve rigoureusement rien.
Chercher une réplication et une méta-analyse récentes. C'est le geste au meilleur rendement de toute cette annexe. Trois minutes dans un moteur de recherche académique, en triant par date, suffisent souvent à faire passer un résultat d'un statut à un autre. Regardez qui a conduit la réplication: une réplication par l'équipe d'origine n'a pas la même valeur informative qu'une réplication indépendante.
Regarder si le champ a préenregistré. Un domaine dont les études préenregistrées confirment la littérature antérieure est un domaine auquel on peut faire crédit; un domaine dont les études préenregistrées trouvent systématiquement des effets plus petits vous dit ce que valait cette littérature — et vous permet d'ajuster votre confiance sur des travaux que vous n'avez pas lus.
Accepter de suspendre son jugement. «Je ne sais pas, et voici précisément ce qui me le ferait savoir» est une réponse complète, pas une dérobade. En rédigeant un travail, écrivez «les données disponibles ne permettent pas de trancher entre A et B; une réplication préenregistrée avec environ participants par groupe le permettrait». C'est une phrase qu'aucun examinateur ne peut vous reprocher, parce qu'elle est vraie et qu'elle est vérifiable.
Exercices
Vous pouvez afficher le corrigé directement sous chaque énoncé après avoir cherché la solution.
Le résumé qui suit est entièrement construit pour cet exercice: il ne correspond à aucune étude, aucun auteur et aucune revue existants, et aucun de ses chiffres n'est extrait d'une publication.
> «Effet d'un exercice respiratoire bref sur la mémoire de travail. Quarante-quatre étudiants ont été répartis entre une condition "respiration guidée" (cinq minutes) et une condition témoin (lecture d'un texte neutre), puis ont accompli une tâche d'empan. Les participants de la condition respiration obtiennent un empan significativement supérieur (). Deux participants ont été exclus de l'analyse en raison de scores atypiques. Ces résultats montrent que quelques minutes de respiration guidée améliorent les capacités cognitives.»
- Appliquez les huit questions dans l'ordre. Pour chacune, dites ce que le résumé permet de vérifier, ce qu'il faudrait aller chercher dans l'article, et ce que son silence implique.
- Calculez la puissance de cette étude contre un effet réel de , puis contre (on prendra participants par groupe après exclusion, bilatéral, puissance avec ).
La chaîne suivante est construite pour l'exercice: le titre, la dépêche et le résultat sont inventés, et ne renvoient à aucune publication, aucun média et aucun laboratoire existants.
Le titre: «Les enfants qui dorment mal deviennent de mauvais élèves.»
La dépêche: «Selon une étude menée auprès de 1 200 écoliers, les enfants dormant moins de sept heures par nuit obtiennent de moins bons résultats scolaires. Les chercheurs recommandent d'avancer l'heure du coucher.»
L'article: «Dans une cohorte de 1 200 écoliers de 9 à 11 ans, la durée de sommeil déclarée par les parents est corrélée à la moyenne scolaire de fin d'année, (). L'association reste de même ordre après ajustement sur l'âge et le sexe, et diminue après ajustement sur le niveau socio-économique du ménage. Aucune manipulation expérimentale n'a été conduite.»
Une équipe rapporte, dans une étude construite pour cet exercice, un effet de sur participants par groupe, avec , sans préenregistrement. L'état de la littérature du domaine rend plausible, si l'effet existe, une taille réelle de l'ordre de , et vous estimez qu'environ une hypothèse sur sept explorée dans ce domaine est vraie, soit . Le seuil est bilatéral, . On rappelle , la puissance et le théorème 3.3.
Références
- Gazzaniga, M., Heatherton, T. et Halpern, D., Psychological Science, W. W. Norton, New York, chapitres sur la méthode scientifique et l'évaluation des affirmations scientifiques.
- Schacter, D. L., Gilbert, D. T. et Wegner, D. M., Psychologie, De Boeck Supérieur, Louvain-la-Neuve, chapitre «Méthodes de recherche en psychologie».
- Cohen, J., Statistical Power Analysis for the Behavioral Sciences, 2e éd., Lawrence Erlbaum, Hillsdale, 1988 (tailles d'effet, puissance, tables d'effectifs).
- Ioannidis, J. P. A., «Why most published research findings are false», PLoS Medicine, 2(8), 2005; Simmons, J. P., Nelson, L. D. et Simonsohn, U., «False-positive psychology», Psychological Science, 22(11), 2011; Kerr, N. L., «HARKing: hypothesizing after the results are known», Personality and Social Psychology Review, 2(3), 1998.
- Open Science Collaboration, «Estimating the reproducibility of psychological science», Science, 349(6251), 2015; rapports des projets Many Labs et des Registered Replication Reports.
- Chapitres 1, 2, 3, 4, 9, 11 et 12 du présent cours, où sont établis les statuts probatoires repris dans le tableau B.2; Fonds national suisse, directives sur l'Open Research Data.