Effet Stroop : pourquoi lire gêne la couleur ?
L’effet Stroop montre combien il est difficile d’ignorer ce qu’on lit sans le vouloir. Nommer la couleur d’encre d’un mot est plus lent quand le mot désigne une autre couleur, par exemple ROUGE écrit en bleu. Dans la première étude, publiée en 1935, des étudiants ont mis 74,3 % de temps en plus pour nommer les couleurs de 100 mots de ce genre que pour celles de simples carrés colorés[1]. Sur un test moderne à l’ordinateur, le retard est une fraction de seconde par mot : des étudiants d’une étude avaient en moyenne 78 ms[2].
Les chiffres en un tableau
| Ce qui a été mesuré | Chiffre |
|---|---|
| Étude d’origine : nommer les couleurs de 100 simples carrés | 63,3 secondes |
| Nommer la couleur d’encre de 100 mots de couleur contradictoires | 110,3 secondes |
| Le temps en plus, en proportion | 74,3 % |
| Lire les mots à voix haute sans tenir compte de l’encre : temps en plus | 2,3 secondes |
| Test moderne à l’ordinateur : temps en plus par mot contradictoire, en moyenne | 78 ms |
| Écart des étudiants par rapport à cette moyenne | 38 ms |
L’étude d’origine chronométrait des cartes entières de mots avec un chronomètre ; l’étude moderne a chronométré chaque réponse au clavier. Le schéma est le même : des mots contradictoires vous ralentissent beaucoup, une encre contradictoire presque pas.
Ce qu’a trouvé Stroop
John Ridley Stroop a publié ses expériences en 1935. Dans l’une, des étudiants lisaient à voix haute des noms de couleurs, une fois écrits en noir et une fois dans une encre d’une autre couleur. L’encre colorée comptait à peine : lire 100 mots ne prenait que 2,3 secondes de plus, soit 5,6 %[1].
Dans l’autre, 100 étudiants nommaient au contraire les couleurs d’encre. Nommer les couleurs de simples carrés prenait en moyenne 63,3 secondes pour une carte de 100. Nommer l’encre de mots qui écrivaient d’autres couleurs prenait 110,3 secondes : 47 secondes de plus, soit 74,3 %[1]. Le mot gênait la couleur, mais la couleur ne gênait pas le mot.
Pourquoi la lecture l’emporte
Pour un adulte entraîné, lire un mot court est automatique : impossible de regarder un mot familier sans le lire. Nommer une couleur, on le fait moins souvent et plus volontairement. Quand les deux arrivent en même temps et mènent à des réponses différentes, il faut retenir la réponse automatique avant de donner la bonne, et cela prend du temps. De temps en temps, ça échoue, et on dit le mot au lieu de la couleur.
C’est ce qui rend ce test intéressant pour l’attention. Le temps en plus mesure l’effort qu’il faut pour rester sur la tâche demandée pendant que quelque chose de plus familier tire dans l’autre sens. Les psychologues appellent ce genre de contrôle l’inhibition, ou l’attention sélective.
Cela veut dire aussi que l’effet dépend d’une lecture aisée, sans effort. C’est pourquoi notre test montre les noms de couleurs dans la langue de la page, celle où on les lit le plus automatiquement.
L’effet aujourd’hui
Les versions modernes montrent un mot à la fois sur un ordinateur et chronomètrent chaque réponse, donnée avec une touche par couleur. Dans une étude publiée en 2018, des étudiants de premier cycle répondaient à des centaines de mots en une séance. Leurs réponses aux mots contradictoires étaient en moyenne plus lentes de 78 ms que celles aux mots assortis, et les individus s’écartaient de cette moyenne d’environ 38 ms[2].
Presque tout le monde montre l’effet. Cela fait du test de Stroop l’une des démonstrations les plus fiables de la psychologie : essayez-le sur n’importe quel groupe, les mots contradictoires seront plus lents.
Ce qu’un score de Stroop peut montrer, et ce qu’il ne peut pas
La même étude posait une question plus difficile : le score de Stroop d’une personne reste-t-il le même d’un jour à l’autre ? Les étudiants ont été testés deux fois, à 3 semaines d’intervalle. L’accord entre les deux séances était de 0,60 dans une étude et de 0,66 dans une seconde, sur une échelle où 0,82 était le meilleur niveau atteint par l’une de leurs sept tâches[2].
Les auteurs ont appelé cela le paradoxe de la fiabilité. Une tâche devient célèbre parce qu’elle marche pour presque tout le monde, ce qui veut dire que les gens diffèrent peu ; et quand les gens diffèrent peu, le bruit de mesure est grand par rapport aux vraies différences entre eux. L’effet Stroop est donc très fiable pour un groupe, et beaucoup moins pour classer une personne par rapport à une autre[2].
- Un score de Stroop est un bon moyen de voir l’effet chez vous, et de le regarder changer avec l’entraînement ou la fatigue.
- C’est un mauvais moyen de comparer votre attention à celle de quelqu’un d’autre à partir d’un seul court essai.
- Il ne dit rien de votre intelligence ni de votre santé ; il est fait pour la curiosité et la réflexion sur soi.
Une réponse de Stroop est un choix
Chaque réponse d’un test de Stroop, même à un mot assorti, est plus lente qu’une réaction simple. Dans un test de réaction simple, il y a un signal et un bouton ; ici, il faut voir la couleur, choisir la bonne touche parmi plusieurs et appuyer. Choisir prend du temps : c’est pourquoi les temps d’un test de Stroop se mesurent par pas plus grands que ceux d’un test de réaction, et pourquoi le score est la différence entre deux sortes de mots plutôt qu’un temps unique.
C’est aussi dans les choix que l’âge se voit le plus. Une enquête auprès de 7 130 adultes au Royaume-Uni a trouvé que les réactions simples changeaient peu jusqu’à environ 50, alors que les réactions avec un choix ralentissaient sur toute la vie adulte[3] ; une longue étude à Baltimore a trouvé qu’une réaction avec décision ralentissait environ trois fois plus vite avec l’âge qu’une réaction simple[4]. Une personne plus âgée peut donc s’attendre à des temps de Stroop plus lents dans l’ensemble, ce qui est une raison de plus pour que le test compare les deux sortes de mots au lieu de regarder la seule vitesse.
Comment notre test le mesure
Notre test de Stroop commence par 8 mots d’entraînement qui ne comptent pas, puis chronomètre 48 mots, dont la moitié dans une couleur contradictoire. Votre score est la différence entre votre temps du milieu pour les mots contradictoires et votre temps du milieu pour les mots assortis, avec le nombre de bonnes réponses. On utilise le temps du milieu parce qu’une seule réponse lente le déplace moins qu’une moyenne.
Comme le test est court, votre score bougera d’un essai à l’autre. Passez-le plusieurs fois et regardez la taille habituelle de votre effet plutôt qu’un chiffre isolé.
Pourquoi chaque réponse de Stroop est une réaction avec choix, et comment on mesure les temps de réaction en général, est expliqué dans comment on mesure le temps de réaction.
Questions
Que mesure le test de Stroop ?
À quel point un mot que vous lisez automatiquement vous ralentit quand vous devez nommer sa couleur d’encre. Le temps en plus reflète la difficulté de rester sur la tâche en ignorant le mot.
Quel est un effet Stroop normal ?
Sur un test à l’ordinateur, des étudiants d’une étude étaient en moyenne plus lents de 78 ms sur les mots contradictoires. Dans la version d’origine avec cartes, nommer l’encre prenait 74,3 % de temps en plus que nommer de simples couleurs.
Peut-on s’améliorer au test de Stroop ?
Les scores changent d’un jour à l’autre : un meilleur essai est facile à obtenir et difficile à interpréter. Dans une étude, les scores des mêmes étudiants ne s’accordaient que moyennement d’une séance à l’autre, à 3 semaines d’intervalle.
Pourquoi l’effet Stroop est-il difficile à vaincre ?
Parce que lire un mot familier se fait qu’on le veuille ou non. Même ceux qui connaissent le truc lisent d’abord le mot et doivent le mettre de côté.
Sources
- Stroop, J. R. (1935). Studies of interference in serial verbal reactions. Journal of Experimental Psychology, 18(6), 643–662.doi:10.1037/h0054651
College students in the United StatesExperiment 1: "Seventy college undergraduates (14 males and 56 females)". Experiment 2: "One hundred students (88 college undergraduates, 29 males and 59 females, and 12 graduate students, all females)"; mean times, NC "63.3 seconds", NCWd "110.3 seconds". Summary: the interference of conflicting word stimuli upon naming colors caused an increase of "47.0 seconds or 74.3 percent of the normal time for naming colors printed in squares." "The interference of conflicting color stimuli upon the time for reading 100 words ... caused an increase of only 2.3 seconds or 5.6 percent over the normal time for reading the same words printed in black."
(lu le 2026-10-06: https://psychclassics.yorku.ca/Stroop/) - Hedge, C., Powell, G., & Sumner, P. (2018). The reliability paradox: Why robust cognitive tasks do not produce reliable individual differences. Behavior Research Methods, 50(3), 1166–1186.doi:10.3758/s13428-017-0935-1
n = 47; Undergraduate students aged 18 to 21 in a university lab in the United Kingdom (50 took part, 3 did not return)Participants: "Participants in Study 1 were 50 (three male) undergraduate students aged 18–21 years"; Data analysis: "Data were not included if participants did not return for the follow-up session (3,2,2 for the three studies respectively)". Supplementary Table B1, Stroop task, "RT cost", Study 1, Session 1: "78 ms (38)".
(lu le 2026-10-06: https://pmc.ncbi.nlm.nih.gov/articles/PMC5990556/)Abstract: "In three studies, we assessed test-retest reliability of seven classic tasks: Eriksen Flanker, Stroop, stop-signal, go/no-go, Posner cueing, Navon, and Spatial-Numerical Association of Response Code (SNARC). Reliabilities ranged from 0 to .82, being surprisingly low for most tasks given their common use." "Experimental effects become well established - and thus those tasks become popular - when between-subject variability is low." Table 1, Stroop, "RT cost": Study 1 ".60 (.31–.78)", Study 2 ".66 (.26–.83)". Participants: Study 1 "50 (three male) undergraduate students", Study 2 "62 (12 male) undergraduate students"; sessions "3 weeks apart".
(lu le 2026-10-06: https://www.ebi.ac.uk/europepmc/webservices/rest/PMC5990556/fullTextXML) - Der, G., & Deary, I. J. (2006). Age and sex differences in reaction time in adulthood: Results from the United Kingdom Health and Lifestyle Survey. Psychology and Aging, 21(1), 62–73.doi:10.1037/0882-7974.21.1.62
n = 7 130; Adults in the United Kingdom Health and Lifestyle SurveyAbstract: "The authors reanalyzed data for 7,130 adult participants in the United Kingdom Health and Lifestyle Survey" "The authors modeled the age differences in simple and 4-choice reaction time means and variabilities" "Simple RT shows little slowing until around 50, whereas choice RT slows throughout the adult age range."
(lu le 2026-10-06: https://pubmed.ncbi.nlm.nih.gov/16594792/) - Fozard, J. L., Vercruyssen, M., Reynolds, S. L., Hancock, P. A., & Quilter, R. E. (1994). Age differences and changes in reaction time: The Baltimore Longitudinal Study of Aging. Journal of Gerontology, 49(4), P179–P189.doi:10.1093/geronj/49.4.p179
n = 1 265; Community volunteers in Baltimore aged 17 to 96Abstract: "This study analyzed auditory reaction time (RT) data from 1,265 community-dwelling volunteers (833 males and 432 females) who ranged in age from 17 to 96." "Repeated testing within participants (longitudinal analyses) over eight years showed consistent slowing and increased variability with age." "Beginning at about age 20, RTs increased at a rate of approximately 0.5 msec/yr for SRT and 1.6 msec/yr for DRT."
(lu le 2026-10-06: https://pubmed.ncbi.nlm.nih.gov/8014399/)