El efecto Stroop
El efecto Stroop muestra lo difícil que es ignorar algo que lees sin querer. Nombrar el color de la tinta de una palabra cuesta más cuando la palabra nombra otro color, como ROJO escrito en azul. En el primer estudio, publicado en 1935, los estudiantes tardaron un 74,3% más en nombrar los colores de 100 palabras así que los de unos simples cuadrados de color[1]. En una prueba moderna por ordenador, el retraso es una fracción de segundo por palabra: los estudiantes de un estudio promediaron 78 ms[2].
Las cifras en una tabla
| Qué se midió | Dato |
|---|---|
| Estudio original: nombrar los colores de 100 cuadrados lisos | 63,3 segundos |
| Nombrar la tinta de 100 palabras de color en conflicto | 110,3 segundos |
| El tiempo extra, como proporción | 74,3% |
| Leer las palabras en voz alta, sin hacer caso de la tinta: tiempo extra | 2,3 segundos |
| Prueba moderna por ordenador: tiempo extra por palabra en conflicto, en promedio | 78 ms |
| Cuánto se diferenciaron los estudiantes de ese promedio | 38 ms |
El estudio original cronometraba con un cronómetro tarjetas enteras de palabras; el moderno cronometró cada respuesta en un teclado. El patrón es el mismo: las palabras en conflicto te frenan mucho, la tinta en conflicto casi nada.
Qué halló Stroop
John Ridley Stroop publicó sus experimentos en 1935. En uno, estudiantes universitarios leyeron en voz alta palabras de colores, una vez impresas en negro y otra vez con tinta de otro color. La tinta de color casi no importó: leer 100 palabras llevó solo 2,3 segundos más, o un 5,6%[1].
En el otro, 100 estudiantes nombraron en cambio los colores de la tinta. Nombrar los colores de cuadrados lisos llevó 63,3 segundos de promedio en una tarjeta de 100. Nombrar la tinta de palabras que escribían otros colores llevó 110,3 segundos: un aumento de 47 segundos, o un 74,3%[1]. La palabra estorbaba al color, pero el color no estorbaba a la palabra.
Por qué gana la lectura
Para un adulto con práctica, leer una palabra corta es automático: no puedes mirar una palabra conocida y no leerla. Nombrar un color es algo que haces con menos frecuencia y con más intención. Cuando las dos cosas llegan a la vez y señalan respuestas distintas, hay que frenar la automática antes de poder dar la respuesta correcta, y frenarla lleva tiempo. A veces falla, y dices la palabra en lugar del color.
Eso es lo que hace interesante la prueba para estudiar la atención. El tiempo extra mide cuánto esfuerzo cuesta mantenerte en la tarea que te dieron mientras algo más familiar tira hacia el otro lado. Los psicólogos llaman a este tipo de control inhibición, o atención selectiva.
También significa que el efecto depende de leer las palabras con fluidez, sin esfuerzo. Por eso nuestro test muestra las palabras de color en el idioma de la página, donde se leen de la forma más automática.
El efecto hoy
Las versiones modernas muestran una palabra cada vez en un ordenador y cronometran cada respuesta, que se da con una tecla para cada color. En un estudio publicado en 2018, estudiantes universitarios contestaron cientos de palabras en una sesión. Sus respuestas a palabras en conflicto fueron en promedio 78 ms más lentas que a las palabras que coincidían, y los individuos se repartían en torno a eso con unos 38 ms[2].
Casi cualquier persona muestra el efecto. Eso hace del test de Stroop una de las demostraciones más fiables de la psicología: pruébalo con cualquier grupo y las palabras en conflicto serán más lentas.
Qué puede mostrar una puntuación de Stroop y qué no
El mismo estudio planteó una pregunta más difícil: ¿la puntuación de Stroop de una persona se mantiene de un día a otro? Los estudiantes hicieron la prueba dos veces, con 3 semanas de diferencia. La coincidencia entre las dos sesiones fue de 0,60 en un estudio y de 0,66 en un segundo, en una escala donde 0,82 fue lo mejor que alcanzó cualquiera de sus siete tareas[2].
Los autores lo llamaron la paradoja de la fiabilidad. Una tarea se hace famosa porque funciona con casi todos, lo que significa que las personas se diferencian poco en ella; y cuando las personas se diferencian poco, el ruido de la medición es grande comparado con las diferencias reales entre ellas. Así, el efecto Stroop es muy seguro para un grupo, y mucho menos seguro como forma de ordenar a una persona frente a otra[2].
- Una puntuación de Stroop es una buena manera de ver el efecto en ti y de observar cómo cambia con la práctica o el cansancio.
- Es una mala manera de comparar tu atención con la de otra persona a partir de una sola prueba corta.
- No dice nada de lo listo que eres ni de tu salud; es para curiosidad y reflexión personal.
Una respuesta de Stroop es una elección
Cada respuesta en un test de Stroop, incluso a una palabra que coincide, es más lenta que una reacción simple. En un test de reacción simple hay una señal y un botón; aquí tienes que ver el color, elegir la tecla correcta entre varias y pulsarla. Elegir lleva tiempo, y por eso los tiempos de un test de Stroop se miden en pasos mayores que los de un test de reacción, y por eso la puntuación es la diferencia entre dos clases de palabra y no un solo tiempo.
Las elecciones son también donde más se nota la edad. Una encuesta a 7130 adultos del Reino Unido halló que las reacciones simples cambiaban poco hasta cerca de 50, mientras que las reacciones con elección se hacían más lentas a lo largo de toda la edad adulta[3]; un estudio largo en Baltimore halló que una reacción con una decisión se frenaba con la edad unas tres veces más rápido que una simple[4]. Un adulto mayor puede esperar, pues, tiempos de Stroop más lentos en general, y es una razón más para que el test compare las dos clases de palabra en vez de mirar solo la velocidad.
Cómo lo mide nuestro test
Nuestro test de Stroop empieza con 8 palabras de práctica que no cuentan, y luego cronometra 48 palabras, la mitad de ellas en un color en conflicto. Tu puntuación es la diferencia entre tu tiempo del medio con las palabras en conflicto y tu tiempo del medio con las que coinciden, junto con cuántas contestaste bien. Se usa el tiempo del medio (la mediana) porque una sola respuesta lenta lo mueve menos que a un promedio.
Como la prueba es corta, tu puntuación variará de una vez a otra. Hazla varias veces y mira el tamaño habitual de tu efecto en lugar de un solo número.
Por qué cada respuesta de Stroop es una reacción con elección, y cómo se miden los tiempos de reacción en general, se explica en la medición del tiempo de reacción.
Preguntas
¿Qué mide el test de Stroop?
Cuánto te frena una palabra que lees de forma automática cuando tienes que nombrar el color de su tinta. El tiempo extra refleja lo difícil que es seguir con la tarea ignorando la palabra.
¿Cuál es un efecto Stroop normal?
En una prueba por ordenador, los estudiantes de un estudio fueron en promedio 78 ms más lentos con las palabras en conflicto. En la versión original con tarjetas, nombrar la tinta llevó un 74,3% más que nombrar colores lisos.
¿Se puede mejorar en el test de Stroop?
Las puntuaciones cambian de un día a otro, así que es fácil sacar una prueba mejor y difícil leer mucho en ella. En un estudio, las puntuaciones de los mismos estudiantes coincidieron solo de forma moderada entre sesiones con 3 semanas de diferencia.
¿Por qué es tan difícil vencer al efecto Stroop?
Porque leer una palabra conocida ocurre quieras o no. Incluso quien conoce el truco lee primero la palabra y tiene que dejarla a un lado.
Fuentes
- Stroop, J. R. (1935). Studies of interference in serial verbal reactions. Journal of Experimental Psychology, 18(6), 643–662.doi:10.1037/h0054651
College students in the United StatesExperiment 1: "Seventy college undergraduates (14 males and 56 females)". Experiment 2: "One hundred students (88 college undergraduates, 29 males and 59 females, and 12 graduate students, all females)"; mean times, NC "63.3 seconds", NCWd "110.3 seconds". Summary: the interference of conflicting word stimuli upon naming colors caused an increase of "47.0 seconds or 74.3 percent of the normal time for naming colors printed in squares." "The interference of conflicting color stimuli upon the time for reading 100 words ... caused an increase of only 2.3 seconds or 5.6 percent over the normal time for reading the same words printed in black."
(leído el 2026-10-06: https://psychclassics.yorku.ca/Stroop/) - Hedge, C., Powell, G., & Sumner, P. (2018). The reliability paradox: Why robust cognitive tasks do not produce reliable individual differences. Behavior Research Methods, 50(3), 1166–1186.doi:10.3758/s13428-017-0935-1
n = 47; Undergraduate students aged 18 to 21 in a university lab in the United Kingdom (50 took part, 3 did not return)Participants: "Participants in Study 1 were 50 (three male) undergraduate students aged 18–21 years"; Data analysis: "Data were not included if participants did not return for the follow-up session (3,2,2 for the three studies respectively)". Supplementary Table B1, Stroop task, "RT cost", Study 1, Session 1: "78 ms (38)".
(leído el 2026-10-06: https://pmc.ncbi.nlm.nih.gov/articles/PMC5990556/)Abstract: "In three studies, we assessed test-retest reliability of seven classic tasks: Eriksen Flanker, Stroop, stop-signal, go/no-go, Posner cueing, Navon, and Spatial-Numerical Association of Response Code (SNARC). Reliabilities ranged from 0 to .82, being surprisingly low for most tasks given their common use." "Experimental effects become well established - and thus those tasks become popular - when between-subject variability is low." Table 1, Stroop, "RT cost": Study 1 ".60 (.31–.78)", Study 2 ".66 (.26–.83)". Participants: Study 1 "50 (three male) undergraduate students", Study 2 "62 (12 male) undergraduate students"; sessions "3 weeks apart".
(leído el 2026-10-06: https://www.ebi.ac.uk/europepmc/webservices/rest/PMC5990556/fullTextXML) - Der, G., & Deary, I. J. (2006). Age and sex differences in reaction time in adulthood: Results from the United Kingdom Health and Lifestyle Survey. Psychology and Aging, 21(1), 62–73.doi:10.1037/0882-7974.21.1.62
n = 7130; Adults in the United Kingdom Health and Lifestyle SurveyAbstract: "The authors reanalyzed data for 7,130 adult participants in the United Kingdom Health and Lifestyle Survey" "The authors modeled the age differences in simple and 4-choice reaction time means and variabilities" "Simple RT shows little slowing until around 50, whereas choice RT slows throughout the adult age range."
(leído el 2026-10-06: https://pubmed.ncbi.nlm.nih.gov/16594792/) - Fozard, J. L., Vercruyssen, M., Reynolds, S. L., Hancock, P. A., & Quilter, R. E. (1994). Age differences and changes in reaction time: The Baltimore Longitudinal Study of Aging. Journal of Gerontology, 49(4), P179–P189.doi:10.1093/geronj/49.4.p179
n = 1265; Community volunteers in Baltimore aged 17 to 96Abstract: "This study analyzed auditory reaction time (RT) data from 1,265 community-dwelling volunteers (833 males and 432 females) who ranged in age from 17 to 96." "Repeated testing within participants (longitudinal analyses) over eight years showed consistent slowing and increased variability with age." "Beginning at about age 20, RTs increased at a rate of approximately 0.5 msec/yr for SRT and 1.6 msec/yr for DRT."
(leído el 2026-10-06: https://pubmed.ncbi.nlm.nih.gov/8014399/)