Stroop Effekt: Einfach erklärt, mit Test

Der Stroop Effekt zeigt, wie schwer es ist, etwas zu überhören, das du ohne Mühe liest. Die Farbe der Schrift zu nennen dauert länger, wenn das Wort eine andere Farbe nennt, etwa ROT in blauer Schrift. In der ersten Studie aus dem Jahr 1935 brauchten Studenten 74,3% länger, um die Farben von 100 solchen Wörtern zu nennen als die von einfachen farbigen Quadraten[1]. Bei einem modernen Computertest ist die Verzögerung ein Bruchteil einer Sekunde pro Wort: Studenten kamen in einer Studie im Schnitt auf 78 ms[2].

Stroop-Test machen

Die Zahlen in einer Tabelle

Der Stroop Effekt in der ersten Studie und in einer modernen
Was gemessen wurdeZahl
Erste Studie: die Farben von 100 einfachen Quadraten nennen63,3 Sekunden
Die Schriftfarbe von 100 widersprüchlichen Farbwörtern nennen110,3 Sekunden
Die zusätzliche Zeit, als Anteil74,3%
Die Wörter laut lesen und die Schrift ignorieren: zusätzliche Zeit2,3 Sekunden
Moderner Computertest: zusätzliche Zeit pro widersprüchlichem Wort, im Durchschnitt78 ms
Wie stark sich die Studenten von diesem Durchschnitt unterschieden38 ms

Die erste Studie stoppte ganze Karten voller Wörter mit der Stoppuhr, die moderne Studie stoppte jede einzelne Antwort an der Tastatur. Das Muster ist dasselbe: Widersprüchliche Wörter bremsen dich stark, widersprüchliche Schriftfarbe kaum.

Stroop Effekt Erklärung: Was Stroop fand

John Ridley Stroop veröffentlichte seine Versuche im Jahr 1935. In einem lasen Studenten Farbwörter laut vor, einmal in schwarzer Schrift und einmal in einer anderen Farbe. Die farbige Schrift spielte kaum eine Rolle: 100 Wörter zu lesen dauerte nur 2,3 Sekunden länger, das sind 5,6%[1].

Im anderen nannten 100 Studenten stattdessen die Schriftfarben. Die Farben einfacher Quadrate zu nennen dauerte im Schnitt 63,3 Sekunden für eine Karte mit 100. Die Schriftfarbe von Wörtern zu nennen, die andere Farben schrieben, dauerte 110,3 Sekunden: ein Plus von 47 Sekunden, also 74,3%[1]. Das Wort kam der Farbe in die Quere, aber die Farbe dem Wort nicht.

Warum das Lesen gewinnt

Für einen geübten Erwachsenen läuft das Lesen eines kurzen Wortes von selbst ab: Du kannst ein bekanntes Wort nicht ansehen und es nicht lesen. Eine Farbe zu benennen tust du seltener und bewusster. Wenn beides gleichzeitig kommt und auf verschiedene Antworten zeigt, muss die automatische zurückgehalten werden, bevor die richtige gegeben werden kann, und das kostet Zeit. Manchmal klappt es nicht, und du sagst das Wort statt der Farbe.

Das macht den Test für die Aufmerksamkeit interessant. Die zusätzliche Zeit misst, wie viel Mühe es kostet, bei der gestellten Aufgabe zu bleiben, während etwas Vertrauteres in die andere Richtung zieht. In der Psychologie heißt diese Art von Kontrolle Hemmung oder selektive Aufmerksamkeit. Stroop Effekt Psychologie kurz gesagt: ein Test für Kontrolle über automatische Reaktionen.

Es heißt auch, dass der Effekt davon abhängt, die Wörter mühelos flüssig zu lesen. Darum zeigt unser Test die Farbwörter auf Deutsch, der Sprache der Seite, in der sie am automatischsten gelesen werden: Rot, Grün, Blau, Gelb.

Der Effekt heute

Moderne Versionen zeigen ein Wort nach dem anderen am Computer und stoppen jede Antwort, gegeben mit einer Taste für jede Farbe. In einer Studie aus dem Jahr 2018 beantworteten Studenten in einer Sitzung Hunderte von Wörtern. Ihre Antworten auf widersprüchliche Wörter waren im Schnitt 78 ms langsamer als die auf passende, und einzelne Personen streuten darum herum um etwa 38 ms[2].

Fast jeder zeigt den Effekt. Das macht den Stroop Effekt Test zu einer der verlässlichsten Vorführungen der Psychologie: Mach ihn mit irgendeiner Gruppe, und die widersprüchlichen Wörter werden langsamer sein.

Was ein Stroop-Ergebnis zeigen kann und was nicht

Dieselbe Studie stellte eine schwierigere Frage: Bleibt das Stroop-Ergebnis eines Menschen von einem Tag zum anderen gleich? Die Studenten wurden zweimal getestet, im Abstand von 3 Wochen. Die Übereinstimmung zwischen den beiden Sitzungen war 0,60 in einer Studie und 0,66 in einer zweiten, auf einer Skala, auf der 0,82 das Beste war, was eine ihrer sieben Aufgaben erreichte[2].

Die Autoren nannten das das Zuverlässigkeits-Paradox. Eine Aufgabe wird berühmt, weil sie bei fast allen wirkt, und das heißt, dass sich Menschen darin wenig unterscheiden. Wenn sich Menschen wenig unterscheiden, ist das Messrauschen groß im Vergleich zu den echten Unterschieden zwischen ihnen. Der Stroop Effekt ist also für eine Gruppe sehr verlässlich und viel weniger verlässlich, um einen Menschen gegen einen anderen zu reihen[2].

  • Ein Stroop-Ergebnis ist ein guter Weg, den Effekt an dir selbst zu sehen und zu beobachten, wie er sich mit Übung oder Müdigkeit ändert.
  • Es ist ein schlechter Weg, deine Aufmerksamkeit anhand eines kurzen Durchgangs mit der von jemand anderem zu vergleichen.
  • Es sagt nichts darüber, wie klug du bist oder wie es um deine Gesundheit steht. Es ist für Neugier und zum Nachdenken über dich selbst.

Eine Stroop-Antwort ist eine Wahl

Jede Antwort in einem Stroop-Test, auch auf ein passendes Wort, ist langsamer als eine einfache Reaktion. In einem einfachen Reaktionstest gibt es ein Signal und eine Taste. Hier musst du die Farbe sehen, aus mehreren die richtige Taste wählen und sie drücken. Wählen braucht Zeit. Darum werden die Zeiten in einem Stroop-Test in größeren Schritten gemessen als im Reaktionstest, und darum ist das Ergebnis der Unterschied zwischen zwei Arten von Wörtern und keine einzelne Zeit.

Bei Wahlen zeigt sich auch das Alter am stärksten. Eine Befragung von 7.130 Erwachsenen im Vereinigten Königreich fand, dass sich einfache Reaktionen bis etwa 50 kaum änderten, während Reaktionen mit einer Wahl über den ganzen Erwachsenenbereich langsamer wurden[3]. Eine lange Studie in Baltimore fand, dass eine Reaktion mit einer Entscheidung mit dem Alter etwa dreimal so schnell langsamer wurde wie eine einfache[4]. Ein älterer Erwachsener kann daher insgesamt langsamere Stroop-Zeiten erwarten. Das ist ein weiterer Grund, warum der Test die zwei Arten von Wörtern vergleicht, statt nur auf das Tempo zu sehen.

So misst unser Test den Effekt

Unser Stroop-Test beginnt mit 8 Übungswörtern, die nicht zählen, und stoppt dann 48 Wörter, die Hälfte davon in widersprüchlicher Farbe. Dein Ergebnis ist der Unterschied zwischen deiner mittleren Zeit für widersprüchliche Wörter und deiner mittleren Zeit für passende, zusammen damit, wie viele du richtig beantwortet hast. Es wird die mittlere Zeit genommen, weil eine einzelne langsame Antwort sie weniger verschiebt als einen Durchschnitt.

Weil der Test kurz ist, schwankt dein Ergebnis von Durchgang zu Durchgang. Mach ihn ein paar Mal und schau auf die übliche Größe deines Effekts statt auf eine einzelne Zahl.

Warum jede Stroop-Antwort eine Wahl-Reaktion ist und wie Reaktionszeiten allgemein gemessen werden, erklärt der Text wie man die Reaktionszeit misst.

Fragen

Was misst der Stroop-Test?

Wie sehr ein Wort, das du automatisch liest, dich bremst, wenn du stattdessen seine Schriftfarbe nennen musst. Die zusätzliche Zeit zeigt, wie schwer es ist, bei der Aufgabe zu bleiben und das Wort zu ignorieren.

Was ist ein normaler Stroop-Effekt?

Bei einem Computertest waren Studenten in einer Studie bei widersprüchlichen Wörtern im Schnitt 78 ms langsamer. In der ursprünglichen Kartenversion dauerte es 74,3% länger, die Schriftfarbe zu nennen, als einfache Farben.

Kann man im Stroop-Test besser werden?

Ergebnisse ändern sich von Tag zu Tag, ein besserer Durchgang ist also leicht zu bekommen und sagt wenig. In einer Studie stimmten die Ergebnisse derselben Studenten über Sitzungen im Abstand von 3 Wochen nur mäßig überein.

Warum ist der Stroop-Effekt schwer zu schlagen?

Weil das Lesen eines bekannten Wortes geschieht, ob du willst oder nicht. Auch wer den Trick kennt, liest das Wort zuerst und muss es beiseite schieben.

Quellen

  1. Stroop, J. R. (1935). Studies of interference in serial verbal reactions. Journal of Experimental Psychology, 18(6), 643–662.doi:10.1037/h0054651
    College students in the United States
    Experiment 1: "Seventy college undergraduates (14 males and 56 females)". Experiment 2: "One hundred students (88 college undergraduates, 29 males and 59 females, and 12 graduate students, all females)"; mean times, NC "63.3 seconds", NCWd "110.3 seconds". Summary: the interference of conflicting word stimuli upon naming colors caused an increase of "47.0 seconds or 74.3 percent of the normal time for naming colors printed in squares." "The interference of conflicting color stimuli upon the time for reading 100 words ... caused an increase of only 2.3 seconds or 5.6 percent over the normal time for reading the same words printed in black." (gelesen am 2026-10-06: https://psychclassics.yorku.ca/Stroop/)
  2. Hedge, C., Powell, G., & Sumner, P. (2018). The reliability paradox: Why robust cognitive tasks do not produce reliable individual differences. Behavior Research Methods, 50(3), 1166–1186.doi:10.3758/s13428-017-0935-1
    n = 47; Undergraduate students aged 18 to 21 in a university lab in the United Kingdom (50 took part, 3 did not return)
    Participants: "Participants in Study 1 were 50 (three male) undergraduate students aged 18–21 years"; Data analysis: "Data were not included if participants did not return for the follow-up session (3,2,2 for the three studies respectively)". Supplementary Table B1, Stroop task, "RT cost", Study 1, Session 1: "78 ms (38)". (gelesen am 2026-10-06: https://pmc.ncbi.nlm.nih.gov/articles/PMC5990556/)
    Abstract: "In three studies, we assessed test-retest reliability of seven classic tasks: Eriksen Flanker, Stroop, stop-signal, go/no-go, Posner cueing, Navon, and Spatial-Numerical Association of Response Code (SNARC). Reliabilities ranged from 0 to .82, being surprisingly low for most tasks given their common use." "Experimental effects become well established - and thus those tasks become popular - when between-subject variability is low." Table 1, Stroop, "RT cost": Study 1 ".60 (.31–.78)", Study 2 ".66 (.26–.83)". Participants: Study 1 "50 (three male) undergraduate students", Study 2 "62 (12 male) undergraduate students"; sessions "3 weeks apart". (gelesen am 2026-10-06: https://www.ebi.ac.uk/europepmc/webservices/rest/PMC5990556/fullTextXML)
  3. Der, G., & Deary, I. J. (2006). Age and sex differences in reaction time in adulthood: Results from the United Kingdom Health and Lifestyle Survey. Psychology and Aging, 21(1), 62–73.doi:10.1037/0882-7974.21.1.62
    n = 7.130; Adults in the United Kingdom Health and Lifestyle Survey
    Abstract: "The authors reanalyzed data for 7,130 adult participants in the United Kingdom Health and Lifestyle Survey" "The authors modeled the age differences in simple and 4-choice reaction time means and variabilities" "Simple RT shows little slowing until around 50, whereas choice RT slows throughout the adult age range." (gelesen am 2026-10-06: https://pubmed.ncbi.nlm.nih.gov/16594792/)
  4. Fozard, J. L., Vercruyssen, M., Reynolds, S. L., Hancock, P. A., & Quilter, R. E. (1994). Age differences and changes in reaction time: The Baltimore Longitudinal Study of Aging. Journal of Gerontology, 49(4), P179–P189.doi:10.1093/geronj/49.4.p179
    n = 1.265; Community volunteers in Baltimore aged 17 to 96
    Abstract: "This study analyzed auditory reaction time (RT) data from 1,265 community-dwelling volunteers (833 males and 432 females) who ranged in age from 17 to 96." "Repeated testing within participants (longitudinal analyses) over eight years showed consistent slowing and increased variability with age." "Beginning at about age 20, RTs increased at a rate of approximately 0.5 msec/yr for SRT and 1.6 msec/yr for DRT." (gelesen am 2026-10-06: https://pubmed.ncbi.nlm.nih.gov/8014399/)