Wortfrequenzeffekt
Lese die Wörter "Stuhl" und "Urne." Beide sind kurz, beide sind Nomen, beide benennen ein Objekt, in der Nähe dessen du sitzen könntest. Dennoch kennzeichnet dein Gehirn "Stuhl" schneller als "Urne." Psychologen nennen diese Lücke den Wortfrequenzeffekt: Je öfter ein Wort in der Sprache um uns herum vorkommt, desto schneller und genauer erkennen wir es.
Inhaltsverzeichnis
Was Ist der Wortfrequenzeffekt
Probiere es selbst: "Tisch" und "Gitter." Beide Nomen, beide zwei Silben, beide konkrete Objekte. Eines von ihnen wirst du fast sofort als echtes Wort kennzeichnen. Das andere dauert einen Moment länger. Der einzige wirkliche Unterschied zwischen ihnen ist, wie oft du jeden einzelnen getroffen hast, und dieser Unterschied allein reicht aus, um deine Reaktionszeit zu verändern.
Frequenz: die rohe Zählung der Vorkommen eines Wortes in einem realen Korpus von Text oder Sprache, das messbare Pendant dazu, wie "häufig" ein Wort vorkommt.
Baayen und Kollegen nennen es "einen starken Prädiktor in den meisten lexikalischen Verarbeitungsaufgaben" (Heitmeier, Chuang, Axen & Baayen, 2023). Diese Vorhersagekraft ist gut etabliert. Was weniger geklärt ist, ist, warum es passiert.
Wie der Wortfrequenzeffekt Funktioniert
Wenn du einem Wort begegnest, muss dein Gehirn alles abrufen, was darüber gespeichert ist: seine Schreibweise, seinen Klang, seine Bedeutung. Die Wortfrequenz verändert, wie lange diese Auffindung dauert, hochfrequente Wörter kommen schnell zurück, niederfrequente Wörter kommen langsamer zurück. Drei Modelle erklären, warum, in drei verschiedenen Vokabularen.
Das Logogen-Modell
Die klassische Version ist Mortons Logogen-Modell. Jedes Wort, das du kennst, hat seinen eigenen Logogen, eine (Erkennungs-) Einheit, die feuert, sobald genügend Beweise für dieses Wort gesammelt sind. Die Frequenz bestimmt, wie viel Beweis benötigt wird: Ein hochfrequentes Wort hat einen niedrigeren Schwellenwert, sodass es früher feuert. Ein niederfrequentes Wort benötigt mehr Beweis, sodass es später feuert (Lim, 2016).
Das Interaktive Aktivierungsmodell
McClelland und Rumelharts Interaktives Aktivierungsmodell baut dies in ein geschichtetes System auf: Visuelle Merkmale speisen sich in Buchstaben, Buchstaben speisen sich in ganze Wort-Einheiten. Statt eines festen Schwellenwerts setzt die Frequenz das Ruhe-Aktivierungsniveau jeder Wort-Einheit. Eine hochfrequente Einheit beginnt näher am Feuern. Eine niederfrequente Einheit beginnt weiter entfernt (Lim, 2016).
Das Diskriminative-Lernen-Konto
Ein neueren, rechnergestütztes Konto fasst es wieder anders zusammen: als ein Vorhersageproblem, nicht als einen Aktivierungswettlauf. Ein System, das auf der Sprache trainiert wurde, mit der du tatsächlich konfrontiert wurdest, macht einen kleineren Vorhersagefehler für Wörter, die es öfter gesehen hat. Hochfrequente Wörter: kleinerer Fehler, schnellere Erkennung. Niedrigfrequente Wörter: größerer Fehler, langsamere Erkennung (Heitmeier, Chuang, Axen & Baayen, 2023).
Alle oben genannten Theorien haben eines gemeinsam: die Exposition bestimmt, wie schnell ein Wort die Messlatte, die das Modell misst, überwindet. Worüber sich alle drei einig sind, und was für das Studiendesign von Bedeutung ist, ist, dass die rohe Frequenzzählung selbst ein schlechter Prädiktor ist. Der log- oder rang-transformierte Wert verfolgt die Reaktionszeit viel genauer (Heitmeier, Chuang, Axen & Baayen, 2023). Du wirst genau sehen, wie dieser transformierte Wert im Vergleich zu einem echten Wort im nächsten Abschnitt aussieht.
Wie Wortfrequenz Gemessen Wird
Prädiktoren benötigen eine Zahl dahinter. Wo kommt diese Zahl also tatsächlich her?
Eine der Hauptmethoden, mit denen Forscher über Jahrzehnte die Wortfrequenz gemessen haben, bestand darin, das Auftreten über gedrucktes Material zu zählen: Leser, Lehrbücher, die Bibel, die englischen Klassiker, beliebte Zeitschriften, sogar eine Sammlung von 120 Kinderbüchern (Thorndike & Lorge, 1944).
Aber Menschen sprechen nicht wie Bücher. Warum also Bücher als Hauptbasis verwenden, um die Sprachfrequenz zu repräsentieren? Marc Brysbaert und Boris New haben die Standardzählung amerikanischer Englisch-Wörter von Grund auf neu erstellt, 51 Millionen Wörter wurden stattdessen aus Film- und Fernsehsendern entnommen (Brysbaert & New, 2009).
Die Wette hat sich ausgezahlt. Getestet an 31.201 echten Wörtern erklärte ihre auf Untertiteln basierende Messung, SUBTLEX-US, 62,3 % der Varianz darin, wie schnell Menschen sie erkannten. Die alten Normen, die aus bearbeiteten englischen Prosa aus dem Jahr 1961 (Francis & Kučera, 1964) erstellt wurden, erreichten nur 57,7 % (Brysbaert & New, 2009).
Eine Handvoll realer Einträge aus diesem SUBTLEX-US-Datensatz zeigt die Streuung (Brysbaert & New, 2009), von Wörtern, die einmal in 51 Millionen Wörtern erscheinen, bis zu "der", das in jedem einzelnen der 8.388 Filme und Shows im Korpus erscheint:
| Wort | FREQcount | SUBTLWF | SUBTLCD | Lg10WF |
|---|---|---|---|---|
| Verzauberungen | 1 | 0.02 | 0.01 | 0.3010 |
| festigen | 1 | 0.02 | 0.01 | 0.3010 |
| Siebenlinge | 1 | 0.02 | 0.01 | 0.3010 |
| referent | 1 | 0.02 | 0.01 | 0.3010 |
| pünktlich | 1 | 0.02 | 0.01 | 0.3010 |
| Pragmatismus | 11 | 0.22 | 0.11 | 1.0792 |
| demütig | 46 | 0.90 | 0.39 | 1.6721 |
| Ausstellung | 207 | 4.06 | 1.63 | 2.3181 |
| treu | 465 | 9.12 | 4.21 | 2.6684 |
| Werkzeug | 548 | 10.75 | 4.40 | 2.7396 |
| Flasche | 682 | 13.37 | 5.47 | 2.8344 |
| Persönlichkeit | 811 | 15.90 | 6.72 | 2.9096 |
| schön | 4,853 | 95.16 | 29.48 | 3.6861 |
| Hund | 9,835 | 192.84 | 36.35 | 3.9928 |
| Augen | 11,299 | 221.55 | 56.82 | 4.0531 |
| verheiratet | 12,163 | 238.49 | 47.11 | 4.0851 |
| zusammen | 19,553 | 383.39 | 76.90 | 4.2912 |
| Geist | 24,715 | 484.61 | 81.90 | 4.3930 |
| Danke | 31,789 | 623.31 | 85.23 | 4.5023 |
| Gott | 46,061 | 903.16 | 82.74 | 4.6633 |
| Wo | 93,341 | 1,830.22 | 98.47 | 4.9701 |
| Ja | 101,835 | 1,996.76 | 97.04 | 5.0079 |
| wissen | 291,780 | 5,721.18 | 99.43 | 5.4651 |
| der | 1,501,908 | 29,449.18 | 100.00 | 6.1766 |
Neue Frequenzmessungen basierend auf der SUBTLEXUS-Datenbank, Dateiname Zipped Excel 2007 file with all 74,286 words in the corpus
- FREQcount: die rohe Anzahl der Male, die das Wort im gesamten 51-Millionen-Wort-SUBTLEX-US-Korpus vorkommt.
- SUBTLWF: Wortfrequenz pro Million Wörter (FREQcount dividiert durch 51), die standardisierte Zahl, die es ermöglicht, Wörter aus unterschiedlich großen Korpora vergleichbar zu machen.
- SUBTLCD: kontextuelle Vielfalt, der Prozentsatz der 8.388 Filme und TV-Episoden des Korpus, die das Wort mindestens einmal enthalten. Ein Wort kann häufig, aber in wenigen Kontexten vorkommen, oder moderat häufig, aber überall verbreitet sein; dies erfasst diesen Unterschied.
- Lg10WF: die log10-transformierte Frequenz. Dies ist der Wert, der tatsächlich die Reaktionszeit in lexikalischen Entscheidungsexperimenten vorhersagt, nicht die rohe Zählung, weshalb Forscher diesen Wert anstelle von FREQcount für Modellierungen verwenden.
Anmerkung
Es gibt kein universelles Korpus zur Messung der Wortfrequenz. Welches ein Forscher verwendet, hängt von der Sprache, dem betreffenden Wörterbuch oder der Frequenzliste sowie der Anwendung ab. SUBTLEX-US ist ein weit verbreitetes Beispiel in der Forschung zur englischsprachigen Linguistik und wird hier verwendet, weil es die Kernkonzepte des Wortfrequenzeffekts klar demonstriert, nicht weil es die einzige Option ist. Es existieren andere Korpora für andere Sprachen, Genres und Forschungsbedürfnisse.
Das ist die Variable, die definiert und gemessen wird. Wo sie tatsächlich auftaucht, in psycholinguistischen Laboren, darin, wie Kinder Lesen lernen, bei zweisprachigen Sprechern, in Marketingtexten, wird es interessant.
Beispiele für den Einfluss der Wortfrequenz in der Forschung
Marketing und Überzeugung
Die Wortfrequenz bleibt nicht nur im Labor, sie beeinflusst, wie Menschen allgemein auf Sprache reagieren. Einfach zu verarbeitende Wörter fühlen sich einfach besser an, ein Phänomen, das Forscher Verarbeitungsflüssigkeit nennen, und die Wortfrequenz ist einer ihrer zuverlässigsten Hebel (Bullock, Shulman & Huskey, 2021).
Brady Hodges, Zachary Estes und Caleb Warren testeten das direkt an Markenslogans: Sie analysierten über 800 reale Beispiele mithilfe von korrelationalen Analysen, Laborexperimenten, Eye-Tracking und einer Feldstudie und fanden heraus, dass Slogans, die aus gängigen Wörtern bestehen, mehr gemocht werden (Hodges, Estes & Warren, 2024). Die Implikation davon ist, dass Slogans, die aus seltenen Wörtern bestehen, wahrscheinlicher mehr im Gedächtnis bleiben!
Die Implikationen lassen sich auf echte Geschäftsentscheidungen anwenden. Eine neuere Marke oder eine, die um Marktanteile kämpft, oder in unbekanntes Terrain vordringt, profitiert tatsächlich von schwerer zu verarbeitender Sprache; das ist es, was die Menschen dazu bringt, sich später an den Namen zu erinnern. Für eine etablierte Marke umkehrt sich die Rechnung: Vergesslich zu sein kostet sie kaum etwas, die Menschen wissen bereits, wer sie sind, aber unbeliebt zu sein, fügt echten Schaden zu. Deshalb ist die sicherere Wette für sie das einfache, sympathische Wort, auch wenn es weniger einprägsam ist (Hodges, Estes & Warren, 2024).
Psycholinguistik und lexikalische Entscheidungsfindung
Es klingt fast zu einfach, um wichtig zu sein: Sieh dir eine Buchstabenkette an, entscheide, ob es ein echtes Wort ist, drücke einen Knopf, so schnell du kannst. Dieses trivial wirkende Urteil ist der Punkt, an dem der Effekt der Wortfrequenz am größten ist, größer als die Wortlänge, die Nachbarschaftsdichte oder alles andere, was Psycholinguisten normalerweise für langsame Reaktionszeiten verantwortlich machen.
Heitmeier und Kollegen maßen es direkt: Die Frequenz erklärte "bei weitem" die meiste Varianz in der Geschwindigkeit, mit der Menschen reagierten (Heitmeier, Chuang, Axen & Baayen, 2023).
Im obigen Video ist ein Beispiel der Dual Lexical Decision Task zu sehen. Diese Aufgabe präsentiert dem Teilnehmer zwei Wörter, und der Teilnehmer muss entscheiden, ob beide präsentierten Wörter auf Englisch sind oder ob eines nicht ist.
Lesefähigkeit
Sarah Gerth und Julia Festman nutzten Eye-Tracking in einer Studie mit 66 deutschsprachigen Kindern in der fünften und sechsten Klasse im Alter von 10 bis 12 Jahren, während sie gewöhnliche Sätze lasen, keine isolierten Wörter auf einem Bildschirm, sondern echte Sätze, so wie ein Kind tatsächlich in der Schule liest. Das Ergebnis: Wörter mit niedriger Frequenz hielten ihren Blick volle 62 Millisekunden länger als solche mit hoher Frequenz, bei Lesern, die immer noch aktiv lernen, flüssig zu lesen (Gerth & Festman, 2021).
Aber die Frequenz stellte sich nur als die halbe Wahrheit heraus. Einige der Kinder waren einfach schnellere Leser als andere, und die Wortfrequenz allein konnte nicht erklären, warum.
Die Wortlänge war das fehlende Puzzlestück. Die schnelleren Kinderleser hatten bereits eine Gewohnheit entwickelt, die die langsameren noch nicht hatten: ein gängiges Wort auf einen Blick als Ganzes zu erfassen, anstatt es Buchstabe für Buchstabe zu durchlaufen, ein kleiner, aber bedeutender Schritt hin zu der Art, wie Erwachsene lesen.
Ein auf dieser Studie basierendes Design, bei dem hoch- und niedrigfrequente kritische Wörter in gewöhnliche Sätze eingebettet sind, die in Wortlänge übereinstimmen, mit automatisch aufgezeichneten Metriken zur Blickdauer pro Wort, wird auf Labvanced’s Text Segmentation Seite demonstriert, die mit dem Text Segmentation Object erstellt wurde.
Zweisprachige und Fremdsprachenerkennung
Hier ist ein Muster, das die meisten Menschen an ihrem eigenen Bilingualismus niemals bemerken: Der Effekt der Wortfrequenz trifft in deiner schwächeren Sprache stärker zu. Jens Schmidtke maß es, zweisprachige Sprecher zeigen einen größeren Frequenzeffekt als einsprachige Sprecher (Schmidtke, 2014).
Es ist verlockend, das so zu lesen, dass zweisprachige Gehirne Sprache anders verarbeiten. Für diesen speziellen Effekt muss das nicht sein: Teilt man seine Exposition zwischen zwei Sprachen, erhält jede einfach weniger Übung als die Sprache eines einsprachigen Sprechers.
Werde flüssiger, und der Abstand schrumpft. Höhere Fähigkeiten standen in direktem Zusammenhang mit einem kleineren Frequenzeffekt.
Häufig gestellte Fragen
Was ist der Wortfrequenzeffekt in einfachen Worten?
Warum werden gängige Wörter schneller erkannt als seltene?
Wie messen Forscher die Wortfrequenz?
Gilt der Wortfrequenzeffekt nur für das Lesen?
Wichtige Erkenntnisse
- Gängige Wörter werden schneller und genauer erkannt als seltene, ein Befund, der als Wortfrequenzeffekt bekannt ist.
- Er schlägt jede andere Variable, die Psycholinguisten testen, Wortlänge, Nachbarschaftsdichte, als Prädiktor für die Reaktionszeit.
- Verwende logarithmisch oder rangtransformierte Frequenzen, keine Rohzählungen; rohe Frequenzen sagen kaum etwas über das Verhalten voraus.
- Zweisprachige Sprecher erleben den Effekt stärker als einsprachige Sprecher, weil ihre Exposition gegenüber jeder Sprache aufgeteilt ist.
- Bei Markenslogans sind gängige Wörter bei der Sympathie überlegen und bei der Einprägsamkeit unterlegen.
- Labvanced’s Dual Lexical Decision Task ist ein sofort einsatzbereiter Paradigma zur Untersuchung dieses Effekts, das Daten zur Reaktionszeit und zur Genauigkeit auf Trial-Ebene aufzeichnet.
- Bei kontinuierlichem Lesen von Sätzen statt isolierter Wörter erfasst das Text Segmentation Object automatisch Metriken zur Blickdauer pro Wort, demonstriert mit einer Wörterfrequenz-Lesestudie, die auf Gerth und Festman (2021) basiert.
Mehr psychologische Konzepte und Effekte, erklärt.
Referenzen
- Brysbaert, M., & New, B. (2009). Moving beyond Kučera and Francis: A critical evaluation of current word frequency norms and the introduction of a new and improved word frequency measure for American English. Behavior Research Methods, 41(4), 977–990.
- Bullock, O. M., Shulman, H. C., & Huskey, R. (2021). Narratives are persuasive because they are easier to understand: Examining processing fluency as a mechanism of narrative persuasion. Frontiers in Communication, 6, 719615.
- Francis, W. N., & Kučera, H. (1964). A Standard Corpus of Present-Day Edited American English (the Brown Corpus). Brown University.
- Gerth, S., & Festman, J. (2021). Reading development, word length and frequency effects: An eye-tracking study with slow and fast readers. Frontiers in Communication, 6, 743113.
- Heitmeier, M., Chuang, Y.-Y., Axen, S. D., & Baayen, R. H. (2023). Frequency effects in linear discriminative learning. Frontiers in Human Neuroscience, 17, 1242720.
- Hodges, B. T., Estes, Z., & Warren, C. (2024). Intel inside: The linguistic properties of effective slogans. Journal of Consumer Research, 50(5), 865–886.
- Lim, S. W. H. (2016). The influence of orthographic neighborhood density and word frequency on visual word recognition: Insights from RT distributional analyses. Frontiers in Psychology, 7, 401.
- Schmidtke, J. (2014). Second language experience modulates word retrieval effort in bilinguals: Evidence from pupillometry. Frontiers in Psychology, 5, 137.
- Thorndike, E. L., & Lorge, I. (1944). The Teacher's Word Book of 30,000 Words. Teachers College, Columbia University.