単語頻度効果
「椅子」と「壺」という単語を読んでください。どちらも短く、どちらも名詞で、近くに座ることのできる物体の名前です。それでも、脳は「椅子」を「壺」よりも早く単語として認識します。心理学者はこの差を単語頻度効果と呼びます:私たちの周りの言語において単語が出現する頻度が高いほど、より早く正確にそれを認識します。
目次
単語頻度効果とは
自分で試してみてください:「テーブル」と「トレリス」。どちらも名詞で、どちらも音節が二つで、具体的な物体です。どちらか一方をほぼ瞬時に本当の単語としてタグ付けします。もう一方には一拍長くかかります。両者の唯一の真の違いは、あなたがそれぞれに出会った頻度であり、その違いだけがあなたの反応時間を変えるのです。
頻度: 単語の実際のコーパス内での出現回数の生のカウントで、単語がどれだけ「一般的」かを示す測定可能な指標です。
Baayenとその同僚は、これを「ほとんどの語彙処理タスクにおける強い予測因子」と呼びます(Heitmeier, Chuang, Axen & Baayen, 2023)。その予測力はよく確立されています。何があまり明確でないかというと、なぜそれが起こるのかです。
単語頻度効果の働き
単語に出会うと、脳はそれに関して保存されているすべての情報を取り出さなければなりません:その綴り、音、意味。単語頻度は、その取り出しにかかる時間を変化させます。高頻度の単語は早く返ってきて、低頻度の単語は遅く返ってきます。3つの説明が、3つの異なる語彙体系でそれを説明します。
ロゴジェンモデル
古典的なバージョンはMortonのロゴジェンモデルです。あなたが知っているすべての単語には自身のロゴジェンがあり、それはその単語のための十分な証拠が蓄積されたときに発火します。頻度が必要な証拠の量を決定します:高頻度の単語のロゴジェンはしきい値が低いため、早く発火します。低頻度の単語のロゴジェンはより多くの証拠を必要とするため、遅く発火します(Lim, 2016)。
インタラクティブアクティベーションモデル
McClellandとRumelhartのインタラクティブアクティベーションモデルは、これを層状システムに組み込みます:視覚的特徴が文字に、文字が単語全体のユニットに供給されます。固定のしきい値の代わりに、頻度が各単語ユニットの休止状態の活性化レベルを決定します。高頻度の単語のユニットは発火に近い状態から始まります。低頻度の単語のユニットはより遠くから始まります(Lim, 2016)。
識別学習アカウント
より新しい計算モデルは、これを再度異なる枠組みで捉えます:予測問題として、活性化のレースではありません。実際に遭遇した言語に基づいて訓練されたシステムは、より頻繁に見た単語に対してより小さな予測誤差を生じます。高頻度の単語:小さな誤差、早い認識。低頻度の単語:大きな誤差、遅い認識(Heitmeier, Chuang, Axen & Baayen, 2023)。
上記の理論はすべて共通の点を持っています:露出が単語がモデルが測定しているバーをどれだけ早くクリアするかを決定します。3つ全てが合意すること、そして研究デザインにおいて重要なのは、生の頻度カウント自体が貧弱な予測因子であるということです。ロガリズムまたはランク変換された値は反応時間をはるかに近く追跡します(Heitmeier, Chuang, Axen & Baayen, 2023)。次の節では、その変換された値が実際の単語に対してどのように見えるかを示します。
単語頻度の測定方法
予測因子には数値が必要です。それでは、その数値は実際にはどこから来るのでしょうか?
研究者が数十年にわたり単語頻度を測定する主な方法は、印刷物全体での出現回数をカウントすることでした:読者、教科書、聖書、英語の古典、人気のある雑誌、さらには120冊の児童書のセット(Thorndike & Lorge, 1944)。
しかし、人々は本のように話しません。それでは、なぜ本を言語頻度を表す主な基準として使うのでしょうか?Marc BrysbaertとBoris Newは、アメリカ英語の単語カウントをゼロから再構築しました。代わりに映画やテレビの字幕からの5100万語を使用しています(Brysbaert & New, 2009)。
その賭けは成功しました。31,201の実際の単語と比較テストを行った結果、彼らの字幕ベースの計測値、SUBTLEX-USは、単語認識の速さの62.3%の分散を説明しました。1961年に印刷された編集された英語の散文から構築された古い基準は、わずか57.7%しか説明できませんでした(Brysbaert & New, 2009)。
そのSUBTLEX-USデータセットからの実際のエントリーのいくつかは、分布を示します(Brysbaert & New, 2009)。51百万語の中で一度だけ出現する単語から、コーパス内のすべての8,388の映画や番組で出現する「the」まで:
| Word | FREQcount | SUBTLWF | SUBTLCD | Lg10WF |
|---|---|---|---|---|
| enchantments | 1 | 0.02 | 0.01 | 0.3010 |
| firming | 1 | 0.02 | 0.01 | 0.3010 |
| septuplets | 1 | 0.02 | 0.01 | 0.3010 |
| referent | 1 | 0.02 | 0.01 | 0.3010 |
| punctiliously | 1 | 0.02 | 0.01 | 0.3010 |
| pragmatism | 11 | 0.22 | 0.11 | 1.0792 |
| humbled | 46 | 0.90 | 0.39 | 1.6721 |
| exhibition | 207 | 4.06 | 1.63 | 2.3181 |
| faithful | 465 | 9.12 | 4.21 | 2.6684 |
| tool | 548 | 10.75 | 4.40 | 2.7396 |
| bottles | 682 | 13.37 | 5.47 | 2.8344 |
| personality | 811 | 15.90 | 6.72 | 2.9096 |
| lovely | 4,853 | 95.16 | 29.48 | 3.6861 |
| dog | 9,835 | 192.84 | 36.35 | 3.9928 |
| eyes | 11,299 | 221.55 | 56.82 | 4.0531 |
| married | 12,163 | 238.49 | 47.11 | 4.0851 |
| together | 19,553 | 383.39 | 76.90 | 4.2912 |
| mind | 24,715 | 484.61 | 81.90 | 4.3930 |
| Thanks | 31,789 | 623.31 | 85.23 | 4.5023 |
| God | 46,061 | 903.16 | 82.74 | 4.6633 |
| Where | 93,341 | 1,830.22 | 98.47 | 4.9701 |
| Yes | 101,835 | 1,996.76 | 97.04 | 5.0079 |
| know | 291,780 | 5,721.18 | 99.43 | 5.4651 |
| the | 1,501,908 | 29,449.18 | 100.00 | 6.1766 |
新しい頻度測定はSUBTLEXUSデータベースに基づいており、ファイル名はコーパス内のすべての74,286語を含む圧縮されたExcel 2007ファイルです。
- FREQcount: 51百万語のSUBTLEX-USコーパス全体で単語が出現する生の回数。
- SUBTLWF: 百万語あたりの単語頻度(FREQcountを51で割ったもの)、異なるサイズのコーパスからの単語を比較可能にする標準化された数値。
- SUBTLCD: 文脈の多様性、コーパス内の8,388の映画やテレビエピソードのうち、その単語が1回以上含まれるパーセンテージ。単語は頻繁でも特定の文脈に集中することができますし、適度に頻繁でも広く分布することもあります。これがその違いを捉えます。
- Lg10WF: log10変換された頻度。これは語彙判断実験において反応時間を実際に予測する値であり、生のカウントではないため、研究者はモデル化の際にFREQcountの代わりにこれを使用します。
Note
単語頻度を測定するための普遍的なコーパスは存在しません。研究者がどのコーパスを使用するかは、言語、対象となる辞書または頻度リスト、そして用途によって異なります。SUBTLEX-USは英語の言語学研究で広く使用される例であり、単語頻度効果の背後にあるコアコンセプトを明確に示しているためここで使用されていますが、それが唯一の選択肢ではありません。他の言語、ジャンル、研究ニーズに対して他のコーパスも存在します。
それが変数であり、定義され、測定されています。実際に心理言語学の研究室、子供たちの読みの学習、バイリンガル話者、マーケティングコピーでどのように現れるかが興味深い点です。
研究における単語頻度効果の例
マーケティングと説得
単語頻度は研究室に留まるだけでなく、一般的に人々が言語に反応する方法を形作ります。処理しやすい単語はただ良い感じがし、研究者はこれを 処理流暢性 と呼び、単語頻度はその最も信頼性の高い手段の一つです (Bullock, Shulman & Huskey, 2021)。
Brady Hodges、Zachary Estes、Caleb Warren は、ブランドスローガンに対してこれを直接テストしました:800を超える実例を分解し、相関分析、実験、視線追跡、現地調査を使用して、一般的な単語で構成されたスローガンはより好まれることが分かりました (Hodges, Estes & Warren, 2024)。これは、珍しい単語で作られたスローガンの方が記憶されやすいことを意味します!
その含意は、実際のビジネス決定に応用できます。新しいブランドや市場シェアを争うブランド、または未知の領域に進出しているブランドは、実際には処理しにくい言語から利益を得ます。これこそが、人々が後にその名前を記憶する理由です。確立されたブランドにとっては、状況が逆転します。忘れられることはほとんど彼らにコストをかけず、人々は既に彼らが誰であるかを知っていますが、嫌われることは実際に損害を与えます。だからこそ、彼らにとっては、記憶に残りにくくても、簡単で好ましい単語を使うことが安全な選択となるのです (Hodges, Estes & Warren, 2024)。
心理言語学と単語判断
それはあまりにもシンプルで重要に思えます:文字の列を見て、それが本当の単語かどうかを決定し、できるだけ早くボタンを押す。トリビアルに感じられるその判断が、単語頻度の効果が最も大きい場所であり、単語の長さ、近隣密度、または心理言語学者が通常反応時間の遅さの原因として責める他の何よりも大きいのです。
Heitmeier と同僚たちはそれを直接測定しました:頻度は、どれだけ早く人々が反応するかの「はるかに」多くのばらつきを説明しました (Heitmeier, Chuang, Axen & Baayen, 2023)。
上記のビデオでは、デュアル単語判断課題 の例を見ることができます。この課題は、参加者に2つの単語を提示し、両方の単語が英語であるかどうか、あるいはどちらか一方がそうでないかを決定させます。
読みの発達
Sarah Gerth と Julia Festman は、66人のドイツ語を話す5年生と6年生の子供たちを対象とし、彼らが個別の単語ではなく、実際の文を読み取る際の視線追跡を利用しました。この結果:低頻度単語は、高頻度単語よりも62ミリ秒長く視線を保持しました。これは、まだ流暢に読むことを学んでいる読者において確認されました (Gerth & Festman, 2021)。
しかし、頻度は物語の半分に過ぎないことが判明しました。ある子供たちは単に他の子供たちより速い読者であり、単語の頻度だけではその理由を説明できませんでした。
単語の長さが欠けている部分でした。より速い読者の子供たちは、まだ遅い読者が身に付けていない習慣をすでに身に付けていました:普通の単語を一目で全体的に認識するのではなく、文字ごとに処理すること。これは、大人が読む方法へ向けた小さなしかし実際のステップです。
この研究に基づいたデザインとして、一般的な文に埋め込まれた高頻度および低頻度の重要な単語が、単語の長さが一致し、単語ごとの視線メトリクスが自動的に記録されるものが、Labvanced の テキストセグメンテーション ページに示されています。これは テキストセグメンテーションオブジェクト を使用して構築されています。
バイリンガルと第二言語の単語認識
ほとんどの人が自身のバイリンガリズムについて気づかないパターンがあります:単語頻度効果は、あなたの弱い言語でより強く現れます。Jens Schmidtke はそれを測定しました。バイリンガル話者は、モノリンガル話者よりも大きな頻度効果を示します (Schmidtke, 2014)。
これは、バイリンガルの脳が言語を異なる方法で処理していると読むのは魅力的です。この特定の効果については、彼らはその必要はありません:2つの言語の露出を分割すると、各言語はモノリンガル話者の1つの言語と比較して単純に練習が少なくなります。
より流暢になると、ギャップは縮まります。高い熟達度は、より小さな頻度効果に直接結びついていました。
よくある質問
単語頻度効果とは簡単に言うと何ですか?
なぜ一般的な単語は稀な単語よりも早く認識されるのですか?
研究者はどのように単語頻度を測定するのですか?
単語頻度効果は読書にのみ適用されますか?
重要なポイント
- 一般的な単語は稀な単語よりも早く正確に認識されます。これを単語頻度効果と呼びます。
- これは心理言語学者がテストする他のすべての変数、単語の長さ、近隣密度よりも反応時間の予測因子として優れています。
- 生のカウントではなく、対数変換またはランク変換された頻度を使用します。生の頻度は行動をほとんど予測しません。
- バイリンガル話者は、単言語話者よりもこの効果を強く感じます。なぜなら、各言語への露出が分割されているからです。
- ブランドスローガンでは、一般的な単語は好感度で勝ち、記憶に残りにくくなります。
- Labvanced のデュアル単語判断課題は、この効果を研究するための即用のパラダイムであり、試行レベルの反応時間と正確性データを記録します。
- 孤立した単語の代わりに連続した文を読むために、テキストセグメンテーションオブジェクトは自動的に単語ごとの視線メトリクスを記録し、Gerth と Festman (2021) に基づいた単語頻度の読み研究でデモンストレーションされています。
さらに多くの心理学的概念と効果が説明されています。
参考文献
- Brysbaert, M., & New, B. (2009). Kučera と Francis を超えて:現在の単語頻度基準の批判的評価と、アメリカ英語の新しく改善された単語頻度測定の導入。 Behavior Research Methods, 41(4), 977–990。
- Bullock, O. M., Shulman, H. C., & Huskey, R. (2021). 物語は理解しやすいため説得力がある:物語の説得のメカニズムとしての処理流暢性を検討。 Frontiers in Communication, 6, 719615。
- Francis, W. N., & Kučera, H. (1964). 現在のアメリカ英語の標準コーパス (ブラウンコーパス)。ブラウン大学。
- Gerth, S., & Festman, J. (2021). 読みの発達、単語の長さと頻度効果:遅い読者と速い読者を対象とした視線追跡研究。 Frontiers in Communication, 6, 743113。
- Heitmeier, M., Chuang, Y.-Y., Axen, S. D., & Baayen, R. H. (2023). 線形識別学習における頻度効果。 Frontiers in Human Neuroscience, 17, 1242720。
- Hodges, B. T., Estes, Z., & Warren, C. (2024). 内部のインテル:効果的なスローガンの言語特性。 Journal of Consumer Research, 50(5), 865–886。
- Lim, S. W. H. (2016). 正字的近隣密度と単語頻度が視覚的単語認識に与える影響:RT分布分析からの洞察。 Frontiers in Psychology, 7, 401。
- Schmidtke, J. (2014). 第二言語経験がバイリンガルの単語取得努力を調整する:瞳孔計測からの証拠。 Frontiers in Psychology, 5, 137。
- Thorndike, E. L., & Lorge, I. (1944). 教師のための30,000単語の辞書。コロンビア大学教師大学。