labvanced logoLabVanced
  • Research
    • Publications
    • Researcher Interviews
    • Use Cases
      • Developmental Psychology
      • Linguistics
      • Clinical & Digital Health
      • Educational Psychology
      • Cognitive & Neuro
      • Social & Personality
      • Arts Research
      • Sports & Movement
      • Marketing & Consumer Behavior
      • Economics
      • HCI / UX
      • Commercial / Industry Use
    • Labvanced Blog
    • Services
  • Technology
    • Feature Overview
    • Code-Free Study Building
    • Eye Tracking
    • Mouse Tracking
    • Generative AI Integration
    • Multi User Studies
    • More ...
      • Reaction Time/Precise Timing
      • Text Transcription
      • Heart Rate Detection (rPPG)
      • Emotion Detection
      • Questionnaires/Surveys
      • Experimental Control
      • Data Privacy & Security
      • Desktop App
      • Mobile App
  • Learn
    • Guide
    • Videos
    • Walkthroughs
    • FAQ
    • Release Notes
    • Documents
    • Classroom
  • Experiments
    • Cognitive Tests
    • Sample Studies
    • Public Experiment Library
  • Pricing
    • Licenses
    • Top-Up Recordings
    • Subject Recruitment
    • Study Building
    • Dedicated Support
    • Checkout
  • About
    • About Us
    • Contact
    • Downloads
    • Careers
    • Impressum
    • Disclaimer
    • Privacy & Security
    • Terms & Conditions
    • Third-Party Licenses
  • Appgo to app icon
  • Logingo to app icon
Learn
Guide
Vidéos
Guides étape par étape
FAQ
Archives des newsletters
Documents
Salle de classe
  • 中國人
  • Deutsch
  • Français
  • Español
  • English
  • 日本語
Guide
Vidéos
Guides étape par étape
FAQ
Archives des newsletters
Documents
Salle de classe
  • 中國人
  • Deutsch
  • Français
  • Español
  • English
  • 日本語
  • Guide
    • DÉBUTER

      • Éditeur de tâches
      • Cadres
        • Cadre de Canvas
        • Cadre de Page
        • Cadre de Site Web
      • Chronologie des essais
      • Présentation des stimuli
      • Exactitude de la réponse
      • Objets
      • Événements
      • Variables
      • Assistant de tâche
      • Système d'essai
      • Conception de l'expérience
        • Créer une étude
        • Modèles de Data Frame
        • Conception d'expériences multi-utilisateurs
        • Conception d'Expérience Longitudinale
    • Sujets en vedette

      • Randomisation & Équilibre
      • Suivi oculaire
        • Présentation des Stimuli dans une Tâche de Suivi Oculaire
        • Comment Choisir les Paramètres de Calibration de Suivi Oculaire
        • Configuration du suivi oculaire dans une tâche
        • Enregistrement et exportation des données de regard
        • Utiliser des formes comme zones d'intérêt (AOI) pour le suivi oculaire
        • L'expérience de calibration des participants
      • Pont Web
        • Sélectionner les AOI du site Web | Ancrer, ajuster et vérifier le suivi des AOI
        • Suivi du comportement de la souris sur un AOI de site Web | Guide Web Bridge
      • Questionnaires
      • Application de bureau
      • Études échantillons
      • Recrutement de participants
      • Accès API
        • API REST
        • API Webhook
        • API WebSocket
      • Autres sujets

        • Temps de stimuli précis
        • Études multi-utilisateurs
        • Suivi de la Tête dans Labvanced | Guide
    • ONGLETS PRINCIPAUX DE L'APPLICATION

      • Aperçu : Onglets principaux
      • Tableau de bord
      • Mes études
      • Études partagées
      • Mes fichiers
      • Bibliothèque d'expériences
      • Mon compte
      • Licence & Services
    • ONGLETS D'ÉTUDE

      • Aperçu : Onglets spécifiques à l'étude
      • Conception de l'étude
        • Tâches
        • Blocs
        • Sessions
        • Groupes
      • Éditeur de tâches
        • Contrôles de Tâches
        • Le Système des Essais
        • Types de cadres
        • Objets
        • Tables de Propriétés des Objets
        • Variables
        • Table des Variables Système
        • Le système d'événements
        • Fonctions de l'Éditeur de Texte
        • Options de suivi oculaire dans l'éditeur de tâche
        • Suivi de la tête dans une tâche
        • Études Multi-Utilisateur
      • Paramètres
      • Variables
      • Média
      • Textes & Traduire
      • Lancer & Participer
      • Gestion des sujets
      • Vue de données et Exportation
        • Vue des données et sélection des variables & des tâches (ancienne version)
        • Accéder aux Enregistrements (Version ANCIENNE)
  • Vidéos
    • Aperçu des Vidéos
    • Premiers Pas dans Labvanced
    • Création de Tâches
    • Vidéos d'Éléments
    • Événements & Variables
    • Sujets Avancés
  • Tutoriaux
    • Introduction
    • Tâche Stroop
    • Tâche de Décision Lexicale
    • Tâche de Cues Visuels de Posner
    • Paradygme de Flicker de Cécité au Changement
    • Étude d'Œil-Tracking
    • Étude d'Œil-Tracking des Nourrissons
    • Étude de Capture d'Attention avec Suivi au Souris
    • Présentation Visuelle Sérielle Rapide
    • Étude ChatGPT
    • Démo de Suivi Occulaire : SVG en tant qu'AOI
    • Démo Multi-Utilisateur : Montrer les Curseurs des Sujets
    • Contrôleur de Gamepad / Joystick - Configuration de Base
    • Étude d'App Desktop avec Intégration EEG
    • Équilibrage de Groupes entre Sujets et Configuration des Variables
    • Construction d'une Étude Multi-Utilisateur
    • Tutoriel de Suivi Occulaire dans un Cadre de Site Web
    • Suivi Occulaire Conditionnel avec Webcam
    • Construction d'une Étude de Segmentation de Texte
  • FAQ
    • Fonctionnalités
    • Politique de Support & Directives
    • Sécurité & Confidentialité des Données
    • Licences
    • Précision de Labvanced
    • Utilisation Programmatique & API
    • Utiliser Labvanced Hors Ligne
    • Dépannage
    • Questions sur la Création d'Études
  • Archive de Newsletter
  • Documents
  • Salle de Classe

Effet de Fréquence des Mots

Lisez les mots "chaise" et "urne." Tous deux sont courts, tous deux sont des noms, tous deux désignent un objet près duquel vous pourriez vous asseoir. Pourtant, votre cerveau identifie "chaise" comme un mot plus rapidement que "urne." Les psychologues appellent cet écart l'effet de fréquence des mots : plus un mot apparaît souvent dans la langue qui nous entoure, plus nous le reconnaissons rapidement et avec précision.


Table des Matières

  • Qu'est-ce que l'Effet de Fréquence des Mots
  • Comment Fonctionne l'Effet de Fréquence des Mots
    • Le Modèle Logogen
    • Le Modèle d'Activation Interactive
    • Le Compte d'Apprentissage Discriminatif
  • Comment la Fréquence des Mots est Mesurée
  • Exemples de l'Effet de Fréquence des Mots dans la Recherche
    • Marketing et Persuasion
    • Psycholinguistique et Décision Lexicale
    • Développement de la Lecture
    • Reconnaissance des Mots Bilingues et de Seconde Langue
  • Questions Fréquemment Posées

Qu'est-ce que l'Effet de Fréquence des Mots

Essayez vous-même : "table" et "treillis." Deux noms, deux syllabes, deux objets concrets. L'un d'eux sera rapidement identifié comme un véritable mot. L'autre prendra un peu plus de temps. La seule réelle différence entre eux est la fréquence à laquelle vous avez rencontré chacun, et cette différence seule suffit à changer votre temps de réaction.

Fréquence : le nombre brut d'occurrences d'un mot dans un corpus réel de texte ou de parole, le substitut mesurable de la façon dont un mot semble "commun."

Baayen et ses collègues l'appellent "un fort prédicteur dans la plupart des tâches de traitement lexical" (Heitmeier, Chuang, Axen & Baayen, 2023). Ce pouvoir prédictif est bien établi. Ce qui est moins évident, c'est pourquoi cela se produit.

Comment Fonctionne l'Effet de Fréquence des Mots

Lorsque vous rencontrez un mot, votre cerveau doit récupérer tout ce qui est stocké à son sujet : son orthographe, son son, son sens. La fréquence des mots change combien de temps cette récupération prend, les mots à haute fréquence reviennent rapidement, les mots à basse fréquence reviennent plus lentement. Trois comptes expliquent pourquoi, dans trois vocabulaires différents.

Le Modèle Logogen

La version classique est le Modèle Logogen de Morton. Chaque mot que vous connaissez a son propre logogen, une unité de reconnaissance qui se déclenche une fois qu'assez de preuves pour ce mot s'accumulent. La fréquence fixe combien de preuves sont nécessaires : le logogen d'un mot à haute fréquence a un seuil plus bas, il se déclenche donc plus tôt. Le logogen d'un mot à basse fréquence a besoin de plus de preuves, il se déclenche donc plus tard (Lim, 2016).

Le Modèle d'Activation Interactive

Le Modèle d'Activation Interactive de McClelland et Rumelhart construit cela dans un système en couches : les caractéristiques visuelles alimentent les lettres, les lettres alimentent les unités de mots entiers. Au lieu d'un seuil fixe, la fréquence fixe le niveau d'activation au repos de chaque unité de mot. L'unité d'un mot à haute fréquence commence plus près du déclenchement. L'unité d'un mot à basse fréquence commence plus loin (Lim, 2016).

Le Compte d'Apprentissage Discriminatif

Un compte plus récent et computationnel le cadre différemment encore : comme un problème de prédiction, pas une course d'activation. Un système formé sur la langue que vous avez réellement rencontrée fait une erreur de prédiction plus petite pour les mots qu'il a vus plus souvent. Mots à haute fréquence : erreur plus petite, reconnaissance plus rapide. Mots à basse fréquence : erreur plus grande, reconnaissance plus lente (Heitmeier, Chuang, Axen & Baayen, 2023).

Toutes les théories ci-dessus ont une chose en commun : l'exposition détermine la rapidité avec laquelle un mot franchit la barre mesurée par le modèle. Ce sur quoi les trois s'accordent, et ce qui est important pour la conception de l'étude, c'est que le compte de fréquence brut lui-même est un mauvais prédicteur. La valeur transformée en log- ou en rang suit le temps de réaction de beaucoup plus près (Heitmeier, Chuang, Axen & Baayen, 2023). Vous verrez exactement à quoi ressemble cette valeur transformée par rapport à un mot réel dans la section suivante.

Comment la Fréquence des Mots est Mesurée

Les prédicteurs ont besoin d'un nombre derrière eux. Alors, d'où vient réellement ce nombre ?

Un moyen principal pour les chercheurs de mesurer la fréquence des mots pendant des décennies était de compter les occurrences dans les matériaux imprimés : lecteurs, manuels scolaires, la Bible, les classiques anglais, des magazines populaires, même un ensemble de 120 livres pour enfants (Thorndike & Lorge, 1944).

Mais les gens ne parlent pas comme des livres. Alors pourquoi utiliser les livres comme principale base pour représenter la fréquence linguistique ? Marc Brysbaert et Boris New ont reconstruit le compte des mots en anglais américain depuis zéro, 51 millions de mots extraits des sous-titres de films et de télévision à la place (Brysbaert & New, 2009).

Le pari a payé. Testé contre 31,201 mots réels, leur mesure basée sur les sous-titres, SUBTLEX-US, a expliqué 62.3% de la variance dans la rapidité avec laquelle les gens les reconnaissaient. Les anciennes normes, construites à partir de la prose anglaise éditée publiée en 1961 (Francis & Kučera, 1964), n'ont réussi qu'à 57.7% (Brysbaert & New, 2009).

Une poignée d'entrées réelles de cet ensemble de données SUBTLEX-US montrent la répartition (Brysbaert & New, 2009), depuis des mots qui apparaissent une fois dans 51 millions de mots jusqu'à "le," qui apparaît dans chacun des 8,388 films et émissions du corpus :

MotFREQcountSUBTLWFSUBTLCDLg10WF
enchantements10.020.010.3010
renforcement10.020.010.3010
septuplés10.020.010.3010
référent10.020.010.3010
ponctuellement10.020.010.3010
pragmatisme110.220.111.0792
humble460.900.391.6721
exposition2074.061.632.3181
fidèle4659.124.212.6684
outil54810.754.402.7396
bouteilles68213.375.472.8344
personnalité81115.906.722.9096
charmant4,85395.1629.483.6861
chien9,835192.8436.353.9928
yeux11,299221.5556.824.0531
marié12,163238.4947.114.0851
ensemble19,553383.3976.904.2912
esprit24,715484.6181.904.3930
Merci31,789623.3185.234.5023
Dieu46,061903.1682.744.6633
Où93,3411,830.2298.474.9701
Oui101,8351,996.7697.045.0079
savoir291,7805,721.1899.435.4651
le1,501,90829,449.18100.006.1766

Nouvelles mesures de fréquence basées sur la base de données SUBTLEXUS, nom de fichier Fichier Excel Zippé 2007 avec tous les 74,286 mots du corpus

  • FREQcount : le nombre brut de fois que le mot apparaît dans l'ensemble du corpus SUBTLEX-US de 51 millions de mots.
  • SUBTLWF : fréquence des mots par million de mots (FREQcount divisé par 51), le chiffre standardisé qui rend les mots de corpus de tailles différentes comparables.
  • SUBTLCD : diversité contextuelle, le pourcentage des 8,388 films et épisodes de télévision du corpus qui contiennent le mot au moins une fois. Un mot peut être fréquent mais concentré dans quelques contextes, ou modérément fréquent mais réparti partout, c'est ce qui capture cette différence.
  • Lg10WF : la fréquence transformée en log10. C'est la valeur qui prédit réellement le temps de réaction dans les expériences de décision lexicale, pas le compte brut, c'est pourquoi les chercheurs l'utilisent au lieu de FREQcount pour modéliser.

Note

Il n'existe pas de corpus universel pour mesurer la fréquence des mots. Le choix d'un chercheur dépend de la langue, du dictionnaire ou de la liste de fréquence en question, et de l'application. SUBTLEX-US est un exemple largement utilisé dans la recherche en linguistique anglophone, et il est utilisé ici parce qu'il illustre clairement les concepts fondamentaux derrière l'effet de fréquence des mots, et non parce que c'est la seule option. D'autres corpus existent pour d'autres langues, genres et besoins de recherche.

C'est la variable, définie et mesurée. Là où elle apparaît réellement, dans les laboratoires de psycholinguistique, dans la façon dont les enfants apprennent à lire, chez les locuteurs bilingues, dans les textes marketing, c'est là que les choses deviennent intéressantes.

Exemples de l'effet de fréquence des mots dans la recherche

Marketing et persuasion

La fréquence des mots ne reste pas seulement dans le laboratoire, elle façonne la manière dont les gens réagissent au langage en général. Les mots faciles à traiter semblent tout simplement meilleurs, un phénomène que les chercheurs appellent fluidité de traitement, et la fréquence des mots est l'un de ses leviers les plus fiables (Bullock, Shulman & Huskey, 2021).

Brady Hodges, Zachary Estes et Caleb Warren l'ont testé directement sur des slogans de marques : en analysant plus de 800 exemples réels, utilisant une analyse corrélationnelle, des expériences en laboratoire, un suivi oculaire et une étude sur le terrain, ils ont constaté que les slogans construits à partir de mots courants sont plus appréciés (Hodges, Estes & Warren, 2024). Les implications sont que les slogans construits à partir de mots rares ont plus de chances d'être oubliés !

Les implications peuvent être appliquées à de réelles décisions commerciales. Une marque plus récente, ou celle qui lutte pour sa part de marché, ou qui pénètre un territoire peu familier, bénéficie en fait d'un langage plus difficile à traiter, c'est ce qui fait que les gens se souviennent du nom plus tard. Pour une marque établie, les mathématiques s'inversent : être oubliable ne leur coûte guère, les gens savent déjà qui ils sont, mais être détesté cause des dommages réels. C'est pourquoi le pari le plus sûr pour eux est le mot facile et appréciable, même s'il est moins mémorable (Hodges, Estes & Warren, 2024).

Psycholinguistique et décision lexicale

Cela semble presque trop simple pour avoir de l'importance : regardez une suite de lettres, décidez si c'est un vrai mot, appuyez sur un bouton, aussi vite que possible. Ce jugement qui semble trivial est celui où l'effet de la fréquence des mots est le plus important, plus que la longueur des mots, la densité du voisinage, ou quoi que ce soit d'autre que les psycholinguistes attribuent habituellement aux temps de réaction lents.

Heitmeier et ses collègues l'ont mesuré directement : la fréquence expliquait "de loin" la plus grande variation dans la rapidité avec laquelle les gens ont réagi (Heitmeier, Chuang, Axen & Baayen, 2023).

Dans la vidéo ci-dessus, un exemple de la Tâche de Décision Lexicale Double peut être vu. Cette tâche présente au participant deux mots et le participant doit décider si les deux mots présentés sont en anglais ou si l'un d'eux ne l'est pas.

Développement de la lecture

Sarah Gerth et Julia Festman ont utilisé le suivi oculaire dans une étude avec 66 enfants germanophones de cinquième et sixième année, âgés de 10 à 12 ans, alors qu'ils lisaient des phrases ordinaires, et non des mots isolés sur un écran, des phrases réelles, lues de la manière dont un enfant lit réellement à l'école. Le résultat : les mots à faible fréquence maintenaient leur regard pendant 62 millisecondes de plus que ceux à haute fréquence, chez les lecteurs qui apprenaient encore activement à lire couramment (Gerth & Festman, 2021).

Mais la fréquence s'est révélée n'être que la moitié de l'histoire. Certains des enfants étaient simplement des lecteurs plus rapides que d'autres, et la fréquence des mots à elle seule ne pouvait pas expliquer pourquoi.

La longueur des mots était la pièce manquante. Les enfants lecteurs plus rapides avaient déjà adopté une habitude que les plus lents n'avaient pas encore : percevoir un mot courant dans son entier d'un seul coup d'œil au lieu de le déchiffrer lettre par lettre, une petite mais réelle avancée vers la façon dont les adultes lisent.

Un design basé sur cette étude, des mots critiques à haute et basse fréquence intégrés dans des phrases ordinaires, appariés sur la longueur des mots, avec des métriques de regard par mot enregistrées automatiquement, est démontré sur la page Segmentation de texte de Labvanced, construit avec l'Objet de Segmentation de Texte.

Reconnaissance de mots en langues bilingues et langues secondes

Voici un schéma que la plupart des gens ne remarquent jamais à propos de leur propre bilinguisme : l'effet de fréquence des mots frappe plus fort dans votre langue la plus faible. Jens Schmidtke l'a mesuré, les locuteurs bilingues montrent un effet de fréquence plus important que les locuteurs monolingues (Schmidtke, 2014).

Il est tentant de lire cela comme des cerveaux bilingues traitant le langage différemment. Pour cet effet spécifique, ils n'ont pas besoin de l'être : divisez votre exposition entre deux langues et chacune d'elles obtient simplement moins de pratique que la langue d'un locuteur monolingue.

Devenez plus fluide, et l'écart se réduit. Une plus grande maîtrise était directement liée à un effet de fréquence plus faible.

Questions Fréquemment Posées

Qu'est-ce que l'effet de fréquence des mots en termes simples ?
Les mots courants, ceux que vous entendez ou lisez constamment, sont reconnus plus rapidement que les rares, même lorsque les deux mots ont la même longueur.
Pourquoi les mots courants sont-ils reconnus plus rapidement que les rares ?
Répétition. Vous avez simplement rencontré des mots courants beaucoup plus souvent, et plusieurs modèles de reconnaissance des mots décrivent comment cette exposition répétée affine et accélère la reconnaissance spécifiquement pour les mots à haute fréquence.
Comment les chercheurs mesurent-ils la fréquence des mots ?
En comptant les occurrences dans de vastes corpus de textes ou de discours. La recherche moderne sur l'anglais s'appuie sur des normes dérivées de sous-titres comme SUBTLEX-US, et analyse les temps de réaction par rapport à la valeur de fréquence transformée en logarithme ou en rang plutôt qu'au compte brut.
L'effet de fréquence des mots ne s'applique-t-il qu'à la lecture ?
Non. Il apparaît dans la reconnaissance visuelle des mots, la reconnaissance des mots parlés, et les tâches de nomination d'images, et la taille de l'effet varie selon la tâche et, pour les locuteurs bilingues, selon l'exposition qu'ils ont eue à la langue en question.

Points Clés

  • Les mots courants sont reconnus plus rapidement et plus précisément que les rares, un constat connu sous le nom d'effet de fréquence des mots.
  • Il l'emporte sur toutes les autres variables que les psycholinguistes testent, la longueur des mots, la densité de voisinage, comme prédicteur des temps de réaction.
  • Utilisez la fréquence transformée en logarithme ou en rang, pas les comptes bruts, la fréquence brute prédit à peine le comportement.
  • Les locuteurs bilingues ressentent plus l'effet que les locuteurs monolingues, car leur exposition à chaque langue est divisée.
  • Dans les slogans de marques, les mots courants gagnent en appréciation et perdent en mémorabilité.
  • La Tâche de Décision Lexicale Double de Labvanced est un paradigme prêt à l'emploi pour étudier cet effet, enregistrant les temps de réaction et les données d'exactitude au niveau des essais.
  • Pour la lecture de phrases continues au lieu de mots isolés, l'Objet de Segmentation de Texte enregistre automatiquement les métriques de regard par mot, démontré avec une étude de lecture sur la fréquence des mots modélisée sur Gerth et Festman (2021).

Plus de concepts et effets psychologiques, expliqués.

Références

  1. Brysbaert, M., & New, B. (2009). Moving beyond Kučera and Francis: A critical evaluation of current word frequency norms and the introduction of a new and improved word frequency measure for American English. Behavior Research Methods, 41(4), 977–990.
  2. Bullock, O. M., Shulman, H. C., & Huskey, R. (2021). Narratives are persuasive because they are easier to understand: Examining processing fluency as a mechanism of narrative persuasion. Frontiers in Communication, 6, 719615.
  3. Francis, W. N., & Kučera, H. (1964). A Standard Corpus of Present-Day Edited American English (the Brown Corpus). Brown University.
  4. Gerth, S., & Festman, J. (2021). Reading development, word length and frequency effects: An eye-tracking study with slow and fast readers. Frontiers in Communication, 6, 743113.
  5. Heitmeier, M., Chuang, Y.-Y., Axen, S. D., & Baayen, R. H. (2023). Frequency effects in linear discriminative learning. Frontiers in Human Neuroscience, 17, 1242720.
  6. Hodges, B. T., Estes, Z., & Warren, C. (2024). Intel inside: The linguistic properties of effective slogans. Journal of Consumer Research, 50(5), 865–886.
  7. Lim, S. W. H. (2016). The influence of orthographic neighborhood density and word frequency on visual word recognition: Insights from RT distributional analyses. Frontiers in Psychology, 7, 401.
  8. Schmidtke, J. (2014). Second language experience modulates word retrieval effort in bilinguals: Evidence from pupillometry. Frontiers in Psychology, 5, 137.
  9. Thorndike, E. L., & Lorge, I. (1944). The Teacher's Word Book of 30,000 Words. Teachers College, Columbia University.