Efecto de Frecuencia de Palabras
Lee las palabras "silla" y "urna." Ambas son cortas, ambas son sustantivos, ambas nombran un objeto cerca del cual podrías sentarte. Sin embargo, tu cerebro marca "silla" como una palabra más rápido que "urna." Los psicólogos llaman a esta brecha el efecto de frecuencia de palabras: cuanto más a menudo aparece una palabra en el idioma que nos rodea, más rápido y con mayor precisión la reconocemos.
Tabla de Contenidos
¿Qué es el Efecto de Frecuencia de Palabras?
Prueba tú mismo: "mesa" y "enrejado." Ambos son sustantivos, ambos tienen dos sílabas, ambos son objetos concretos. Uno de ellos lo etiquetarás como una palabra real casi al instante. El otro tarda un poco más. La única diferencia real entre ellos es cuántas veces te has encontrado con cada uno, y esa diferencia es suficiente para cambiar tu tiempo de reacción.
Frecuencia: el conteo bruto de ocurrencias de una palabra en un corpus real de texto o habla, el equivalente medible de cuán "común" se siente una palabra.
Baayen y sus colegas lo llaman "un fuerte predictor en la mayoría de las tareas de procesamiento léxico" (Heitmeier, Chuang, Axen & Baayen, 2023). Ese poder predictivo está bien establecido. Lo que menos se ha resuelto es por qué ocurre.
¿Cómo Funciona el Efecto de Frecuencia de Palabras?
Cuando encuentras una palabra, tu cerebro tiene que recuperar todo lo almacenado sobre ella: su ortografía, su sonido, su significado. La frecuencia de la palabra cambia cuánto tiempo toma esa recuperación; las palabras de alta frecuencia regresan rápido, las palabras de baja frecuencia regresan más lento. Tres explicaciones explican por qué, en tres vocabularios diferentes.
El Modelo Logogen
La versión clásica es el Modelo Logogen de Morton. Cada palabra que conoces tiene su propio logogen, una unidad de reconocimiento que se activa una vez que se acumula suficiente evidencia para esa palabra. La frecuencia establece cuánta evidencia se necesita: el logogen de una palabra de alta frecuencia tiene un umbral más bajo, así que se activa antes. El logogen de una palabra de baja frecuencia necesita más evidencia, así que se activará más tarde (Lim, 2016).
El Modelo de Activación Interactiva
El Modelo de Activación Interactiva de McClelland y Rumelhart construye esto en un sistema en capas: las características visuales se alimentan a letras, y las letras se alimentan a unidades de palabras completas. En lugar de un umbral fijo, la frecuencia establece el nivel de activación en reposo de cada unidad de palabra. La unidad de una palabra de alta frecuencia comienza más cerca de activarse. La unidad de una palabra de baja frecuencia comienza más lejos (Lim, 2016).
La Cuenta de Aprendizaje Discriminativo
Una cuenta más reciente y computacional lo enmarca de otra manera: como un problema de predicción, no como una carrera de activación. Un sistema entrenado en el lenguaje que realmente has encontrado hace un menor error de predicción para las palabras que ha visto más a menudo. Palabras de alta frecuencia: menor error, reconocimiento más rápido. Palabras de baja frecuencia: mayor error, reconocimiento más lento (Heitmeier, Chuang, Axen & Baayen, 2023).
Todas las teorías mencionadas tienen una cosa en común: la exposición determina cuán rápido una palabra supera cualquier criterio que el modelo esté midiendo. En lo que los tres coinciden, y lo que importa para el diseño del estudio, es que el conteo bruto de frecuencia en sí es un mal predictor. El valor transformado en log- o rango predice el tiempo de reacción con mucha más precisión (Heitmeier, Chuang, Axen & Baayen, 2023). Verás exactamente cómo se ve ese valor transformado en comparación con una palabra real en la siguiente sección.
¿Cómo se Mide la Frecuencia de Palabras?
Los predictores necesitan un número detrás de ellos. Entonces, ¿de dónde proviene realmente ese número?
Una de las principales maneras en que los investigadores han medido la frecuencia de palabras durante décadas fue contando las ocurrencias en material impreso: lectores, libros de texto, la Biblia, los clásicos en inglés, revistas populares, incluso un conjunto de 120 libros infantiles (Thorndike & Lorge, 1944).
Pero las personas no hablan como los libros. Entonces, ¿por qué usar libros como la base principal para representar la frecuencia del lenguaje? Marc Brysbaert y Boris New reconstruyeron el conteo estándar de palabras en inglés americano desde cero, utilizando 51 millones de palabras extraídas de subtítulos de películas y programas de televisión (Brysbaert & New, 2009).
La apuesta dio sus frutos. Al ser probada contra 31,201 palabras reales, su medida basada en subtítulos, SUBTLEX-US, explicó el 62.3% de la varianza en cuán rápido las personas las reconocieron. Las normas antiguas, construidas a partir de prosa editada en inglés impresa en 1961 (Francis & Kučera, 1964), lograron solo el 57.7% (Brysbaert & New, 2009).
Un puñado de entradas reales de ese conjunto de datos SUBTLEX-US muestra la distribución (Brysbaert & New, 2009), desde palabras que aparecen una vez en 51 millones de palabras hasta "el," que aparece en cada una de las 8,388 películas y programas en el corpus:
| Palabra | FREQcount | SUBTLWF | SUBTLCD | Lg10WF |
|---|---|---|---|---|
| encantamientos | 1 | 0.02 | 0.01 | 0.3010 |
| consolidación | 1 | 0.02 | 0.01 | 0.3010 |
| septillizos | 1 | 0.02 | 0.01 | 0.3010 |
| referente | 1 | 0.02 | 0.01 | 0.3010 |
| puntillosamente | 1 | 0.02 | 0.01 | 0.3010 |
| pragmatismo | 11 | 0.22 | 0.11 | 1.0792 |
| humillado | 46 | 0.90 | 0.39 | 1.6721 |
| exhibición | 207 | 4.06 | 1.63 | 2.3181 |
| fiel | 465 | 9.12 | 4.21 | 2.6684 |
| herramienta | 548 | 10.75 | 4.40 | 2.7396 |
| botellas | 682 | 13.37 | 5.47 | 2.8344 |
| personalidad | 811 | 15.90 | 6.72 | 2.9096 |
| encantador | 4,853 | 95.16 | 29.48 | 3.6861 |
| perro | 9,835 | 192.84 | 36.35 | 3.9928 |
| ojos | 11,299 | 221.55 | 56.82 | 4.0531 |
| casado | 12,163 | 238.49 | 47.11 | 4.0851 |
| juntos | 19,553 | 383.39 | 76.90 | 4.2912 |
| mente | 24,715 | 484.61 | 81.90 | 4.3930 |
| Gracias | 31,789 | 623.31 | 85.23 | 4.5023 |
| Dios | 46,061 | 903.16 | 82.74 | 4.6633 |
| Dónde | 93,341 | 1,830.22 | 98.47 | 4.9701 |
| Sí | 101,835 | 1,996.76 | 97.04 | 5.0079 |
| saber | 291,780 | 5,721.18 | 99.43 | 5.4651 |
| el | 1,501,908 | 29,449.18 | 100.00 | 6.1766 |
Nuevas medidas de frecuencia basadas en la base de datos SUBTLEXUS, nombre de archivo Archivo Excel comprimido 2007 con todas las 74,286 palabras en el corpus
- FREQcount: el número bruto de veces que la palabra ocurre en todo el corpus de 51 millones de palabras SUBTLEX-US.
- SUBTLWF: frecuencia de palabras por millón de palabras (FREQcount dividido por 51), la cifra estandarizada que hace que palabras de diferentes tamaños de corpus sean comparables.
- SUBTLCD: diversidad contextual, el porcentaje de las 8,388 películas y episodios de TV del corpus que contienen la palabra al menos una vez. Una palabra puede ser frecuente pero concentrada en pocos contextos, o moderadamente frecuente pero distribuida en todas partes; esto es lo que captura esa diferencia.
- Lg10WF: la frecuencia transformada en log10. Este es el valor que realmente predice el tiempo de reacción en experimentos de decisión léxica, no el conteo bruto, razón por la cual los investigadores lo utilizan en lugar de FREQcount para el modelado.
Nota
No hay un corpus universal para medir la frecuencia de palabras. Cualquiera que un investigador use depende del idioma, el diccionario o lista de frecuencias en cuestión, y la aplicación. SUBTLEX-US es un ejemplo ampliamente utilizado en la investigación lingüística en inglés, y se utiliza aquí porque demuestra claramente los conceptos fundamentales detrás del efecto de frecuencia de palabras, no porque sea la única opción. Existen otros corpora para otros idiomas, géneros y necesidades de investigación.
Eso es la variable, definida y medida. Donde realmente aparece, en laboratorios de psicolingüística, en cómo los niños aprenden a leer, en hablantes bilingües, en copias de marketing, es donde las cosas se vuelven interesantes.
Ejemplos del Efecto de Frecuencia de Palabras en la Investigación
Marketing y Persuasión
La frecuencia de palabras no solo se queda en el laboratorio, da forma a cómo las personas responden al lenguaje en general. Las palabras fáciles de procesar simplemente se sienten mejor, un fenómeno que los investigadores llaman fluidez de procesamiento, y la frecuencia de palabras es una de sus palancas más confiables (Bullock, Shulman & Huskey, 2021).
Brady Hodges, Zachary Estes y Caleb Warren lo probaron directamente en eslóganes de marcas: desglosando más de 800 ejemplos reales, utilizando análisis correlacional, experimentos de laboratorio, seguimiento ocular y un estudio de campo, encontraron que los eslóganes construidos a partir de palabras comunes se gustan más (Hodges, Estes & Warren, 2024). ¡Las implicaciones de esto son que los eslóganes construidos a partir de palabras raras es más probable que se recuerden más!
Las implicaciones se pueden aplicar a decisiones comerciales reales. Una marca más nueva, o una que lucha por cuota de mercado, o que entra en territorio desconocido, en realidad se beneficia de un lenguaje más difícil de procesar, es lo que hace que la gente recuerde el nombre más tarde. Para una marca establecida, las matemáticas cambian: ser olvidable apenas les cuesta algo, la gente ya sabe quiénes son, pero ser poco apreciado causa un daño real. Por eso la apuesta más segura para ellos es la palabra fácil y agradable, incluso si es menos memorable (Hodges, Estes & Warren, 2024).
Psicolingüística y Decisión Léxica
Suena casi demasiado simple como para importar: mira una serie de letras, decide si es una palabra real, presiona un botón, lo más rápido que puedas. Ese juicio que se siente trivial es donde el efecto de la frecuencia de palabras es más grande, más grande que la longitud de la palabra, la densidad del vecindario, o cualquier otra cosa que los psicolingüistas suelen culpar por tiempos de reacción lentos.
Heitmeier y colegas lo midieron directamente: la frecuencia explicó "de lejos" la mayor parte de la varianza en la rapidez con que las personas respondieron (Heitmeier, Chuang, Axen & Baayen, 2023).
En el video anterior, se puede ver un ejemplo de la Tarea de Decisión Léxica Dual. Esta tarea presenta al participante dos palabras y el participante debe decidir si ambas palabras presentadas están en inglés o si una no lo está.
Desarrollo de la Lectura
Sarah Gerth y Julia Festman utilizaron el seguimiento ocular en un estudio con 66 niños de habla alemana en quinto y sexto grado, de 10 a 12 años, mientras leían oraciones ordinarias, no palabras aisladas en una pantalla, oraciones reales, leídas de la manera en que un niño realmente lee en la escuela. El resultado: las palabras de baja frecuencia mantenían su mirada un total de 62 milisegundos más que las de alta frecuencia, en lectores que aún estaban aprendiendo a leer con fluidez (Gerth & Festman, 2021).
Pero resultó que la frecuencia era solo la mitad de la historia. Algunos de los niños eran simplemente lectores más rápidos que otros, y la frecuencia de palabras por sí sola no podía explicar por qué.
La longitud de la palabra era la pieza que faltaba. Los niños lectores más rápidos ya habían adquirido un hábito que los más lentos aún no tenían: percibir una palabra común entera de un solo vistazo en lugar de trabajar a través de ella letra por letra, un pequeño pero real paso hacia cómo leen los adultos.
Un diseño modelado en este estudio, con palabras críticas de alta y baja frecuencia incrustadas en oraciones ordinarias, igualadas en longitud de palabra, con métricas de mirada por palabra registradas automáticamente, se demuestra en la página de Segmentación de Texto de Labvanced, construida con el Objeto de Segmentación de Texto.
Reconocimiento de Palabras en Lenguas Bilingües y de Segundo Idioma
Aquí hay un patrón que la mayoría de las personas nunca nota sobre su propio bilingüismo: el efecto de frecuencia de palabras golpea más fuerte en tu lengua más débil. Jens Schmidtke lo midió, los hablantes bilingües muestran un efecto de frecuencia más grande que los hablantes monolingües (Schmidtke, 2014).
Es tentador leer eso como si los cerebros bilingües procesaran el lenguaje de manera diferente. Para este efecto específico, no tienen que hacerlo: dividir tu exposición entre dos lenguas y cada una simplemente recibe menos práctica que la lengua de un hablante monolingüe.
Hazte más fluido y la brecha se estrecha. Una mayor competencia estaba directamente ligada a un efecto de frecuencia más pequeño.
Preguntas Frecuentes
¿Qué es el efecto de frecuencia de palabras en términos simples?
¿Por qué las palabras comunes se reconocen más rápido que las raras?
¿Cómo miden los investigadores la frecuencia de palabras?
¿El efecto de frecuencia de palabras solo se aplica a la lectura?
Conclusiones Clave
- Las palabras comunes se reconocen más rápido y con mayor precisión que las raras, un hallazgo conocido como el efecto de frecuencia de palabras.
- Supera a cualquier otra variable que los psicolingüistas prueban, longitud de palabra, densidad de vecindario, como predictor del tiempo de reacción.
- Usa frecuencia transformada por logaritmo o rango, no cuentas crudas, la frecuencia cruda apenas predice el comportamiento.
- Los hablantes bilingües sienten el efecto con más fuerza que los hablantes monolingües, porque su exposición a cada lengua está dividida.
- En eslóganes de marcas, las palabras comunes ganan en agradabilidad y pierden en memorabilidad.
- La Tarea de Decisión Léxica Dual de Labvanced es un paradigma listo para estudiar este efecto, registrando datos de tiempo de reacción y precisión a nivel de prueba.
- Para la lectura de oraciones continuas en lugar de palabras aisladas, el Objeto de Segmentación de Texto registra métricas de mirada por palabra automáticamente, demostrado con un estudio de lectura de frecuencia de palabras modelado en Gerth y Festman (2021).
Más conceptos y efectos de psicología, explicados.
Referencias
- Brysbaert, M., & New, B. (2009). Moving beyond Kučera and Francis: A critical evaluation of current word frequency norms and the introduction of a new and improved word frequency measure for American English. Behavior Research Methods, 41(4), 977–990.
- Bullock, O. M., Shulman, H. C., & Huskey, R. (2021). Narratives are persuasive because they are easier to understand: Examining processing fluency as a mechanism of narrative persuasion. Frontiers in Communication, 6, 719615.
- Francis, W. N., & Kučera, H. (1964). A Standard Corpus of Present-Day Edited American English (the Brown Corpus). Brown University.
- Gerth, S., & Festman, J. (2021). Reading development, word length and frequency effects: An eye-tracking study with slow and fast readers. Frontiers in Communication, 6, 743113.
- Heitmeier, M., Chuang, Y.-Y., Axen, S. D., & Baayen, R. H. (2023). Frequency effects in linear discriminative learning. Frontiers in Human Neuroscience, 17, 1242720.
- Hodges, B. T., Estes, Z., & Warren, C. (2024). Intel inside: The linguistic properties of effective slogans. Journal of Consumer Research, 50(5), 865–886.
- Lim, S. W. H. (2016). The influence of orthographic neighborhood density and word frequency on visual word recognition: Insights from RT distributional analyses. Frontiers in Psychology, 7, 401.
- Schmidtke, J. (2014). Second language experience modulates word retrieval effort in bilinguals: Evidence from pupillometry. Frontiers in Psychology, 5, 137.
- Thorndike, E. L., & Lorge, I. (1944). The Teacher's Word Book of 30,000 Words. Teachers College, Columbia University.