Las lecturas anteriores han examinado estructuras, significados, usos y variación. Una pregunta metodológica atraviesa todo ese recorrido, la de cómo se establece que una generalización lingüística es verdadera. Afirmar «esta oración suena mal» puede ser un punto de partida, aunque no basta como conclusión, del mismo modo que observar que una forma aparece cien veces en un corpus no demuestra por sí solo que sea gramatical, que sea frecuente en toda la comunidad, que sea cognitivamente fácil ni que su ausencia en otro corpus sea significativa.
La lingüística contemporánea utiliza múltiples fuentes de evidencia, entre ellas los corpus, los juicios de aceptabilidad, los experimentos conductuales, el análisis acústico, la neurofisiología, el eye-tracking, los estudios de adquisición, los datos tipológicos y los modelos computacionales, cada una de las cuales responde mejor a ciertas preguntas. La pregunta central de la lectura es qué tipo de dato se necesita para evaluar una hipótesis lingüística determinada y cómo evitar que una técnica responda una pregunta distinta de la que se pretende resolver. La enseñanza principal es metodológica y se resume en un orden, el que va de la pregunta al dato, del dato al método y del método a la inferencia, nunca del método disponible a una pregunta improvisada. La lectura recorre los corpus y el muestreo, los juicios de aceptabilidad y la introspección, los experimentos de procesamiento y producción, la fonética y la percepción, las técnicas neurofisiológicas, los corpus infantiles, los métodos cuantitativos y computacionales y los problemas de replicación, prerregistro, triangulación y validez, antes de considerar la clínica, la escritura científica, la inteligencia artificial y la filosofía de la evidencia y de cerrar con un caso integrado.
Toda investigación empírica distingue al menos tres niveles. El dato es aquello que se registra, por ejemplo que un hablante calificó una oración con 3/7; la descripción resume el patrón observado, por ejemplo que las oraciones de tipo A recibieron puntuaciones más bajas que las de tipo B; la inferencia es la interpretación teórica, por ejemplo que la estructura A viola una restricción de localidad. La inferencia no está contenida directamente en el dato, pues necesita diseño, controles y comparación con alternativas. Se reproduce así una distinción mantenida a lo largo de toda la obra, la de que el dato no es la explicación.
Corpus
Un corpus es una colección estructurada de datos lingüísticos diseñada para responder preguntas mediante muestras de uso y no un espejo exhaustivo de una lengua. Puede contener texto escrito, conversaciones, transcripciones, audio y video; puede ser general, especializado, histórico, clínico, infantil o multilingüe. Su valor depende de cómo fue construido y con qué finalidad.
La pregunta más directa que se plantea a un corpus es cuántas veces aparece una forma. Puede calcularse la frecuencia absoluta f(x) o la relativa RF(x) = f(x)/N × k, donde N es el tamaño del corpus y k una base de normalización, por ejemplo un millón, normalización que permite comparar corpus de tamaños diferentes.
Las frecuencias de token y de tipo miden propiedades distintas. Si un corpus contiene «habló, habló, habló, cantó, miró», la frecuencia de token del sufijo relevante es 5 mientras el número de tipos verbales es 3. La diferencia es relevante para la productividad, pues una construcción usada muchas veces con una sola palabra no demuestra la misma generalización que una construcción distribuida en muchos tipos lexicales.
Una concordancia muestra cada aparición de una palabra junto con su contexto («... decidió TOMAR una decisión...», «... volvió a TOMAR el medicamento...», «... quiso TOMAR el control...»). El contexto evita interpretar la frecuencia sin estructura y permite estudiar colocaciones, sentidos y patrones sintácticos.
Dos palabras pueden aparecer juntas más de lo esperado, asociación que se mide con estadísticas como mutual information, t-score o log-likelihood; una forma simplificada de PMI es PMI(x, y) = log [P(x, y) / P(x)P(y)], donde un valor alto indica asociación mayor a la esperada bajo independencia. La asociación estadística no equivale a relación semántica, como muestra la coocurrencia frecuente de dos antónimos.
Queda el problema de la ausencia. Una construcción que no aparece en un corpus no es por ello agramatical. Puede ser rara, específica de otro registro o posible sin haber sido producida en la muestra, de modo que la ausencia de evidencia no equivale automáticamente a evidencia de imposibilidad. Una frecuencia alta, en cambio, sí demuestra uso real; en este sentido, corpus y juicios responden preguntas distintas.
Muestreo
Un corpus de redes sociales no representa automáticamente el español general. Puede sobrerrepresentar jóvenes, escritura informal y ciertas regiones, sesgo que obliga a que la inferencia corresponda a la muestra. Es correcto afirmar «en este corpus de X, la variante A aparece con mayor frecuencia» y no lo es concluir «los hablantes de español prefieren A» sin evidencia adicional.
Un corpus puede equilibrar géneros, regiones y edades, aunque el «balance» siempre depende del objetivo. Un corpus clínico, que no necesita representar novelas, sí debe representar adecuadamente tipos de consulta, instituciones y periodos, ejemplo de que no existe un corpus universalmente representativo.
Los metadatos (edad, sexo, región, fecha, género textual) habilitan preguntas que de otro modo son imposibles, como la de si una variante aumenta entre generaciones, pregunta que requiere edad o fecha. De ahí que un corpus sin metadatos pueda ser muy grande y, al mismo tiempo, metodológicamente limitado.
Juicios de aceptabilidad
Tradicionalmente se ha usado la oposición gramatical/agramatical, aunque una persona puede juzgar extraña una oración por razones no gramaticales, como muestra «El libro que el médico que la residente llamó escribió desapareció», que puede ser gramatical y difícil de procesar. Por ello se distingue la gramaticalidad, como propiedad teórica del sistema, de la aceptabilidad, como respuesta del hablante (Schütze & Sprouse, 2013).
En vez de preguntar «¿es gramatical?», puede usarse una escala de 1 a 7, que permite observar gradiencia. Una estructura puede recibir 2,1, 4,8 o 6,5, prueba de que la aceptabilidad no siempre es binaria.
El diseño factorial aumenta el rendimiento del método. Para estudiar islas sintácticas pueden manipularse dos factores, la longitud de la dependencia (corta o larga) y el dominio (isla o no isla), con cuatro condiciones A, B, C y D. Si el costo de la condición larga dentro de isla excede la suma esperada de los costos independientes, puede identificarse una interacción superaditiva, más informativa que la comparación de una sola oración buena con una mala.
Un experimento necesita controlar la longitud, la frecuencia lexical, la plausibilidad y la complejidad. Si una oración experimental tiene veinte palabras más que el control, la diferencia puede deberse a la memoria y no a la estructura estudiada, riesgo que el diseño intenta evitar aislando variables. El orden de presentación también influye, efecto contra el cual se usan aleatorización, contrabalanceo y oraciones de relleno (fillers) que reducen las expectativas, con el fin de evitar que el participante descubra la hipótesis y adapte sus respuestas (Cowart, 1997).
Introspección
La lingüística formal utilizó durante décadas los juicios de los propios lingüistas, práctica que permitió avances rápidos; un investigador puede identificar contrastes como «Juan se vio» frente a «*Juan lo vio a sí mismo». La introspección individual tiene, no obstante, límites, ya que puede estar influida por la teoría, el dialecto y la exposición previa.
La introspección sirve para generar hipótesis, identificar contrastes fuertes y explorar paradigmas. Una afirmación controvertida debería complementarse, en cambio, con múltiples hablantes, experimentos y corpus (Gibson & Fedorenko, 2013). No toda intuición necesita un estudio masivo; la fuerza de la evidencia debe corresponder a la de la afirmación.
Experimentos de procesamiento
Si dos estructuras exigen costos distintos, pueden medirse el tiempo de respuesta y la exactitud. Un tiempo mayor, que puede deberse a dificultad lexical, memoria o ambigüedad, no identifica automáticamente la causa; el diseño debe aislar la variable relevante.
En la lectura automedida (self-paced reading), el participante avanza palabra o segmento por segmento y se registra el tiempo por región. Una demora en la región crítica puede indicar sorpresa, reanálisis o dificultad de integración; en «The horse raced past the barn fell», la palabra fell puede generar un costo de reanálisis considerable.
El efecto de una dificultad no siempre aparece exactamente en la palabra problemática. Puede surgir en la siguiente, en el llamado spillover, de modo que el análisis debe definir la región crítica y las regiones posteriores sin exigir que el efecto coincida perfectamente con una frontera lingüística.
Eye-tracking
El eye-tracking registra fijaciones, movimientos sacádicos y regresiones, a partir de los cuales pueden medirse en lectura la duración de la primera fijación, la gaze duration y el tiempo total de lectura, variables que reflejan etapas parcialmente diferentes del procesamiento.
Una ambigüedad estructural puede inducir una lectura inicial incorrecta que obliga al lector a volver atrás. El eye-tracking registra en ese caso las regresiones y el tiempo adicional, registro que permite estudiar el procesamiento incremental. La estructura, que no se observa directamente, se infiere desde el comportamiento ocular.
En el visual world paradigm, el participante escucha una oración mientras observa imágenes y su mirada puede anticipar referentes. Ante «Mira el vaso...», la fijación sobre el vaso puede aumentar antes de completarse la instrucción. La técnica es así un instrumento para estudiar predicción, referencia y procesamiento lexical.
Producción
Las tareas de elicitación inducen estructuras mediante imágenes, compleción de frases o narraciones. Mostrar una escena donde un perro persigue a un gato y pedir «Describe lo que ocurre» permite estudiar la voz, el orden y la lexicalización.
Si una persona acaba de oír una estructura, aumenta la probabilidad de que la reutilice. Tras una pasiva como «El niño fue empujado por la niña», por ejemplo, puede producir más pasivas. Este structural priming sugiere persistencia de representaciones abstractas, con una magnitud que puede depender del léxico, la frecuencia y la tarea.
Fonética experimental
La fonética permite medir directamente propiedades de la señal, como F0, duración, formantes, VOT e intensidad (Ladefoged, 2003). Estas medidas son observables; la categoría lingüística se infiere después, como ocurre con F1, que se relaciona inversamente con la altura vocálica de manera aproximada, sin que la relación sea uno a uno en todos los hablantes.
Los formantes varían según el tamaño del tracto vocal, el sexo y la edad. Comparar hablantes puede requerir, por eso, técnicas de normalización, ilustración del principio general de que la medición bruta puede necesitar transformación antes de responder una pregunta lingüística.
El VOT (voice onset time) mide el intervalo entre la liberación de una oclusiva y el inicio de la vibración laríngea y permite distinguir categorías sonoras, sordas y aspiradas. Los límites dependen de la lengua, sin que exista un umbral universal único.
Percepción
En una tarea de identificación se presenta un continuo acústico y se pregunta qué sonido se oyó; si las respuestas cambian bruscamente cerca de un límite, puede inferirse categorización. En una tarea de discriminación se pregunta si dos estímulos son iguales o diferentes. La combinación de identificación y discriminación permite estudiar la percepción categorial, sin que esta implique que el sistema auditivo ignore por completo las diferencias dentro de una categoría.
Eeg y erp
El EEG registra actividad eléctrica con gran resolución temporal; los ERP son respuestas promedio alineadas con eventos, entre cuyos componentes clásicos en lenguaje se cuentan la N400 y la P600.
La N400 suele aumentar ante dificultad de integración semántica o baja predictibilidad, como en «Tomó el café con azúcar y calcetines», donde la palabra «calcetines» puede producir mayor N400. El efecto no debe traducirse de forma simplista como «componente semántico», pues responde a múltiples factores relacionados con el acceso y la integración.
La P600 se ha asociado con anomalías sintácticas, reanálisis e integración compleja, sin ser un «marcador puro de sintaxis». La evolución de su interpretación indica que las señales neurofisiológicas no traen etiquetas lingüísticas incorporadas.
fmri y neuroimagen
La fMRI mide cambios hemodinámicos relacionados con actividad neuronal, con buena resolución espacial y peor resolución temporal que el EEG. Puede identificar redes asociadas con la comprensión, la producción y la semántica. La activación de una región no equivale a una función exclusiva, porque una región participa en múltiples tareas.
Un error frecuente es la inferencia inversa. De que la región X se active en la tarea Y y de que se observe activación en X no se sigue que Y haya ocurrido. El razonamiento es débil si X también se activa en otras tareas, razón por la cual la neuroimagen necesita diseños comparativos y modelos probabilísticos.
Corpus infantiles
El proyecto CHILDES reúne transcripciones de interacción infantil y permite estudiar la adquisición lexical, la morfología y la sintaxis. Su ventaja son los datos longitudinales naturales; su limitación es que la transcripción no captura toda la interacción, con posibles sesgos de familia, idioma y contexto.
Con corpus infantiles puede preguntarse cuántas veces oyó un niño determinada construcción antes de producirla. El corpus disponible representa solo una fracción de su input total, de modo que la frecuencia observada es un estimador imperfecto de la frecuencia real y las inferencias deben ser prudentes en la misma medida.
Sociolingüística cuantitativa
Para una variante binaria (aspiración = 1, mantenimiento = 0), la probabilidad puede modelarse mediante regresión logística, logit(P) = β₀ + β₁·edad + β₂·estilo + β₃·contexto, modelo que permite estimar efectos simultáneos de varias variables (Speelman, 2014).
Con observaciones repetidas por hablante y por ítem, los modelos mixtos permiten representar esa estructura jerárquica mediante efectos aleatorios (Baayen, 2008; Bates et al., 2015). La elección de su estructura no se resuelve con una receta única. La propuesta de modelos «maximales» de Barr et al. (2013) fue influyente, si bien trabajos posteriores mostraron su costo en potencia y defendieron estructuras justificadas por el diseño y sostenidas por los datos (Matuschek et al., 2017). Pueden incluirse interceptos y, cuando corresponde, pendientes aleatorias por hablante e ítem, para que el modelo refleje la estructura jerárquica de los datos.
Tipología cuantitativa
Como se mostró en la lectura LS-045, dos lenguas emparentadas comparten historia. Una correlación tipológica debe controlar, por tanto, la familia y el área. Los métodos filogenéticos permiten modelar la dependencia histórica, sin cuyo control cien lenguas de una misma familia pueden inflar artificialmente un patrón.
Métodos computacionales
Un parser asigna estructura a una oración y puede evaluarse por sus decisiones de adjunción y sus dependencias. En Universal Dependencies se utilizan métricas como UAS (porcentaje de palabras con cabeza correcta) y LAS (cabeza y etiqueta correctas), métricas que evalúan una representación específica y no miden «comprensión lingüística total».
Un modelo de lenguaje estima P(wᵢ | w₁, ..., wᵢ₋₁) y puede evaluarse con el surprisal y la perplexity. El surprisal se define como S(wᵢ) = −log P(wᵢ | contexto), definición según la cual una palabra improbable produce mayor surprisal. La medida permite comparar modelos con patrones humanos de procesamiento.
El surprisal se conecta con la lectura, donde una palabra muy inesperada puede aumentar el tiempo de lectura, relación que se testea con RTᵢ = β₀ + β₁·Surprisalᵢ + ε. Una correlación apoya la idea de procesamiento predictivo, aunque no demuestra que el cerebro implemente exactamente el mismo modelo.
En los modelos de IA puede entrenarse un clasificador (probe) para recuperar información desde las representaciones internas, como el número gramatical o la categoría sintáctica. Si el probe recupera la información, demuestra que está disponible en la representación. No demuestra que el modelo la use causalmente; lo decodificable no equivale a lo causalmente utilizado.
Para estudiar la causalidad pueden alterarse activaciones, pesos o entradas; si una manipulación cambia sistemáticamente el comportamiento, la evidencia causal es más fuerte. También la ciencia de los modelos computacionales necesita, en ese sentido, distinguir correlación y mecanismo.
Replicación
Una diferencia estadísticamente significativa puede ser real, azar o artefacto de diseño. De ahí que la replicación, que evalúa la estabilidad del resultado y puede ser directa o conceptual, sea una exigencia de cualquier ciencia madura.
El poder estadístico es la probabilidad de detectar un efecto si existe y depende del tamaño del efecto, la muestra y el ruido. Un estudio pequeño puede producir falsos negativos y estimaciones inestables; p > 0,05 no demuestra ausencia de efecto (Winter, 2020).
Además de la significación debe reportarse la magnitud, dado que dos resultados pueden tener el mismo valor p y efectos muy distintos (d = 0,2 frente a d = 1,2). La inferencia necesita el tamaño del efecto y su intervalo de confianza.
Múltiples comparaciones
Si se prueban veinte hipótesis con α = 0,05, aumenta la probabilidad de obtener algún resultado positivo por azar. Para reducir ese riesgo pueden usarse correcciones, prerregistro e hipótesis confirmatorias (Winter, 2020). La lingüística experimental enfrenta los mismos problemas de reproducibilidad que otras ciencias.
Prerregistro
Un análisis exploratorio busca patrones y es legítimo, aunque no debe presentarse como si la hipótesis hubiera sido formulada antes de ver los datos. El prerregistro hace explícita esa distinción al separar las decisiones previas de las posteriores, separación que mejora la transparencia.
Un conjunto de datos puede analizarse de muchas maneras, excluyendo participantes, transformando variables o seleccionando regiones. Si las decisiones se toman después de ver los resultados, aumenta el riesgo de sobreajuste, flexibilidad que la transparencia metodológica permite evaluar.
Triangulación
Una hipótesis es más fuerte si recibe apoyo desde métodos diferentes. Cuando la hipótesis de que cierta dependencia tiene costo estructural recibe apoyo de los juicios, los tiempos de lectura y el eye-tracking, la explicación gana fuerza.
Los métodos también pueden discrepar. Un juicio bajo junto a un corpus con ejemplos frecuentes no significa necesariamente error; puede indicar diferencias dialectales, efectos de contexto o procesamiento. La discrepancia puede ser informativa y ningún método es automáticamente «el verdadero».
Validez
La validez interna pregunta si el diseño permite atribuir el efecto a la variable estudiada y disminuye con malos controles; la validez externa pregunta si el resultado generaliza a otras situaciones. Los métodos intercambian ventajas, con gran control y baja naturalidad en el experimento de laboratorio y alta ecología y menor control causal en el corpus natural.
La validez de constructo pregunta si la medida captura realmente el concepto. Medir la «complejidad lingüística» solo como longitud de oración puede ser una operacionalización demasiado estrecha. La crítica debe dirigirse, en tal caso, a la relación entre constructo y medida.
Clínica
Una observación clínica como «lenguaje desorganizado» es demasiado amplia si no se operacionaliza. Pueden registrarse respuestas tangenciales, errores de referencia o pérdida de coherencia global, conductas observables que la lingüística empírica enseña a separar de la impresión.
Un estudio con diez pacientes puede ser útil exploratoriamente, aunque no debe sostener una afirmación universal. La generalización debe ajustarse al tamaño muestral, la selección, el diagnóstico y la lengua. La metodología lingüística clínica necesita el mismo rigor que cualquier otro campo.
El análisis lingüístico de entrevistas clínicas puede requerir audio y transcripción, materiales que introducen obligaciones éticas de consentimiento, anonimización y almacenamiento seguro. Más datos no son automáticamente mejores si comprometen la privacidad, de modo que la calidad metodológica incluye la gobernanza ética.
Escritura científica
La expresión «los datos demuestran» no debe usarse sin especificar qué se demuestra. Resulta preferible escribir «los participantes calificaron las construcciones de tipo A 1,3 puntos más bajo que las de tipo B» y luego «este patrón es compatible con una restricción estructural». Separar la primera frase, descriptiva, de la segunda, interpretativa, mejora la trazabilidad.
Un artículo bien construido mantiene la alineación entre pregunta, diseño, medida, resultado y conclusión. Si la pregunta es causal, un corpus observacional puede ser insuficiente; si es de frecuencia de uso, un experimento artificial puede ser menos adecuado, de lo que se sigue que la técnica debe corresponder a la tesis.
Inteligencia artificial
Evaluar modelos exige análisis adicionales a la aplicación de benchmarks. Un benchmark puede medir exactitud, F1 o perplexity, pero una puntuación agregada puede ocultar dialectos, tipos de estructura y errores de negación. La evaluación necesita, por eso, análisis cualitativo.
Un modelo puede responder correctamente, respuesta que demuestra comportamiento correcto en esa prueba y no un mecanismo humano equivalente. La adecuación conductual debe distinguirse de la equivalencia mecanística, ya que la comparación con humanos requiere hipótesis específicas.
Filosofía de la evidencia
Ningún método observa directamente la gramática; un corpus registra producción, un juicio registra evaluación, un EEG registra actividad eléctrica y un modelo computacional produce comportamiento formal. La «gramática» es una entidad inferida de la que los diferentes métodos observan proyecciones distintas, situación que no invalida la teoría, aunque obliga a que la inferencia sea explícita.
Un mismo resultado puede ser compatible con varias teorías, como ocurre con un mayor tiempo de lectura, que puede deberse a la sintaxis, la semántica o la memoria. Se necesitan controles y predicciones diferenciales, ya que la evidencia adquiere fuerza cuando elimina alternativas.
La explicación no es acumulación de datos. Millones de observaciones no garantizan comprensión y un corpus gigante puede mostrar correlaciones mientras la teoría pregunta por qué. Una teoría sin datos, a su vez, puede convertirse en especulación; la ciencia necesita datos, modelo y contraste.
Caso integrado
Supóngase la hipótesis de que las preguntas con extracción desde una isla son menos aceptables por una restricción estructural. El corpus permite buscar ejemplos reales, con el problema de que las estructuras raras pueden no aparecer; los juicios permiten comparar condiciones controladas, con acceso directo a la aceptabilidad. La lectura automedida mide el costo de procesamiento y los modelos computacionales permiten evaluar si los sistemas predictivos muestran penalización. La triangulación separa así el uso, la aceptabilidad, el procesamiento y el aprendizaje distribucional.
El diseño mínimo construye cuatro condiciones (corta/no isla, larga/no isla, corta/isla, larga/isla), mide la aceptabilidad y estima la interacción (D − C) − (B − A). Si esta es negativa y estable, puede apoyar un efecto superaditivo, con una inferencia más fuerte que la comparación directa entre la mejor y la peor condición.
Aun un efecto estable no demuestra que exista «una isla innata en el cerebro». Puede apoyar la existencia de una restricción o de un costo específico, mientras que la explicación causal requiere comparar gramática, procesamiento y frecuencia; la misma disciplina metodológica que sostiene la inferencia evita la sobreinterpretación.
Síntesis
La lingüística empírica utiliza múltiples tipos de evidencia. Los corpus permiten estudiar la frecuencia, la distribución y el uso natural, si bien la ausencia en un corpus no demuestra agramaticalidad. Los juicios de aceptabilidad permiten comparar estructuras bajo control, con la reserva de que la aceptabilidad no equivale exactamente a la gramaticalidad. La lectura automedida, el eye-tracking y los tiempos de reacción miden el procesamiento incremental; la fonética experimental mide propiedades directas de la señal, como F0, formantes, VOT y duración. El EEG y la fMRI informan sobre actividad neurobiológica, sin que ningún componente cerebral equivalga automáticamente a una categoría lingüística. Los métodos computacionales permiten estudiar parsing, surprisal y generalización, con la salvedad de que lo decodificable no es lo causalmente utilizado.
La investigación cuantitativa necesita controlar la muestra, el poder, las comparaciones múltiples y los efectos aleatorios. La triangulación aumenta la fuerza de una hipótesis cuando métodos distintos convergen; la discrepancia entre métodos puede revelar diferencias entre uso, gramática y procesamiento. La validez debe analizarse en los niveles interno, externo y de constructo. En clínica, describir el lenguaje exige observaciones operacionales en lugar de etiquetas globales; en escritura científica, deben separarse el dato, la descripción y la interpretación; en inteligencia artificial, una puntuación de benchmark no sustituye el análisis del mecanismo.
La enseñanza metodológica de la lectura es que ningún método «mide el lenguaje» en general. Cada método observa una dimensión particular y una inferencia lingüística es sólida solo cuando la pregunta, la medida y el modelo explicativo están correctamente alineados.
La lectura LS-051 ofrece una integración general de los niveles de análisis lingüístico, mostrando cómo fonología, morfología, sintaxis, semántica, pragmática, variación y método forman una arquitectura coherente sin reducirse unos a otros.
Referencias fundamentales y ampliadas
Baayen, R. H. (2008). Analyzing Linguistic Data: A Practical Introduction to Statistics Using R. Cambridge University Press.
Barr, D. J., Levy, R., Scheepers, C., & Tily, H. J. (2013). Random effects structure for confirmatory hypothesis testing: Keep it maximal. Journal of Memory and Language, 68(3), 255–278.
Bates, D., Mächler, M., Bolker, B., & Walker, S. (2015). Fitting linear mixed-effects models using lme4. Journal of Statistical Software, 67(1), 1–48.
Cowart, W. (1997). Experimental Syntax: Applying Objective Methods to Sentence Judgments. Sage.
Gibson, E., & Fedorenko, E. (2013). The need for quantitative methods in syntax and semantics research. Language and Cognitive Processes, 28(1–2), 88–124.
Ladefoged, P. (2003). Phonetic Data Analysis: An Introduction to Fieldwork and Instrumental Techniques. Blackwell.
Matuschek, H., Kliegl, R., Vasishth, S., Baayen, R. H., & Bates, D. M. (2017). Balancing Type I error and power in linear mixed models. Journal of Memory and Language, 94, 305–315.
Schütze, C. T., & Sprouse, J. (2013). Judgment data. En R. J. Podesva & D. Sharma (Eds.), Research Methods in Linguistics. Cambridge University Press.
Speelman, D. (2014). Logistic regression: A confirmatory technique for comparisons in corpus linguistics. En D. Glynn & J. A. Robinson (Eds.), Corpus Methods for Semantics. John Benjamins.
Winter, B. (2020). Statistics for Linguists: An Introduction Using R. Routledge.