LS-011 / Fonética y fonología

Coarticulación y percepción del habla

Coarticulación y percepción del habla, de una señal continua a unidades lingüísticas

Ver secciones del texto
  1. El problema de la percepción del habla
  2. El habla no es una cadena de posturas independientes
  3. Coarticulación anticipatoria y perseverativa
  4. Coarticulación y asimilación
  5. La coarticulación no elimina la estructura
  6. Un fonema no tiene una única señal acústica
  7. Claves múltiples y dependencia del contexto
  8. El experimento clásico de la percepción categorial
  9. Los límites de la versión fuerte
  10. Una frontera gradual
  11. Prototipos y efecto imán perceptivo
  12. Teorías de la percepción del habla
  13. Normalización del hablante
  14. Adaptación perceptiva
  15. El habla continua no tiene espacios
  16. Pistas fonotácticas y prosódicas
  17. Conocimiento léxico y competencia entre candidatos
  18. Probabilidades transicionales
  19. El efecto Ganong
  20. Restauración fonémica
  21. Integración audiovisual y efecto McGurk
  22. Aprender categorías modifica la percepción
  23. Segunda lengua
  24. Hipoacusia y percepción lingüística
  25. Procesamiento auditivo y atención
  26. Habla degradada y contexto clínico
  27. Reconocimiento automático como inferencia
  28. Cómo estudiar la percepción del habla
  29. Segmentación y categorías
  30. Relación con el estructuralismo y con Peirce
  31. Aplicación clínica integrada
  32. Síntesis
  33. Referencias

DESARROLLO COMPLETO · BIBLIOGRAFÍA INCLUIDA

El problema de la percepción del habla

Las lecturas LS-007 a LS-010 describieron cómo se produce el habla y cómo puede analizarse acústicamente. Queda por resolver un problema de fondo. La señal que llega al oído no contiene segmentos discretos, separados y en correspondencia uno a uno con los fonemas que el oyente cree escuchar. Ante una palabra como pato, analizada como /ˈpato/, resulta tentador imaginar cuatro bloques acústicos sucesivos, uno por fonema. La producción real no funciona así. Los movimientos articulatorios de un segmento se superponen con los de sus vecinos, las propiedades acústicas de una consonante dependen de las vocales que la rodean, las fronteras entre segmentos son difusas y una misma categoría fonológica cambia de realización según el contexto, la velocidad, el hablante y la variedad. Los oyentes comprenden, sin embargo, el habla con gran rapidez.

La pregunta es cómo una señal acústica continua y variable se convierte en categorías lingüísticas relativamente estables. La respuesta no puede consistir en buscar en la señal una versión acústica de cada letra. La percepción del habla usa información distribuida en el tiempo, múltiples claves acústicas, conocimiento de la lengua, regularidades estadísticas y contexto. Esta lectura examina cuatro problemas relacionados, que son la coarticulación, la invariancia, la categorización perceptiva y la segmentación del habla continua en palabras.

El habla no es una cadena de posturas independientes

Para producir [ku], el dorso de la lengua forma una constricción velar para la [k], mientras que la [u] exige una lengua retraída y labios redondeados. El hablante no espera a terminar la [k] para comenzar a preparar la [u]. El redondeamiento de los labios puede empezar durante la consonante, que adquiere así propiedades del segmento siguiente. La coarticulación puede definirse como la superposición temporal de los gestos articulatorios correspondientes a unidades vecinas. Es una propiedad normal de la producción eficiente del habla, sin nada de defecto de pronunciación.

Coarticulación anticipatoria y perseverativa

En la coarticulación anticipatoria, una propiedad del segmento siguiente se manifiesta antes de que este se realice plenamente. La /k/ de quiso se articula más adelante en el paladar que la de cuna, porque la lengua anticipa la posición de la vocal. La señal acústica de la consonante contiene, por tanto, información sobre la vocal antes de que esta comience convencionalmente. La información fonética está distribuida en el tiempo, lo que contradice la imagen del habla como una secuencia de unidades acústicamente encapsuladas.

En la coarticulación perseverativa, o progresiva, la influencia avanza desde un segmento anterior hacia el siguiente. Una vocal puede nasalizarse parcialmente tras una consonante nasal, como en más. En la anticipatoria, la preparación de un segmento modifica al anterior; en la perseverativa, un segmento modifica al que le sigue. La distinción es analítica, porque en el habla real ambas direcciones coexisten.

Coarticulación y asimilación

Coarticulación y asimilación están emparentadas; no son sinónimos. La coarticulación puede consistir en ajustes graduales propios de la ejecución motora. La asimilación suele describirse cuando un segmento adopta de manera más sistemática una propiedad de otro, como la nasal que toma el lugar de articulación de la consonante siguiente en tengo o enfermo, ejemplos que presentó el texto LS-008. La frontera entre un efecto fonético gradual y un proceso fonológico categórico depende del grado de abstracción y de los datos disponibles. El texto LS-013 estudia la asimilación como proceso fonológico.

La coarticulación no elimina la estructura

Si la señal es continua y los segmentos se superponen, podría parecer que las categorías de consonante y vocal son ficciones arbitrarias. La conclusión no se sigue. La coarticulación muestra que la relación entre las categorías lingüísticas y la señal física no es una correspondencia uno a uno. Las unidades pueden ser reales como categorías funcionales aunque su implementación física se distribuya en el tiempo. Un acorde musical contiene notas simultáneas cuyas ondas se superponen. Esa superposición no impide analizarlas como componentes. En el habla la situación es más compleja, porque los gestos cambian continuamente. La estructura lingüística se implementa mediante una dinámica motora, no mediante bloques concatenados.

Un fonema no tiene una única señal acústica

La realización acústica de /d/ depende de la vocal que la sigue. La transición del segundo formante asciende hacia una [i] y desciende hacia una [u], por lo que la /d/ de di y la de du no comparten un patrón acústico simple. El oyente reconoce, sin embargo, la misma consonante en ambos contextos (Liberman et al., 1967). No existe, por tanto, una propiedad acústica única que funcione como firma de /d/ en todas las situaciones. Este es el problema de la falta de invariancia, que ocupó a la investigación sobre percepción del habla desde sus comienzos y que puede formularse como la pregunta de cómo se identifica una categoría cuya realización acústica cambia sustancialmente con el contexto.

Claves múltiples y dependencia del contexto

La percepción de una consonante puede apoyarse en varias señales. Para una oclusiva, el oyente puede usar el VOT, la frecuencia y la distribución de la explosión, las transiciones formánticas, la duración, la sonoridad y el contexto vocálico. Ninguna de estas claves es suficiente en todos los contextos. El sistema perceptivo combina la información que aportan. Las claves pueden compensarse parcialmente entre sí, un fenómeno que la literatura en inglés llama trading relations. Si una señal es ambigua en una dimensión, otra puede inclinar la categorización. La percepción fonética es, así, multidimensional.

Una misma propiedad acústica puede interpretarse, además, de manera diferente según los sonidos vecinos. El oyente usa el contexto para estimar qué categorías son plausibles, desde el entorno acústico inmediato hasta el ritmo, la identidad aparente del hablante, las palabras posibles y la oración. La percepción no espera a analizar cada segmento de manera aislada para empezar a usar información de niveles superiores. Ambos niveles interactúan continuamente. La magnitud y la arquitectura exactas de esa interacción siguen en discusión.

El experimento clásico de la percepción categorial

Uno de los resultados más influyentes de la psicolingüística fue la llamada percepción categorial del habla. Liberman et al. (1957) sintetizaron una serie de sílabas en la que la transición del segundo formante variaba de manera gradual, de modo que sus extremos se oían como /ba/, /da/ y /ga/. Aunque el estímulo cambiaba de manera continua, las respuestas de identificación mostraban transiciones relativamente abruptas entre categorías. Estudios posteriores obtuvieron patrones semejantes con series que variaban el VOT entre /ba/ y /pa/.

La evidencia clásica combinaba dos tareas. En la de identificación, el participante escuchaba un estímulo y decidía a qué categoría pertenecía. En la de discriminación, decidía si dos estímulos eran iguales o diferentes. Los resultados mostraban una mejor discriminación cuando los dos estímulos quedaban a ambos lados de la frontera que cuando pertenecían a la misma categoría. De ahí surgió una interpretación fuerte, según la cual los oyentes perciben sobre todo categorías fonológicas y pierden gran parte de la información acústica dentro de cada una. La idea influyó durante décadas en la lingüística, la psicología cognitiva y la neurociencia.

Los límites de la versión fuerte

La investigación posterior obligó a revisar esa conclusión. Los oyentes conservan información acústica fina dentro de cada categoría. Medidas más sensibles que la elección forzada, como los tiempos de respuesta, los movimientos oculares ante imágenes que corresponden a palabras en competencia y los potenciales evocados, muestran efectos graduales de la señal. Dos estímulos identificados ambos como /b/ no se procesan de manera idéntica si uno de ellos está acústicamente mucho más cerca de la frontera con /p/. McMurray (2022) revisó cincuenta años de trabajos de este tipo y concluyó que rechazan las formas más fuertes de la percepción categorial. Según su síntesis, la codificación de la señal auditiva es en gran medida continua. Los oyentes preservan, además, el detalle fino para procesar el habla con más flexibilidad.

El alcance de esa revisión debe precisarse. Es un trabajo crítico con una tesis explícita, no un experimento que invalide por sí solo toda la evidencia anterior. La evidencia de respuestas categoriales y la de sensibilidad gradual deben evaluarse según la tarea, el contraste y la población. La conclusión mínima es más acotada y más firme. Una decisión binaria impuesta por la tarea no demuestra que toda la representación previa fuera binaria.

Una frontera gradual

La relación entre el VOT y la categoría percibida puede describirse como una función de probabilidad. A medida que aumenta el VOT, crece gradualmente la probabilidad de que el oyente responda /p/, desde valores casi nulos hasta valores cercanos a la certeza, sin que haga falta postular una frontera mental perfectamente determinista. La categoría existe; su relación con la señal es gradual. Clayards et al. (2008) mostraron, además, que los oyentes ajustan la pendiente de esa función a la variabilidad de las claves que escuchan. Cuando las realizaciones de cada categoría se dispersan más, la transición entre categorías se vuelve más suave.

La posición de la frontera depende de la lengua. En inglés, la oposición entre /b/ y /p/ se sitúa entre un retraso corto y uno largo de la sonoridad, unas decenas de milisegundos después de la liberación. Abramson y Lisker (1973) presentaron a hablantes de español latinoamericano oclusivas sintetizadas cuyo VOT variaba en pasos pequeños y obtuvieron dos categorías bien definidas, coherentes con la producción del español. En esta lengua, la frontera separa la sonoridad previa de un retraso corto y queda, por tanto, próxima al momento de la liberación. Una serie de estímulos que un angloparlante oye mayoritariamente como /b/ puede oírse en buena parte como /p/ para un hispanohablante. Las curvas de identificación obtenidas con hablantes de inglés no pueden usarse como norma para el español.

Prototipos y efecto imán perceptivo

Dentro de una misma categoría, algunas realizaciones se perciben como mejores ejemplos que otras. Una [i] situada cerca del centro estadístico aprendido de la categoría funciona como un ejemplar muy prototípico. Esa posición afecta a la percepción de las distancias entre estímulos. El llamado efecto imán perceptivo describe la compresión perceptiva de las regiones cercanas a un prototipo, que los modelos actuales explican con herramientas estadísticas y bayesianas. Las categorías modifican la geometría perceptiva sin borrar por completo el detalle acústico.

Teorías de la percepción del habla

La percepción del habla plantea una pregunta filosóficamente interesante acerca de su objeto. Cuando se escucha /b/, lo percibido podría ser un patrón acústico, un gesto articulatorio, una categoría fonológica abstracta o un evento comunicativo. Las distintas teorías han privilegiado niveles diferentes. Ninguna teoría aceptada universalmente explica todos los fenómenos; los problemas deben conocerse antes de adoptar una arquitectura.

La teoría motora de la percepción del habla, formulada por Alvin Liberman e Ignatius Mattingly, sostuvo en su formulación madura que los objetos de percepción son los gestos articulatorios que producen la señal (Liberman y Mattingly, 1985). Su motivación provenía de la coarticulación. Si la señal acústica cambia tanto con el contexto, lo relativamente estable podría ser la intención gestual subyacente. La teoría defendió también, en ciertos momentos, una especialización biológica del sistema de percepción del habla. Fue muy influyente. La evidencia posterior mostró que el sistema motor puede participar en la percepción del habla, aunque es difícil sostener que sea siempre necesario o que sea la única explicación. Los oyentes perciben habla en condiciones en las que una recuperación articulatoria explícita parece improbable. Otros sistemas perceptivos muestran, además, fenómenos categoriales. Kuhl y Miller (1975) entrenaron chinchillas para responder a una serie sintética entre /da/ y /ta/. Los animales cambiaban de respuesta en la misma región en que lo hacían los oyentes de inglés, sin producir habla. La teoría dejó, aun así, un problema duradero. La percepción debe relacionar una señal acústica muy variable con eventos de producción organizados.

Las teorías auditivas explican la percepción mediante mecanismos generales de procesamiento auditivo y de aprendizaje (Diehl et al., 2004). Desde esta perspectiva, el oyente no necesita reconstruir gestos motores y puede aprender las regularidades estadísticas que vinculan patrones acústicos, categorías, palabras y contextos. Estas teorías mostraron que muchos fenómenos atribuidos a un módulo fonético especial se relacionan con mecanismos perceptivos generales. Tampoco basta, sin embargo, con reducirlo todo a la audición general, porque el habla tiene una estructura temporal y estadística muy particular y la experiencia lingüística modifica en gran medida la percepción.

El realismo directo, defendido por Carol Fowler, sostiene que los objetos de percepción pueden ser los gestos articulatorios reales, sin adoptar la arquitectura representacional de la teoría motora clásica (Fowler, 1986). La señal acústica informa sobre eventos físicos distantes, del mismo modo que la luz reflejada informa sobre un objeto visual. Quien mira percibe el objeto a través de la luz; quien escucha percibiría acciones vocales a través de sus consecuencias acústicas. La discusión muestra que el desacuerdo concierne a los mecanismos y también a qué se considera el objeto de la percepción.

Los enfoques probabilísticos incorporan la incertidumbre. El oyente infiere qué categoría o qué palabra produjo una señal a partir de la señal y del contexto. En términos bayesianos, la probabilidad de una categoría dada la señal es proporcional a la probabilidad de esa señal bajo la categoría multiplicada por la probabilidad previa de la categoría. El oyente combina así la compatibilidad acústica, la frecuencia previa, el contexto y la experiencia. El formalismo representa una inferencia bajo incertidumbre, sin afirmar que el cerebro ejecute literalmente una ecuación.

Normalización del hablante

El texto LS-009 mostró que los valores de F1 y F2 varían con la anatomía, así que la misma /i/ tiene valores acústicos distintos en adultos y en niños o en hablantes con tractos vocales diferentes. Lo mismo ocurre con la F0 y con muchas consonantes. El oyente debe compensar esa variación, un problema conocido como normalización del hablante.

Una señal puede interpretarse en relación con el rango acústico de quien habla. En una persona de voz generalmente grave, una F0 determinada puede corresponder a una elevación prosódica importante aunque sea baja en términos absolutos respecto de la de otra persona. Lo mismo ocurre con los formantes. La percepción usa información distribuida en el contexto para calibrar sus expectativas, con lo cual una propiedad acústica no siempre tiene un valor lingüístico independiente del sistema local en el que aparece. La lógica estructural reaparece, así, en la percepción. Los modelos episódicos proponen incluso que la memoria léxica conserva huellas de las emisiones concretas, con detalles del hablante que intervienen en el reconocimiento (Goldinger, 1998).

Adaptación perceptiva

Los oyentes se ajustan con rapidez a pronunciaciones atípicas. Norris et al. (2003) presentaron a oyentes neerlandeses un sonido ambiguo entre [f] y [s] al final de palabras en las que el léxico permitía deducir cuál de las dos fricativas correspondía. Tras esa exposición, los oyentes desplazaron su frontera entre ambas categorías en la dirección que el léxico había indicado. Este aprendizaje perceptivo muestra que las categorías fonéticas adultas conservan plasticidad. La percepción no se limita a fronteras rígidas adquiridas en la infancia y actualiza sus expectativas con la experiencia reciente.

El habla continua no tiene espacios

La escritura española separa las palabras de una oración como «hoy fui al hospital», aunque el audio no contiene equivalentes acústicos sistemáticos de esos espacios. En el habla natural, las palabras se enlazan, algunos segmentos se reducen y aparecen asimilaciones. El oyente debe resolver dónde termina una palabra y comienza otra, un problema conocido como segmentación léxica. Para un adulto parece trivial, porque dispone de un léxico amplio y conoce las regularidades de su lengua. Para un niño que adquiere el lenguaje, el problema es mucho más evidente.

Las pausas no resuelven la segmentación. En el habla espontánea aparecen dentro de unidades sintácticas, antes de palabras difíciles, por necesidades de planificación o entre grupos prosódicos. Muchas fronteras entre palabras, en cambio, no contienen pausa alguna. La segmentación debe apoyarse, por tanto, en otras pistas.

Pistas fonotácticas y prosódicas

Las lenguas restringen qué secuencias de sonidos son posibles. Una secuencia puede ser común dentro de las palabras, frecuente en las fronteras o imposible dentro de una sílaba. El oyente puede usar estas regularidades para inferir límites. El español no admite /sl/ al comienzo de sílaba, como muestra la adaptación de slogan como eslogan. Al oír /sl/ en los lagos, el oyente puede inferir una frontera entre la /s/ y la /l/. La fonotáctica convierte el conocimiento del sistema en una herramienta de segmentación.

El acento, el ritmo y la estructura silábica también ayudan. En algunas lenguas, la posición del acento aporta información fuerte sobre las fronteras. En español, el acento léxico y la organización prosódica colaboran en la segmentación sin identificar mecánicamente cada palabra. El oyente integra múltiples pistas imperfectas, que no tienen el mismo peso. Mattys et al. (2005) propusieron un marco jerárquico en el que el conocimiento léxico predomina cuando la señal es clara y las pistas subléxicas y métricas ganan importancia cuando el habla está degradada o el contexto léxico es pobre.

Conocimiento léxico y competencia entre candidatos

Una secuencia compatible con una palabra conocida activa esa palabra como candidata. Varias palabras pueden competir al principio. Una secuencia que comienza por /kasa/ puede activar casa, casar, casado o casamiento, según su continuación. El reconocimiento es incremental. El oyente comienza a interpretar una palabra antes de oírla completa.

Modelos como TRACE (McClelland y Elman, 1986) y Shortlist (Norris, 1994) propusieron arquitecturas en las que los candidatos léxicos se activan y compiten mientras llega la señal. A medida que aparece más información, algunos candidatos ganan apoyo y otros se vuelven incompatibles. Este principio explica que el reconocimiento sea rápido sin requerir fronteras acústicas explícitas. Los dos modelos difieren en un punto discutido. TRACE permite que la activación de las palabras retroalimente la de los fonemas, mientras que Shortlist mantiene el procesamiento prelexical libre de esa retroalimentación. En ambos, el léxico participa activamente en la segmentación.

Probabilidades transicionales

Un descubrimiento influyente en la adquisición del lenguaje fue que incluso los lactantes son sensibles a las regularidades estadísticas entre sílabas. En una secuencia artificial en la que bi va siempre seguida de da, la probabilidad de da después de bi es máxima. Si después de da pueden aparecer muchas sílabas distintas, la probabilidad de cualquiera de ellas es menor. Las fronteras entre palabras tienden a coincidir con esas caídas de probabilidad transicional. Saffran et al. (1996) mostraron que bebés de ocho meses, tras escuchar durante dos minutos una secuencia continua de sílabas sin pausas, distinguían después las «palabras» del lenguaje artificial de secuencias que cruzaban sus fronteras.

El resultado no significa que los niños adquieran las palabras usando solo probabilidades entre sílabas, porque el habla natural contiene además pistas fonotácticas, prosódicas, léxicas, semánticas y sociales. El aprendizaje estadístico es una fuente de información, sin que baste por sí solo para explicar el mecanismo completo. Las regularidades estadísticas pueden aprenderse, además, en dominios no lingüísticos, por lo que el fenómeno tampoco demuestra un módulo específicamente lingüístico. Los experimentos usan secuencias controladas, mientras que el lenguaje natural tiene vocabularios muy amplios, ruido, variabilidad, múltiples hablantes y dependencias de largo alcance. Una tarea experimental puede aislar un mecanismo real sin demostrar que ese mecanismo explique por sí solo el fenómeno complejo fuera del laboratorio.

El efecto Ganong

El léxico puede influir en la categorización fonética. Ganong (1980) construyó series de estímulos que variaban el VOT entre dos consonantes, de manera que una de las interpretaciones formaba una palabra y la otra no. Una de sus series iba de dash, palabra inglesa, a tash, que no lo es. Otra iba de dask, que no es palabra, a task, que sí lo es. En ambas, los oyentes tendían a elegir la consonante que formaba una palabra. El efecto era mayor en la zona de la frontera, donde la información auditiva era ambigua, que en los extremos de las series. El reconocimiento fonético no está, por tanto, completamente aislado del léxico. El mecanismo sigue en discusión. Puede deberse a una retroalimentación desde el léxico, como en TRACE, a una integración en la etapa de decisión o a una inferencia probabilística. Un efecto conductual no determina por sí solo la arquitectura cognitiva que lo produce.

Restauración fonémica

Warren (1970) reemplazó por una tos una de las /s/ de la palabra legislatures en una oración grabada. Los oyentes afirmaban oír el sonido ausente y no sabían localizar la tos dentro de la oración. Samuel (1981) desarrolló después un método que compara estímulos en los que el ruido reemplaza al fonema con otros en los que el ruido solo se superpone a él, lo que permite medir la restauración con más precisión. La información léxica y contextual permite completar la señal. La percepción del habla es reconstructiva. Esa reconstrucción no es una invención libre, porque está restringida por la señal residual, la palabra, la sintaxis y el contexto. La percepción combina la evidencia ascendente con el conocimiento previo.

Integración audiovisual y efecto McGurk

La percepción del habla integra información visual. En el efecto McGurk, una señal acústica correspondiente a una sílaba se combina con movimientos labiales de otra y puede producir una tercera percepción (McGurk y MacDonald, 1976). Escuchar /ba/ mientras se ve una articulación de /ga/ puede hacer que se perciba /da/. El fenómeno muestra que la percepción del habla no es exclusivamente auditiva y da una base experimental a la multimodalidad examinada en el texto LS-004. Su alcance tiene límites. El resultado depende de los estímulos y de los participantes. No todas las personas perciben la misma fusión. El efecto demuestra que, en determinadas condiciones, la información visual puede alterar una respuesta auditiva, sin demostrar que la comprensión cotidiana use siempre una fusión de ese tipo ni que su magnitud mida exhaustivamente la integración audiovisual.

Aprender categorías modifica la percepción

Los bebés nacen capaces de discriminar numerosos contrastes que no pertenecen a la lengua de su entorno. Durante el primer año, su percepción se especializa en las regularidades de las lenguas que escuchan. Werker y Tees (1984) mostraron que bebés que crecían en un entorno angloparlante discriminaban entre los 6 y los 8 meses contrastes del hindi y de una lengua salish de Columbia Británica que sus padres no distinguían. Esa capacidad declinaba entre los 10 y los 12 meses. El cambio no es una pérdida absoluta de capacidad auditiva. La experiencia reorganiza el peso perceptivo que el sistema otorga a ciertas dimensiones.

Segunda lengua

En los adultos, aprender contrastes nuevos resulta difícil cuando dos categorías de la segunda lengua se asimilan a una sola de la lengua materna. Un hispanohablante puede tener dificultades al principio para distinguir las vocales inglesas de ship y sheep, como vio el texto LS-009. Un hablante de japonés puede tenerlas con el contraste inglés entre /r/ y /l/, una oposición entre un rótico y una lateral que su lengua no establece. La dificultad depende de la relación entre los dos sistemas y no puede predecirse contando cuántos sonidos tiene cada lengua.

Hipoacusia y percepción lingüística

Una pérdida auditiva puede afectar selectivamente ciertas regiones de frecuencia y reducir así la disponibilidad de pistas fonéticas. La presbiacusia, que afecta sobre todo a las frecuencias agudas, dificulta por ejemplo distinguir fricativas como [s] y [f], cuya energía se concentra en esa región. Dos sonidos que un oyente normoacúsico distingue con facilidad pueden volverse difíciles de diferenciar. La dificultad de comprensión no implica, entonces, una alteración lingüística central, porque el problema puede estar en el acceso sensorial a la señal. En la evaluación clínica, esta distinción es imprescindible.

Procesamiento auditivo y atención

La percepción del habla exige también atención, memoria de trabajo, integración temporal y conocimiento lingüístico. En el delirium, en el deterioro cognitivo o en estados de distracción intensa pueden aparecer dificultades comunicativas aunque el sistema auditivo periférico funcione bien. Ante una respuesta en apariencia incoherente, hay que considerar si el paciente oyó, si segmentó la emisión, si la comprendió, si mantuvo la información y si interpretó la pregunta. La expresión «no entendió» puede describir fallas en niveles muy distintos.

Habla degradada y contexto clínico

En entornos ruidosos, el contexto semántico ayuda a reconstruir el habla degradada; una frase clínicamente predecible puede reconocerse aunque algunas de sus propiedades acústicas sean pobres. Esa ayuda introduce también un riesgo, porque el oyente puede escuchar lo que espera. En una entrevista, una expectativa diagnóstica fuerte puede influir en la reconstrucción de una emisión ambigua. Es una razón más para grabar cuando corresponda y exista consentimiento, pedir aclaraciones y evitar completar automáticamente expresiones críticas. La percepción humana es eficiente porque usa el contexto. Esa misma eficiencia puede generar errores.

Reconocimiento automático como inferencia

Los sistemas de reconocimiento de voz enfrentan un problema análogo al humano, que consiste en convertir un audio variable en una secuencia lingüística tolerando acentos, ruido, velocidad, coarticulación y diferencias anatómicas. Los sistemas actuales aprenden regularidades a partir de grandes conjuntos de datos y usan el contexto para desambiguar, lo que aumenta mucho su precisión. Esa misma estrategia puede llevarlos a preferir una palabra contextualmente probable frente a una señal acústicamente ambigua. La transcripción automática es una inferencia, no una copia.

Un error absurdo suele ser visible, mientras que un error contextualmente plausible puede pasar inadvertido. Si un sistema transcribe «niega ideación suicida» donde el paciente dijo «refiere ideación suicida», una diferencia acústica pequeña produce una inversión clínica grave. En los dominios de alto riesgo no basta, por eso, con una tasa global de error baja. Hay que estudiar qué errores ocurren, en qué términos y con qué consecuencias, de modo que la métrica corresponda al uso.

Un sistema que integre audio, transcripción, video y contexto clínico podría mejorar el reconocimiento y también reforzar sesgos. Si espera una palabra por el contexto, puede sobreponderarla frente a una señal acústica discordante. La integración multimodal debe conservar la incertidumbre, la procedencia de cada dato y la posibilidad de revisión, porque más contexto no debe traducirse automáticamente en más confianza.

Cómo estudiar la percepción del habla

Un experimento típico manipula de manera controlada una dimensión acústica, como el VOT, para registrar después las respuestas de identificación de los participantes. Una curva de identificación con una transición marcada muestra un efecto categorial en la respuesta, aunque no demuestra por sí sola que la representación perceptiva interna sea discreta. Esa afirmación requiere otras medidas, porque la lógica experimental debe corresponder a la conclusión.

Cada tarea aporta información diferente. La identificación muestra qué etiqueta asigna el participante; la discriminación, si puede distinguir dos estímulos; las medidas graduales, como los tiempos de reacción, los movimientos oculares, los potenciales evocados o las calificaciones en escalas continuas, muestran el detalle que la elección forzada oculta. Un error histórico fue inferir demasiado sobre la representación perceptiva a partir de tareas que exigían precisamente respuestas categoriales. Hay que distinguir tres niveles, que son las propiedades acústicas disponibles en la señal, la manera en que el sistema codifica esa información y la respuesta que exige la tarea. Un participante puede conservar información acústica gradual y pulsar, aun así, solo la tecla B o la tecla P. El método puede contribuir a producir el patrón que después se cree descubrir.

Segmentación y categorías

La señal de habla carece de fronteras inequívocas equivalentes a las letras y los espacios de la escritura. El oyente segmenta combinando la coarticulación, las pistas acústicas, la fonotáctica, la prosodia, el léxico, las regularidades estadísticas y el contexto. Ninguna de esas fuentes resuelve por sí sola el problema. La estabilidad del resultado surge de su combinación. Múltiples señales imperfectas pueden producir una inferencia muy estable cuando se integran.

Las categorías fonológicas son necesarias para describir el lenguaje. La percepción no tiene que borrar, sin embargo, la variación interna para usarlas. El oyente puede conservar a la vez una clasificación categorial, información gradual sobre la proximidad a las fronteras y detalles del hablante. Esto disuelve la falsa alternativa entre una percepción continua y una categorial, porque la percepción puede ser ambas cosas en distintos niveles.

Relación con el estructuralismo y con Peirce

La percepción conecta con las lecturas de fundamentos del atlas. Una categoría se define en parte por contraste con otras, mientras que la señal que permite reconocerla es variable. El sistema lingüístico no puede identificarse, entonces, con propiedades físicas invariantes. El contraste entre /b/ y /p/ existe como organización funcional. Su implementación acústica depende del VOT, del contexto, del hablante y de la lengua. La estructura es estable en un nivel y variable en otro, un ejemplo concreto de la necesidad de distinguir niveles de descripción.

Existe también una analogía útil con la semiótica de Peirce presentada en el texto LS-002, sin que la percepción del habla sea una aplicación directa de ella. El oyente no recibe el objeto lingüístico directamente. Recibe una señal producida por eventos físicos y debe inferir las categorías pertinentes, en una inferencia restringida por la señal, informada por hábitos y abierta a la corrección contextual. La analogía no debe convertirse en una identidad teórica. La ciencia de la percepción usa modelos experimentales y computacionales específicos, mientras que la semiótica plantea preguntas generales sobre la representación. Cada disciplina opera en un nivel diferente.

Aplicación clínica integrada

Supóngase que, durante una entrevista, el clínico escucha que el paciente dice «No quiero vivir». La situación exige una aclaración inmediata. Antes de documentar la frase literalmente, conviene considerar si la señal fue clara, si había ruido, si el paciente pudo haber dicho «no quiero ir», si el contexto permite confirmarlo y si la pregunta puede repetirse. En una afirmación de gran relevancia clínica, la incertidumbre perceptiva no debe ocultarse. La percepción cotidiana funciona mediante una reconstrucción rápida y automática. La documentación clínica necesita, en ocasiones, frenar esa automatización.

Síntesis

El habla es una señal continua en la que los gestos de segmentos diferentes se superponen en el tiempo. La coarticulación, anticipatoria o perseverativa, es una propiedad normal de la producción. Por ella, una categoría fonológica carece con frecuencia de una realización acústica única. La percepción resuelve el problema de la invariancia integrando múltiples claves acústicas y contextuales. Los experimentos clásicos de percepción categorial mostraron respuestas relativamente abruptas ante estímulos continuos, aunque la evidencia posterior indica que los oyentes conservan información gradual dentro de las categorías, lo que vuelve insuficiente la versión fuerte de la percepción categorial. La frontera entre categorías depende, además, de la lengua, como muestra la diferencia entre el español y el inglés en el VOT. Las teorías de la percepción del habla han privilegiado distintos objetos y mecanismos, desde los gestos articulatorios hasta el procesamiento auditivo general y la inferencia probabilística, sin que ninguna constituya un consenso definitivo. La percepción normaliza las diferencias entre hablantes y se adapta a pronunciaciones nuevas. La segmentación de palabras se apoya en la fonotáctica, la prosodia, el léxico, las probabilidades transicionales y el contexto. Los efectos léxicos y audiovisuales muestran que la percepción integra información de múltiples niveles y modalidades. En la clínica, escuchar una frase es ya un proceso inferencial. Una interpretación auditiva ambigua debe verificarse antes de convertirse en evidencia documental. En la inteligencia artificial, el reconocimiento de voz enfrenta el mismo problema general, sin que sus mecanismos deban suponerse equivalentes a los humanos. Categoría y continuidad no son opuestos absolutos. Una representación lingüística puede ser discreta en su función mientras su realización y su procesamiento preservan información gradual.

El texto LS-012 da el paso de la fonética a la fonología propiamente dicha. Estudia los fonemas, los alófonos y su distribución mediante el análisis de pares mínimos, la distribución complementaria, la variación libre y los criterios para decidir cuándo dos sonidos pertenecen a una misma categoría fonológica.

Referencias

Abramson, A. S. y Lisker, L. (1973). Voice-timing perception in Spanish word-initial stops. Journal of Phonetics, 1(1), 1–8. https://doi.org/10.1016/S0095-4470(19)31372-5

Clayards, M., Tanenhaus, M. K., Aslin, R. N. y Jacobs, R. A. (2008). Perception of speech reflects optimal use of probabilistic speech cues. Cognition, 108(3), 804–809. https://doi.org/10.1016/j.cognition.2008.04.004

Diehl, R. L., Lotto, A. J. y Holt, L. L. (2004). Speech perception. Annual Review of Psychology, 55, 149–179. https://doi.org/10.1146/annurev.psych.55.090902.142028

Fowler, C. A. (1986). An event approach to the study of speech perception from a direct-realist perspective. Journal of Phonetics, 14(1), 3–28.

Ganong, W. F. (1980). Phonetic categorization in auditory word perception. Journal of Experimental Psychology: Human Perception and Performance, 6(1), 110–125. https://doi.org/10.1037/0096-1523.6.1.110

Goldinger, S. D. (1998). Echoes of echoes? An episodic theory of lexical access. Psychological Review, 105(2), 251–279. https://doi.org/10.1037/0033-295X.105.2.251

Kuhl, P. K. y Miller, J. D. (1975). Speech perception by the chinchilla: Voiced-voiceless distinction in alveolar plosive consonants. Science, 190(4209), 69–72. https://doi.org/10.1126/science.1166301

Liberman, A. M., Cooper, F. S., Shankweiler, D. P. y Studdert-Kennedy, M. (1967). Perception of the speech code. Psychological Review, 74(6), 431–461. https://doi.org/10.1037/h0020279

Liberman, A. M., Harris, K. S., Hoffman, H. S. y Griffith, B. C. (1957). The discrimination of speech sounds within and across phoneme boundaries. Journal of Experimental Psychology, 54(5), 358–368. https://doi.org/10.1037/h0044417

Liberman, A. M. y Mattingly, I. G. (1985). The motor theory of speech perception revised. Cognition, 21(1), 1–36. https://doi.org/10.1016/0010-0277(85)90021-6

Mattys, S. L., White, L. y Melhorn, J. F. (2005). Integration of multiple speech segmentation cues: A hierarchical framework. Journal of Experimental Psychology: General, 134(4), 477–500. https://doi.org/10.1037/0096-3445.134.4.477

McClelland, J. L. y Elman, J. L. (1986). The TRACE model of speech perception. Cognitive Psychology, 18(1), 1–86. https://doi.org/10.1016/0010-0285(86)90015-0

McGurk, H. y MacDonald, J. (1976). Hearing lips and seeing voices. Nature, 264, 746–748. https://doi.org/10.1038/264746a0

McMurray, B. (2022). The myth of categorical perception. The Journal of the Acoustical Society of America, 152(6), 3819–3842. https://doi.org/10.1121/10.0016614

Norris, D. (1994). Shortlist: A connectionist model of continuous speech recognition. Cognition, 52(3), 189–234. https://doi.org/10.1016/0010-0277(94)90043-4

Norris, D., McQueen, J. M. y Cutler, A. (2003). Perceptual learning in speech. Cognitive Psychology, 47(2), 204–238. https://doi.org/10.1016/S0010-0285(03)00006-9

Saffran, J. R., Aslin, R. N. y Newport, E. L. (1996). Statistical learning by 8-month-old infants. Science, 274(5294), 1926–1928. https://doi.org/10.1126/science.274.5294.1926

Samuel, A. G. (1981). Phonemic restoration: Insights from a new methodology. Journal of Experimental Psychology: General, 110(4), 474–494. https://doi.org/10.1037/0096-3445.110.4.474

Warren, R. M. (1970). Perceptual restoration of missing speech sounds. Science, 167(3917), 392–393. https://doi.org/10.1126/science.167.3917.392

Werker, J. F. y Tees, R. C. (1984). Cross-language speech perception: Evidence for perceptual reorganization during the first year of life. Infant Behavior and Development, 7(1), 49–63.

Cómo citar esta lectura

Publicación en la web: · LS-011

APA 7

Alarcón Covarrubias, J. (2026). Coarticulación y percepción del habla. Lingüística y Semiótica. https://linguisticaysemiotica.org/temas/ls-011

Chicago

Alarcón Covarrubias, Jonathan. «Coarticulación y percepción del habla». Lingüística y Semiótica. 22 de septiembre de 2026. https://linguisticaysemiotica.org/temas/ls-011.

CONTINUAR EXPLORANDO

Buscar en el atlas

Títulos, conceptos y secciones · las tildes no cambian los resultados.