Por qué las vocales requieren otro tipo de descripción
El texto LS-008 mostró que las consonantes pueden describirse por su lugar, su modo, su actividad laríngea y su coordinación temporal. Las vocales exigen otro enfoque. También se producen mediante configuraciones del tracto vocal, pero no se caracterizan por una constricción localizada lo bastante estrecha para generar un cierre o una fricación. Su identidad depende de la forma global que adopta el tracto vocal y de cómo esa configuración modifica la señal generada en la laringe.
La diferencia tiene una consecuencia metodológica. Las consonantes suelen describirse por posiciones de constricción relativamente discretas, mientras que las vocales ocupan un espacio continuo. Dos hablantes pueden producir realizaciones acústicamente diferentes de una misma vocal y ser percibidos como si dijeran la misma; incluso un mismo hablante varía según la velocidad, el acento, el contexto y el estilo. La descripción tradicional usa tres dimensiones, que son la altura, la anterioridad y el redondeamiento. Estas categorías articulatorias son útiles e insuficientes, por lo que la fonética estudia además las vocales mediante medidas acústicas, en especial los formantes, que representan cuantitativamente parte de la configuración del tracto vocal. La lectura pregunta cómo se organizan articulatoria y acústicamente las vocales y qué relación existe entre esa organización continua y las categorías discretas que usa una lengua.
Qué es una vocal desde el punto de vista articulatorio
Una vocal se produce con una vía oral lo bastante abierta para que el aire fluya sin la obstrucción característica de las oclusivas y las fricativas. Eso no significa que todas las vocales sean articulatoriamente abiertas. La [i] presenta una constricción relativamente estrecha en la región palatal, aunque no tanto como para generar la turbulencia de una fricativa. La configuración vocálica depende de la posición de la lengua, del grado de apertura de la mandíbula, de la forma de los labios, de la configuración de la faringe, de la posición de la laringe y, en algunos casos, de la nasalización. El espacio vocálico surge de combinaciones continuas de estas variables, por lo que expresiones como vocal alta o vocal anterior son simplificaciones categoriales sobre movimientos continuos.
Altura vocálica
La altura describe aproximadamente la posición vertical de la lengua y el grado de apertura del tracto oral. El Alfabeto Fonético Internacional distingue siete grados, que van de cerrada a abierta pasando por casi cerrada, semicerrada, media, semiabierta y casi abierta (International Phonetic Association, 1999). Las descripciones más simples hablan de vocales altas, medias y bajas. El español general tiene cinco vocales fonológicas, de las cuales /i/ y /u/ son altas, /e/ y /o/ medias y /a/ baja. Estas etiquetas no significan que la lengua ocupe una posición anatómica fija para cada vocal. La realización de /e/ puede desplazarse dentro de una región del espacio vocálico sin dejar de pertenecer a esa categoría, que es más estable que cada una de sus ejecuciones.
Anterioridad y posterioridad
La segunda dimensión corresponde a la posición horizontal de la lengua, según la cual las vocales pueden ser anteriores, centrales o posteriores. En español, /i/ y /e/ son anteriores; /a/ ocupa una región central o centro-anterior según el análisis; /o/ y /u/ son posteriores. Esta clasificación tampoco corresponde a coordenadas anatómicas discretas. La lengua se deforma y se desplaza de manera compleja. Su posición interactúa, además, con otras propiedades, como el redondeamiento y el tamaño de la cavidad faríngea. Anterior y posterior son, por tanto, aproximaciones articulatorias útiles.
Redondeamiento
El redondeamiento de los labios es la tercera dimensión. En español, /o/ y /u/ son típicamente redondeadas, mientras que /i/, /e/ y /a/ no lo son. Otras lenguas combinan estas propiedades de otro modo. El francés y el alemán tienen vocales anteriores redondeadas, como la [y] del francés tu o del alemán über, que puede describirse como alta, anterior y redondeada. Esa vocal se parece a [i] en la posición de la lengua y a [u] en la configuración de los labios, lo que muestra que las dimensiones vocálicas son parcialmente independientes.
El cuadrilátero vocálico
Las vocales suelen representarse en un cuadrilátero, cuyo eje vertical representa aproximadamente la altura y cuyo eje horizontal representa la anterioridad. La tabla 9.1 ubica en él, de manera simplificada, las cinco vocales del español.
Tabla 9.1. Las vocales del español según la altura y la anterioridad
| Altura | Anterior | Central | Posterior |
|---|---|---|---|
| Alta | /i/ | /u/ | |
| Media | /e/ | /o/ | |
| Baja | /a/ |
El esquema permite visualizar relaciones; no debe leerse como un mapa anatómico literal de la lengua. El cuadrilátero es una abstracción descriptiva. La posición de una vocal en él resume una combinación aproximada de propiedades articulatorias y acústicas.
Vocales cardinales
Daniel Jones propuso a comienzos del siglo XX el sistema de vocales cardinales, un conjunto de puntos de referencia estandarizados para describir vocales de distintas lenguas (Ladefoged y Johnson, 2015). Las vocales cardinales no corresponden a las de ninguna lengua particular. Son referencias convencionales dentro del espacio articulatorio, que permiten decir, por ejemplo, que una vocal es más abierta que la [e] cardinal o más posterior que la [i]. Su utilidad está en que todos los descriptores comparten la misma referencia, si bien evaluar de oído las posiciones cardinales requiere entrenamiento y no reemplaza la medición acústica cuando se necesita precisión cuantitativa.
El espacio articulatorio es continuo
No existe una frontera física exacta en la que una vocal deje de ser [e] y se convierta en [ɛ]. Los símbolos fonéticos representan regiones o categorías dentro de un continuo, que dos lenguas pueden repartir de maneras distintas. El francés distingue, según la variedad, vocales medias de diferente grado de apertura, como en fée [fe] 'hada' y fait [fɛ] 'hecho'. El español general, en cambio, se analiza con una sola categoría /e/ que cubre parte de ambas regiones. La misma diferencia física puede distinguir palabras en una lengua y ser irrelevante en otra. La fonética describe el continuo; la fonología determina qué particiones usa el sistema.
La teoría de la fuente y el filtro
Para comprender acústicamente las vocales hay que volver al modelo de la fuente y el filtro (Fant, 1960). La fuente principal es la vibración de los pliegues vocales, que produce una señal compleja con una frecuencia fundamental y una serie de armónicos. El filtro es el tracto vocal, cuya forma modifica la amplitud relativa de esos armónicos y refuerza algunas bandas de frecuencia. Esas resonancias son los formantes. La identidad de una vocal depende en gran medida de la relación entre los primeros de ellos. Cuando se modifica la posición de la lengua y de los labios, se altera la geometría del tracto vocal y, con ella, sus resonancias (Stevens, 1998). La separación entre fuente y filtro es una aproximación de modelización, porque la señal laríngea, la configuración del tracto y su acoplamiento pueden interactuar. Aquí los formantes se usan como referencia. El texto LS-010 explica la presión, la frecuencia y la representación espectral en que se basa su medición.
Frecuencia fundamental y formantes
La frecuencia fundamental, o F0, se relaciona principalmente con la tasa de vibración de los pliegues vocales y contribuye a la percepción de la altura tonal. Los formantes, designados F1, F2, F3 y así sucesivamente, son resonancias del tracto vocal y contribuyen a la calidad vocálica. Una persona puede producir la misma vocal con distintas frecuencias fundamentales. Una [a] dicha con voz grave o aguda sigue reconociéndose como [a], porque cambia la F0 mientras las relaciones formánticas pertinentes permanecen en regiones compatibles con esa categoría (Johnson, 2012). Confundir la F0 con el F1 o el F2 es un error básico en fonética acústica.
Primer y segundo formantes
El primer formante se relaciona de manera aproximadamente inversa con la altura de la vocal. Las vocales altas, como [i] y [u], suelen tener un F1 bajo; las bajas, como [a], un F1 más alto. A mayor apertura, más alto es el F1. La relación no es una ley mecánica válida para todos los tractos vocales, pero es muy útil. Puede parecer contraintuitiva al principio, porque una vocal articulatoriamente alta tiene un F1 acústicamente bajo, lo que obliga a mantener separados los dos vocabularios.
El segundo formante se relaciona sobre todo con la anterioridad. Las vocales anteriores tienen un F2 más alto y las posteriores, uno más bajo. [i] y [u] son ambas altas y tienen un F1 bajo, aunque se distinguen claramente por el F2, alto en [i] y bajo en [u]. El redondeamiento también reduce las frecuencias formánticas, en especial el F2, de manera que este no mide solo la posición de la lengua. Las dimensiones articulatorias interactúan. Las relaciones entre formantes y articulación son, por eso, aproximaciones que el redondeamiento, la anatomía y el contexto modifican.
Representación de las vocales mediante F1 y F2
Las vocales pueden representarse en un gráfico con el F1 en un eje y el F2 en el otro. Por tradición, ambos ejes se invierten para que la distribución acústica se parezca al cuadrilátero articulatorio. En ese espacio, [i] aparece en la región de F1 bajo y F2 alto; [u], en la de F1 y F2 bajos; [a], en la de F1 alto y F2 intermedio. La representación permite comparar hablantes, dialectos, edades y estilos, siempre que se controlen las diferencias anatómicas. Un tracto vocal más largo produce frecuencias de resonancia más bajas; comparar valores absolutos entre hablantes puede exigir, por eso, normalización.
La tabla 9.2 reproduce los valores medios que Peterson y Barney (1952) obtuvieron en su estudio clásico del inglés estadounidense, con 33 hombres, 28 mujeres y 15 niños que pronunciaron diez vocales en palabras del tipo heed o who'd.
Tabla 9.2. Valores medios de F1 y F2, en hercios, de tres vocales del inglés estadounidense
| Vocal | Hombres F1 | Hombres F2 | Mujeres F1 | Mujeres F2 | Niños F1 | Niños F2 |
|---|---|---|---|---|---|---|
| [i] | 270 | 2290 | 310 | 2790 | 370 | 3200 |
| [ɑ] | 730 | 1090 | 850 | 1220 | 1030 | 1370 |
| [u] | 300 | 870 | 370 | 950 | 430 | 1170 |
Nota. Datos de Peterson y Barney (1952).
La tabla ilustra dos hechos. El primero es la relación entre formantes y articulación. En los tres grupos, [i] y [u] tienen un F1 bajo y se separan por el F2, mientras que [ɑ] tiene el F1 más alto. El segundo es la variación entre hablantes. Una misma vocal tiene valores más altos en las mujeres y todavía más en los niños, cuyos tractos vocales son más cortos; la [i] de un niño y la de un hombre difieren así en cerca de 900 Hz en su F2. Los oyentes reconocen, sin embargo, ambas como la misma vocal. Hillenbrand et al. (1995) replicaron el estudio con 45 hombres, 48 mujeres y 46 niños. Los oyentes identificaron casi siempre la vocal que el hablante quiso producir, pese a que una medición estática de los formantes separaba mal las categorías. La separación mejoraba mucho al incluir la duración y el cambio espectral a lo largo de la vocal.
Variación entre hablantes y dentro del mismo hablante
Los valores formánticos dependen de la longitud del tracto vocal, del tamaño de sus cavidades, de la edad y de otras características corporales. Dos hablantes pueden producir la misma categoría fonológica con valores absolutos distintos. El oyente compensa de algún modo esas diferencias para reconocer categorías estables. Este problema se conoce como normalización del hablante. La percepción debe extraer regularidades lingüísticas de señales físicamente variables.
Una misma persona tampoco produce una vocal idéntica en todas las ocasiones. La realización depende de la velocidad, del acento, de la posición en la palabra, de los sonidos vecinos, del énfasis, del registro, de la fatiga y de la emoción. Una /a/ acentuada y pronunciada con cuidado puede ocupar una región distinta de una /a/ átona en habla rápida sin dejar de ser reconocible. Una representación fonológica no equivale, por tanto, a una coordenada acústica exacta.
Reducción vocálica
En muchas lenguas, las vocales átonas tienden a desplazarse hacia regiones más centrales del espacio vocálico. El inglés es el ejemplo clásico, por la frecuencia de [ə], la vocal media central llamada schwa, que aparece por ejemplo en la primera sílaba de about. El español presenta comparativamente menos reducción en numerosas variedades, aunque existen fenómenos de centralización y debilitamiento en contextos específicos. En el español del centro de México y en el de los Andes, las vocales átonas en contacto con /s/ pueden ensordecerse o casi desaparecer, como en pesos o antes. La reducción depende de la estructura prosódica, de la velocidad, del dialecto y del estilo. La posición átona no produce, por tanto, el mismo efecto en todas las lenguas.
El sistema de cinco vocales del español
El sistema vocálico del español es simple frente al de lenguas que distinguen diez, doce o más calidades vocálicas. Los sistemas de cinco vocales son, de hecho, los más frecuentes entre las lenguas del mundo (Maddieson, 1984). Las cinco categorías tradicionales, /i e a o u/, forman una organización aproximadamente triangular, con dos vocales altas, dos medias y una baja. La distribución de las categorías puede investigarse con medidas de separación y con tareas perceptivas. La forma triangular del sistema no basta, sin embargo, para concluir que sea histórica o perceptivamente más estable que otro. Cinco vocales se refiere, además, al inventario fonológico básico. Las realizaciones fonéticas reales son numerosas.
Apertura contextual en español
La tradición fonética española describió durante mucho tiempo variantes más abiertas o más cerradas de /e/ y /o/ según el contexto (Quilis, 1993). Navarro Tomás (1918) describió, por ejemplo, una /e/ más abierta en contacto con la vibrante múltiple, como en perro. La fonética acústica permite estudiar empíricamente cuánto varían estas categorías y si las condiciones propuestas se cumplen en todas las variedades. El caso ilustra la relación entre las descripciones impresionistas tradicionales y las mediciones instrumentales. La tradición descriptiva formula una hipótesis y la instrumentación permite comprobar su magnitud y su consistencia. Las observaciones históricas conservan su valor, aunque requieren medición cuando es posible.
Monoptongos y diptongos
Un monoptongo mantiene una configuración relativamente estable durante su núcleo. Un diptongo presenta un cambio perceptible de calidad vocálica dentro de una misma sílaba, como en baile [ˈbai̯le], peine [ˈpei̯ne] o causa [ˈkau̯sa]. La transcripción exacta depende del análisis y del grado de detalle. Acústicamente, un diptongo muestra un movimiento del F1 y del F2 a lo largo del tiempo. Las vocales tampoco son puntos estáticos y pueden describirse como trayectorias en un espacio acústico.
Semivocales y aproximantes
Segmentos como [j] y [w] tienen propiedades articulatorias cercanas a las de las vocales altas y se comportan como consonantes en diversos contextos, como en tierra [ˈtjera] o cuatro [ˈkwatɾo]. [j] se aproxima articulatoriamente a [i] y [w] a [u]. La diferencia depende del grado de constricción, de la posición en la sílaba, de la duración y de la función fonológica. La frontera entre vocal y consonante tampoco es simple, porque las categorías se definen por conjuntos de propiedades y por su comportamiento estructural.
Vocales nasales
Una vocal puede producirse con el velo del paladar descendido, con lo cual parte del flujo acústico se acopla a la cavidad nasal. El AFI marca la nasalización con una tilde sobre el símbolo, como en [ã]. En español, la nasalización aparece fonéticamente por influencia del contexto, como en la vocal de mano, situada entre dos nasales, sin que la nasalidad sea allí contrastiva. En francés o en portugués, en cambio, la nasalidad distingue palabras, como el francés beau [bo] 'bello' y bon [bɔ̃] 'bueno', o el portugués lá 'allá' y lã 'lana'. Una misma dimensión articulatoria puede ser alofónica en una lengua y distintiva en otra.
Longitud vocálica
Las vocales pueden variar también en duración. En algunas lenguas, esa diferencia distingue palabras. El AFI representa la longitud con el signo [ː], como en [aː]. En finés, tuli 'fuego' se opone a tuuli 'viento'. El español no usa la longitud vocálica como contraste léxico independiente, si bien sus vocales duran más o menos según el acento, el ritmo, el énfasis y el contexto. La duración existe fonéticamente aunque no sea fonológicamente contrastiva.
Tipos de fonación
Las vocales pueden producirse con distintos ajustes laríngeos, como la voz modal, la voz murmurada, la voz laringealizada o el falsete. Algunas lenguas usan los tipos de fonación de manera contrastiva. El mazateco de Jalapa, en México, distingue vocales modales, murmuradas y laringealizadas (Ladefoged y Maddieson, 1996). En otras lenguas, estas propiedades aparecen como variación paralingüística, estilística o fisiológica. Que una voz suene de determinada manera no debe traducirse directamente en una emoción, porque la fonación es una propiedad acústica y fisiológica que participa en múltiples funciones.
Categorías perceptivas e influencia de la lengua materna
El oyente percibe categorías lingüísticas, no tablas de valores de F1 y F2. Puede identificar como la misma vocal dos señales acústicamente diferentes. La transformación de una señal continua y variable en categorías discretas depende de la distribución acústica, de la experiencia lingüística, del contexto, del hablante y de las expectativas. Aprender una lengua implica adquirir las fronteras categoriales pertinentes para esa comunidad.
Un hablante adulto puede tener dificultades para percibir contrastes vocálicos que su lengua materna no usa, sin que ello refleje un déficit auditivo general. Su sistema perceptivo aprendió a organizar el espacio acústico según categorías familiares. Un hispanohablante que aprende inglés puede asimilar al principio a su /i/ tanto la vocal de sheep como la de ship, que el inglés distingue. El fenómeno es importante en la adquisición de segundas lenguas y muestra que la percepción no es una lectura neutral de la acústica.
El problema de la normalización
La tabla 9.2 mostró que la [i] de un niño tiene valores formánticos absolutos muy distintos de los de la [i] de un hombre; el oyente, sin embargo, reconoce ambas como miembros de la misma categoría. Esa operación exige algún tipo de normalización. Diversos modelos proponen que el oyente compara los valores dentro del sistema de cada hablante, usa información contextual, aprende regularidades estadísticas o integra múltiples claves acústicas. No existe una solución teórica consensuada para todos los casos. La normalización muestra que la percepción fonética no se reduce a correspondencias simples entre frecuencias y categorías.
Medición de formantes
En el análisis acústico, los formantes se estiman con herramientas computacionales como el análisis por predicción lineal, conocido por la sigla inglesa LPC, los espectrogramas y el seguimiento automático (Harrington, 2010). La medición automática puede fallar. Los problemas frecuentes incluyen las voces con frecuencia fundamental alta, como las de muchos niños, en las que los armónicos quedan muy separados; los formantes muy próximos entre sí; el ruido y la mala calidad de la señal; las consonantes adyacentes; y los errores propios del algoritmo. El investigador debe inspeccionar, validar y corregir los valores y documentar sus criterios, porque la automatización no elimina la necesidad de juicio metodológico.
El momento de la medición también depende de la pregunta. Una estrategia habitual toma los valores cerca del centro temporal del segmento, donde la influencia de las consonantes vecinas suele ser menor. Esa estrategia no siempre es adecuada. Los diptongos exigen medir trayectorias, en las vocales muy breves el centro puede no corresponder a una región estable y los estudios de coarticulación buscan justamente los cambios a lo largo del tiempo. Hillenbrand et al. (1995) midieron, por ejemplo, el punto de mayor estabilidad y además los puntos situados al 20 %, al 50 % y al 80 % de la duración de cada vocal. Una medición sin hipótesis produce números que no se traducen necesariamente en conocimiento.
Normalización acústica
Al comparar hablantes pueden aplicarse métodos de normalización vocálica, que reducen las diferencias anatómicas y hacen visibles las lingüísticas (Thomas, 2011). Existen múltiples procedimientos. El de Lobanov (1971) transforma los valores de F1 y F2 de cada hablante en puntuaciones típicas, a partir de su media y su desviación estándar. Otros métodos usan los extremos del espacio vocálico de cada hablante. La elección del método puede modificar los resultados, así que un análisis serio debe especificar el método, su justificación y su efecto sobre los datos. La normalización es una decisión analítica con consecuencias sobre lo que se observa.
Vocales y alteraciones motoras del habla
Los trastornos motores pueden modificar la precisión de los objetivos articulatorios, la velocidad, la estabilidad y la amplitud de los movimientos. El resultado puede ser una centralización del espacio vocálico, en la que las realizaciones se agrupan hacia regiones centrales y dejan de alcanzar posiciones periféricas diferenciadas. El fenómeno puede reducir la inteligibilidad y se ha estudiado en diversas condiciones neurológicas y en las disartrias. La reducción del espacio vocálico no identifica, sin embargo, una etiología específica. Es una medida fonética, sin valor diagnóstico por sí sola.
Área del espacio vocálico
Una medida frecuente en investigación es el área del espacio vocálico, conocida por la sigla inglesa VSA. Se seleccionan vocales periféricas, como /i/, /a/ y /u/, para calcular el área del triángulo que forman en el plano de F1 y F2. Una reducción del área puede reflejar una menor diferenciación acústica y un habla menos precisa. La medida depende, sin embargo, de las vocales elegidas, del hablante, de la tarea, de la normalización y del número de emisiones analizadas. Dos áreas solo son comparables si se obtuvieron con el mismo conjunto de vocales, los mismos criterios de segmentación, la misma posición de medida y el mismo tratamiento de la variación entre hablantes. La normalización puede reducir la variación anatómica y eliminar también diferencias que formaban parte del fenómeno de interés.
La sensibilidad del VSA a la variación entre hablantes llevó a proponer medidas alternativas. Sapir et al. (2010) analizaron grabaciones de 38 personas con enfermedad de Parkinson y disartria y de 14 controles sanos. La razón de centralización de formantes, conocida por la sigla inglesa FCR, distinguió el habla disártrica de la sana y no resultó sensible al sexo del hablante, a diferencia del VSA. Todas las medidas registraron el efecto de un tratamiento intensivo del habla. Los autores presentaron sus resultados como preliminares.
Prosodia y calidad vocálica
Una voz puede sonar plana por la escasa variación de su F0, un fenómeno prosódico. Una vocal puede estar centralizada por cambios en su F1 y su F2, un fenómeno de calidad segmental. Ambos pueden coexistir sin confundirse. En la clínica, una expresión vaga como «habla monótona» puede ocultar si el problema está en la F0, en la intensidad, en el ritmo, en la calidad de la voz o en la articulación. La fonética permite descomponer el fenómeno en esos componentes.
Estado emocional y vocales
Las emociones pueden modificar la frecuencia fundamental, la intensidad, la velocidad, la articulación y los formantes. Las relaciones no son unívocas, porque un mismo estado emocional puede producir patrones diferentes en distintas personas. Variables como la medicación, el sueño, la edad, la enfermedad o el contexto pueden generar, además, cambios similares.
Scherer et al. (2016) analizaron automáticamente el espacio vocálico en entrevistas de cribado a 253 personas. Quienes superaban el punto de corte de cuestionarios autoaplicados de depresión o de trastorno de estrés postraumático tenían un espacio vocálico significativamente reducido, un resultado que se mantuvo al controlar variables demográficas y la velocidad de articulación. Los autores lo atribuyeron al enlentecimiento psicomotor. El hallazgo es una asociación de grupo obtenida con cuestionarios, sin entrevistas diagnósticas. No autoriza, por tanto, a leer en el espacio vocálico de una persona un marcador directo de una emoción o de un diagnóstico. El texto LS-015 examina con más detalle la evidencia sobre el habla en los trastornos psiquiátricos.
Los sistemas vocálicos cambian
Las vocales son particularmente útiles para estudiar el cambio lingüístico. Un cambio puede comenzar como un pequeño desplazamiento fonético y propagarse en una comunidad. Cuando varias vocales se desplazan de manera coordinada se habla de un cambio en cadena, como el que afecta a las vocales bajas del inglés de las ciudades del norte de Estados Unidos. La sociolingüística ha usado medidas formánticas para estudiar cambios generacionales, diferencias regionales e identidades sociales (Thomas, 2011). Una herramienta acústica puede conectarse así con procesos históricos y sociales, aunque la señal no contiene por sí sola la explicación social, que requiere datos sobre la comunidad, la edad, el estilo y las redes sociales de los hablantes.
Variación chilena
El español de Chile tiene, como cualquier variedad, patrones fonéticos propios. La producción de sus vocales varía según la región, la formalidad, la velocidad, la edad y el entorno consonántico. Las diferencias dialectales suelen ser más sutiles en las vocales que en consonantes como la /s/ o los róticos, aunque siguen siendo medibles. Los valores publicados para el español peninsular, el mexicano o el rioplatense no describen automáticamente a los hablantes chilenos; la fonética comparativa exige muestras específicas.
Vocales, reconocimiento automático, síntesis de voz y sesgo
Los sistemas de reconocimiento de voz deben aprender que una misma vocal puede ocupar regiones acústicas diferentes según el hablante y deben distinguir categorías muy próximas. Los modelos actuales usan representaciones mucho más complejas que el F1 y el F2, aunque los formantes siguen siendo útiles para análisis interpretables. Un sistema puede reconocer correctamente una palabra sin representar explícitamente el valor del F1 de su vocal. La descripción fonética humana, la representación interna del modelo y la salida del reconocimiento son, por tanto, cosas distintas.
En la síntesis de voz, producir vocales naturales exige controlar el espectro, la duración, las transiciones, la prosodia y la coarticulación. Una vocal aislada puede sonar correcta y una secuencia completa resultar artificial si las transiciones entre segmentos no son naturales. La naturalidad depende de trayectorias y de coordinación, lo que confirma que el habla no es una concatenación de sonidos estáticos.
Un sistema entrenado sobre todo con determinados acentos puede tener dificultades con otros. La variación vocálica es una de las fuentes posibles de error. Si el modelo asocia una categoría léxica demasiado estrechamente con una región acústica particular, puede fallar cuando esa región cambia de un dialecto a otro. La representatividad de los datos de entrenamiento importa, por eso, tanto técnica como éticamente, porque las diferencias normales de pronunciación no deberían convertirse en diferencias sistemáticas de desempeño. El texto LS-008 presentó evidencia de este problema en el reconocimiento de voz.
Cómo describir una vocal
Un procedimiento inicial puede seguir siete pasos. Los tres primeros establecen la altura, la anterioridad y el redondeamiento de la vocal. El cuarto examina si existe un acoplamiento nasal pertinente; el quinto, si la duración es fonética o fonológicamente relevante; el sexto, si hay propiedades laríngeas adicionales. El séptimo observa si la realización depende de los segmentos vecinos, del acento o de la posición. La descripción articulatoria resultante puede complementarse con mediciones acústicas, leídas con la regla aproximada de que un F1 más alto indica mayor apertura y un F2 más alto, mayor anterioridad.
Qué no debe inferirse de un valor formántico
Un valor de F1 o de F2 no permite concluir, por sí solo, el dialecto, la emoción, el diagnóstico, el sexo, la identidad social ni la intención de un hablante. Puede contribuir a una inferencia cuando se combina con la distribución de los datos, una población de referencia, el contexto y otras medidas. La medición acústica aumenta la precisión descriptiva sin volver automáticas las interpretaciones.
Integración con las lecturas anteriores
Esta lectura permite conectar varios conceptos del atlas. Las lenguas seleccionan subconjuntos del espacio vocálico disponible, lo que ilustra la noción de sistema de las lecturas LS-002 y LS-003. Las vocales forman alternativas contrastivas en una misma posición silábica y su realización depende de los segmentos vecinos, de modo que reproducen la relación entre paradigma y sintagma del texto LS-006. Una categoría fonológica admite múltiples ejecuciones. Las hipótesis articulatorias pueden, además, contrastarse con mediciones acústicas, como exige el texto LS-001 al separar el dato de la inferencia. La señal vocal transporta además, a la vez, información segmental, prosódica y paralingüística, lo que la acerca a la multimodalidad del texto LS-004. La fonética es el dominio del atlas en el que puede observarse con claridad cómo categorías abstractas se relacionan con datos físicos continuos.
Síntesis
Las vocales se producen mediante configuraciones del tracto vocal sin una obstrucción oral lo bastante estrecha para generar un cierre o una turbulencia. Su descripción articulatoria usa la altura, la anterioridad y el redondeamiento, dimensiones que definen un espacio continuo que cada lengua divide a su manera. El español usa un sistema fonológico de cinco vocales, cuyas categorías contienen una variación fonética considerable. La teoría de la fuente y el filtro explica cómo la configuración del tracto vocal modifica la señal generada en la laringe. La F0 corresponde principalmente a la actividad de la fuente y los formantes, a las resonancias del tracto. El F1 se relaciona aproximadamente con la apertura y el F2, con la anterioridad y el redondeamiento. El análisis de F1 y F2 permite representar cuantitativamente el espacio vocálico, comparar hablantes y estudiar la variación, aunque los valores absolutos dependen de la anatomía y del contexto y las comparaciones requieren controles y, a veces, normalización. La percepción convierte un continuo acústico en categorías aprendidas, cuya forma depende de la lengua materna. En la clínica, el espacio vocálico ayuda a describir la precisión articulatoria y las alteraciones motoras sin producir diagnósticos automáticos. En la inteligencia artificial, la variación vocálica plantea problemas de reconocimiento, de representación y de equidad entre acentos. Una categoría como /i/ no es una frecuencia, una posición anatómica ni una señal concreta. Es una unidad lingüística cuya realización abarca un rango de configuraciones articulatorias y de patrones acústicos reconocibles dentro de un sistema.
El texto LS-010 estudia la señal acústica del habla de manera más general, con sus ondas, su frecuencia, su amplitud, sus armónicos, sus formantes y sus espectrogramas, así como las relaciones entre la medición física y la percepción lingüística.
Referencias
Fant, G. (1960). Acoustic theory of speech production. Mouton.
Harrington, J. (2010). Phonetic analysis of speech corpora. Wiley-Blackwell.
Hillenbrand, J., Getty, L. A., Clark, M. J. y Wheeler, K. (1995). Acoustic characteristics of American English vowels. The Journal of the Acoustical Society of America, 97(5), 3099–3111. https://doi.org/10.1121/1.411872
International Phonetic Association. (1999). Handbook of the International Phonetic Association: A guide to the use of the International Phonetic Alphabet. Cambridge University Press.
Johnson, K. (2012). Acoustic and auditory phonetics (3.ª ed.). Wiley-Blackwell.
Ladefoged, P. y Johnson, K. (2015). A course in phonetics (7.ª ed.). Cengage.
Ladefoged, P. y Maddieson, I. (1996). The sounds of the world's languages. Blackwell.
Lobanov, B. M. (1971). Classification of Russian vowels spoken by different speakers. The Journal of the Acoustical Society of America, 49, 606–608. https://doi.org/10.1121/1.1912396
Maddieson, I. (1984). Patterns of sounds. Cambridge University Press.
Navarro Tomás, T. (1918). Manual de pronunciación española. Centro de Estudios Históricos.
Peterson, G. E. y Barney, H. L. (1952). Control methods used in a study of the vowels. The Journal of the Acoustical Society of America, 24(2), 175–184. https://doi.org/10.1121/1.1906875
Quilis, A. (1993). Tratado de fonología y fonética españolas. Gredos.
Sapir, S., Ramig, L. O., Spielman, J. L. y Fox, C. (2010). Formant centralization ratio: A proposal for a new acoustic measure of dysarthric speech. Journal of Speech, Language, and Hearing Research, 53(1), 114–125. https://doi.org/10.1044/1092-4388(2009/08-0184)
Scherer, S., Lucas, G. M., Gratch, J., Rizzo, A. S. y Morency, L.-P. (2016). Self-reported symptoms of depression and PTSD are associated with reduced vowel space in screening interviews. IEEE Transactions on Affective Computing, 7(1), 59–73. https://doi.org/10.1109/TAFFC.2015.2440264
Stevens, K. N. (1998). Acoustic phonetics. MIT Press.
Thomas, E. R. (2011). Sociophonetics: An introduction. Palgrave Macmillan.