# Prosodia, entonación, ritmo, organización temporal y prominencia en el habla

## Por qué la prosodia necesita un nivel propio

Los capítulos anteriores mostraron que el habla no se organiza solo mediante consonantes, vocales y sílabas. Existen también patrones de prominencia, de agrupación y de variación melódica que se extienden sobre unidades mayores. Ese dominio es el de la prosodia. Incluye el acento, la entonación, el ritmo, la duración, las pausas, la agrupación prosódica, las variaciones de frecuencia fundamental y la prominencia relativa. Estos componentes no pertenecen al mismo nivel teórico, porque algunos son propiedades fonéticas medibles y otros son categorías fonológicas o discursivas. Por eso el concepto de prosodia debe usarse con cuidado.

La prosodia participa en funciones muy diversas. Distingue palabras, marca límites, señala el foco, diferencia preguntas de afirmaciones, expresa actitudes, organiza los turnos, contribuye a la percepción de emociones y estructura la información. Una misma configuración prosódica no tiene, sin embargo, un significado universal. Un contorno descendente puede cumplir funciones diferentes según la lengua, la estructura gramatical y el contexto interactivo. La pregunta de este capítulo es cómo se organiza prosódicamente una secuencia de habla y qué información puede inferirse legítimamente de esa organización. La respuesta exige separar cuatro niveles, que son las propiedades acústicas, las categorías prosódicas, las funciones lingüísticas y las interpretaciones pragmáticas o afectivas.

## Qué significa suprasegmental

Un segmento corresponde aproximadamente a una consonante o a una vocal. Una propiedad suprasegmental se extiende sobre unidades mayores o no puede asignarse adecuadamente a un único segmento, como el acento, el tono, la entonación o el ritmo. La frecuencia fundamental cambia a lo largo de una palabra o de una frase, la duración organiza grupos completos y una pausa separa constituyentes. La prosodia actúa, así, sobre dominios que exceden el segmento, sin desconectarse de él, porque modifica su realización. Una vocal acentuada puede durar más y una consonante puede reforzarse en una frontera prosódica; prosodia y fonética segmental interactúan constantemente.

## Tres propiedades acústicas principales

La prominencia prosódica combina sobre todo tres propiedades. La frecuencia fundamental, estudiada en el capítulo 10, se relaciona con la periodicidad laríngea y con la percepción de la altura tonal. La duración permite alargar segmentos o sílabas. La intensidad aumenta la energía acústica. Participa también la calidad espectral. Ninguna regla universal identifica el acento con una mayor intensidad, porque cada lengua y cada contexto ponderan estas propiedades de manera distinta. La percepción de la prominencia surge de su combinación.

## Tono y lenguas tonales

En una lengua tonal, las diferencias de F0 distinguen palabras o morfemas, de modo que una misma secuencia segmental corresponde a significados distintos según su patrón tonal. El mandarín, cuyos cuatro tonos presentó el capítulo 5, el yoruba y muchas otras lenguas africanas y asiáticas usan el tono de manera léxica o gramatical (Gussenhoven, 2004). En ellas, el tono forma parte del sistema fonológico con el mismo rango que las consonantes y las vocales.

## Entonación y contorno de F0

La entonación comprende los patrones melódicos que se extienden sobre unidades mayores que el segmento y que participan en funciones discursivas, pragmáticas o gramaticales. En español contribuye a distinguir una afirmación de una pregunta total, como «Vienes» y «¿Vienes?», cuya sintaxis superficial puede ser idéntica. El patrón exacto depende de la variedad y del contexto. No existe una entonación interrogativa única para todo el español, como tampoco un sistema entonativo común a todas las lenguas (Hirst y Di Cristo, 1998; Jun, 2005).

Un contorno de F0 representa cómo cambia la frecuencia fundamental a lo largo del tiempo, con ascensos, descensos, mesetas, reinicios y movimientos locales. La F0 física no debe confundirse con categorías fonológicas como el tono alto, el tono bajo o el acento tonal. La fonología entonativa abstrae patrones sobre la señal, del mismo modo que la fonología segmental abstrae fonemas sobre las realizaciones.

## La fonología autosegmental-métrica

Uno de los marcos más influyentes para analizar la entonación es la fonología autosegmental-métrica, iniciada por Janet Pierrehumbert (Pierrehumbert, 1980; Beckman y Pierrehumbert, 1986) y sistematizada después en la síntesis de Ladd (2008). La melodía se representa como una secuencia de tonos abstractos, alto (H) y bajo (L), que se asocian a sílabas acentuadas o a fronteras prosódicas. Un asterisco indica la asociación con una sílaba prominente, como en H*, L* o L+H*; un signo de porcentaje marca un tono de frontera, como en L% o H%. La notación no copia la curva de F0. Representa categorías fonológicas que explican patrones recurrentes.

Un acento tonal, en inglés *pitch accent*, es un evento tonal asociado a una prominencia léxica o discursiva. L+H* puede corresponder, por ejemplo, a un ascenso asociado a una sílaba acentuada. El asterisco indica una asociación fonológica y no exige que el máximo acústico coincida con el centro de la sílaba. En español, el pico de F0 de los acentos que preceden al núcleo suele alcanzarse después de la sílaba tónica, un desplazamiento que la notación debe recoger (Prieto y Roseano, 2010). La alineación varía y debe medirse. Una etiqueta H o L tampoco fija una frecuencia universal, porque se interpreta dentro del rango del hablante y del sistema analizado. La notación debe derivarse de la evidencia lingüística y fonética. Ver una subida en la curva no basta.

Un tono de frontera puede señalar cierre, continuación, interrogación o dependencia. H% no significa, sin embargo, pregunta en todas partes. En el español del centro de España, las preguntas totales suelen terminar con un ascenso, mientras que en el de Puerto Rico suelen terminar con un descenso. El sistema de transcripción Sp_ToBI se desarrolló justamente para describir esa diversidad entre variedades (Prieto y Roseano, 2010). El significado prosódico es sistemático sin ser necesariamente biunívoco.

## La jerarquía prosódica

La prosodia organiza las unidades en dominios jerárquicos, que van de la sílaba al pie, a la palabra prosódica, a la frase fonológica y a la frase entonativa, como anticipó el capítulo 14 (Nespor y Vogel, 1986). Las teorías difieren en el número de niveles, en sus nombres y en sus criterios, aunque coinciden en que la estructura prosódica es jerárquica (Wagner y Watson, 2010). Una frase sintáctica puede coincidir parcialmente con una frase prosódica, sin que exista una correspondencia uno a uno.

Una frase fonológica agrupa palabras dentro de un dominio prosódico y puede condicionar procesos como la asimilación, el ajuste del acento o el alargamiento. Sus límites se relacionan con la sintaxis, aunque dependen también de la longitud, el foco, la velocidad y la planificación. La prosodia no es, por tanto, sintaxis pronunciada, porque tiene una organización propia. La frase entonativa corresponde a un dominio mayor, marcado por un tono de frontera, un alargamiento final, una pausa o un reinicio del tono. En «Cuando llegue Juan, empezamos», la frontera prosódica tras *Juan* ayuda a interpretar la estructura sintáctica, aunque la oración siga siendo comprensible sin ella.

## Foco y estructura informativa

El foco identifica la parte informativamente prominente de una expresión. A la pregunta «¿Quién compró el libro?», la respuesta hace prominente a *Juan*; a la pregunta «¿Qué compró Juan?», hace prominente *el libro*. La estructura sintáctica puede ser semejante mientras la prominencia cambia según la información pertinente. El foco puede ser estrecho, cuando recae sobre una unidad específica, o amplio, cuando abarca una estructura mayor, como en la respuesta a «¿Qué pasó?». La palabra prominente no es necesariamente la única información nueva. El análisis del foco requiere el contexto discursivo. No puede inferirse solo de la F0.

La respuesta focal no se implementa del mismo modo en todas las lenguas. En español, el orden de palabras, la alineación tonal y el escalamiento cooperan. El español tiende a situar el foco informativo al final de la oración, de modo que a «¿Quién compró el libro?» se responde con naturalidad «Lo compró Juan» (Zubizarreta, 1998). No debe importarse automáticamente el patrón inglés, que desacentúa todo el material posterior al foco. Los ejemplos escritos estipulan un contexto para comparar interpretaciones, sin demostrar qué contorno produjo un hablante real.

El foco contrastivo opone una alternativa a otra, como en «No compró el cuaderno; compró el libro». La prominencia activa un paradigma de alternativas pertinentes, el cuaderno y el libro, una relación que conecta con el eje paradigmático del capítulo 6. El contraste depende también de la sintaxis y del contexto.

## Entonación y tipo de enunciado

Las preguntas pueden expresarse mediante la sintaxis, mediante partículas, mediante la entonación o mediante una combinación de recursos. En español, las preguntas totales pueden usar movimientos de F0 distintos de los de las afirmaciones, con múltiples patrones dialectales, como mostraron los ejemplos del centro de España y de Puerto Rico. Las preguntas retóricas, las confirmativas y las de sorpresa tienen, además, contornos propios. La ecuación entre subida final y pregunta es una simplificación.

Una declarativa puede terminar con un descenso de F0, aunque no siempre. Puede mantener un tono alto para señalar continuación, conservar el turno o expresar incertidumbre, por lo que la categoría gramatical declarativa y la forma melódica no son equivalentes. La prosodia contribuye también a diferenciar una orden de una petición o de una sugerencia. «Siéntate» puede sonar autoritario, neutral o afectuoso con las mismas palabras. La interpretación cambia con la F0, la intensidad, la duración y el contexto. Ninguna firma acústica universal identifica la autoridad. La prosodia modifica la plausibilidad de una interpretación sin determinar infaliblemente la intención.

## Ritmo e índices de variabilidad

El ritmo describe patrones temporales recurrentes en la organización del habla, que dependen de las sílabas, los acentos, la duración, la reducción y la agrupación. El capítulo 14 examinó la clasificación tradicional de las lenguas en rítmicas silábicas, acentuales y moraicas, junto con las razones para tratarla con cautela. Las mediciones modernas muestran que las lenguas no se agrupan limpiamente en tres clases, porque el ritmo depende de la complejidad silábica, de la reducción vocálica, de la variabilidad consonántica y de los patrones acentuales. El inglés tiene sílabas muy variables y reducciones frecuentes, mientras que el español presenta vocales relativamente estables y una complejidad silábica media menor. Estas diferencias contribuyen a una impresión rítmica distinta, aunque el ritmo no es una propiedad única.

Los índices de variabilidad por pares de Grabe y Low (2002) tienen dos versiones que conviene distinguir. El índice no normalizado promedia las diferencias absolutas entre intervalos sucesivos y conserva la unidad de medida, por ejemplo los milisegundos. El índice normalizado divide cada diferencia por la duración media del par correspondiente, promedia esos cocientes y multiplica el resultado por cien. En una serie de tres intervalos de 100, 200 y 100 ms, el índice no normalizado vale 100 ms y el normalizado, unos 66,67. Si todas las duraciones se duplican, el primero sube a 200 ms y el segundo no cambia. Esa propiedad separa la variabilidad absoluta de la relativa, sin volver al índice inmune a la segmentación, a la tarea o a la composición fonológica del material. Ninguna de las dos versiones identifica por sí sola una clase rítmica natural.

## Pausas

Las pausas pueden ser silenciosas o llenas, como las que producen *eh*, *em* o, en muchas variedades americanas, *este*. Reflejan la planificación, los límites estructurales, la dificultad para encontrar una palabra o la toma de turno, sin tener un significado único. Una pausa de 500 ms puede ser trivial en una situación y muy notoria en otra, porque su posición importa tanto como su duración.

Las pausas tienden a aparecer en las fronteras entre constituyentes, como en «Después de la reunión, nos fuimos». Aparecen también dentro de una unidad cuando el hablante busca una palabra, se corrige o duda. Una pausa no marca, por tanto, una frontera sintáctica automática. La prosodia puede alinearse con la sintaxis sin reproducirla mecánicamente.

## Prosodia y emoción

La voz cambia con los estados emocionales. Se han estudiado sus asociaciones con la F0, el rango tonal, la intensidad, la velocidad y la calidad vocal. Los estados de alta activación suelen acompañarse de una F0 más elevada y de una intensidad mayor. Estas relaciones son probabilísticas y dependen del contexto. No existe un diccionario universal en el que una F0 alta signifique ansiedad, porque la misma modificación puede deberse al entusiasmo, al miedo, al esfuerzo, al estilo del hablante o a un ambiente ruidoso. La prosodia emocional requiere un análisis multivariado.

La activación y la valencia son dimensiones analíticas, no emociones discretas ni resultados que puedan leerse en una curva. Una hipótesis de investigación puede relacionar la activación con la F0 o con la intensidad, aunque su alcance depende de la tarea y de la población. Antes de generalizar hay que distinguir la voz actuada, la emoción inducida y la conversación espontánea. Scherer (2003) revisó los paradigmas de investigación de este campo, que separan la producción de la voz emocional, su reconocimiento por los oyentes y las inferencias que estos realizan. Advirtió, además, que buena parte de la evidencia procede de emociones actuadas. Los efectos específicos deben atribuirse a estudios identificados, nunca a la fórmula genérica de que la ciencia ha demostrado algo.

Que una emoción modifique la producción vocal y que un oyente la perciba son procesos distintos. El hablante puede producir un patrón que el oyente interprete de otro modo. La percepción depende de la cultura, de las expectativas y del contexto. La investigación debe distinguir qué se produce, qué se reconoce y con qué precisión.

## Prosodia y pragmática

La ironía puede usar una prosodia particular, aunque no existe una entonación irónica universal. Su interpretación depende de la discrepancia con el contexto, del contenido, del tono y de la relación entre los hablantes. Una prosodia exagerada puede facilitar la inferencia. La misma forma puede expresar humor, incredulidad o teatralidad. La pragmática integra múltiples señales.

La prosodia modifica también la percepción de la cortesía. «Pásame eso» puede sonar brusco, neutro o afectuoso, porque la F0, la duración y la intensidad interactúan con la relación, la cultura y el contexto. Un sistema automático de voz no puede, por eso, optimizar la cortesía ajustando un único parámetro acústico. En la conversación, ciertos contornos señalan que el hablante no ha terminado. Un ascenso o un mantenimiento tonal puede funcionar como señal de continuación. La toma de turno usa, además, la sintaxis, las pausas, la mirada y la respiración; la prosodia es una fuente entre varias en una interacción multimodal.

## Prosodia y conversación

Los participantes de una conversación anticipan cuándo puede terminar un turno a partir de la estructura sintáctica, el significado, la prosodia y la mirada. La prosodia contribuye con descensos, alargamientos y cierres rítmicos, aunque ningún rasgo aislado determina la transición. Un hablante puede terminar sintácticamente una frase y continuar. El capítulo 10 mostró que las lenguas comparten una tendencia a minimizar tanto el solapamiento como el silencio entre turnos. Cuando dos interlocutores comienzan a hablar a la vez, el solapamiento no implica necesariamente una interrupción agresiva, porque puede ser un apoyo, un completamiento, un error de predicción o una competencia por el turno. La prosodia ayuda a interpretar su función (Couper-Kuhlen y Selting, 1996), aunque un evento acústico no equivale a una intención interpersonal.

## Monotonía

En la clínica, la expresión «voz monótona» suele usarse de manera vaga. Puede operacionalizarse mediante el rango de F0, su desviación estándar, el número de movimientos tonales y la variación de la intensidad. Incluso una reducción objetiva de la variabilidad prosódica aparece en la depresión, la enfermedad de Parkinson, la esquizofrenia, la sedación y la fatiga; no es, por tanto, diagnósticamente específica. La medición mejora la descripción sin resolver la etiología.

## Manía y presión del habla

La manía puede asociarse con una velocidad elevada, turnos largos, pocas pausas y alta energía vocal, en un patrón heterogéneo. La presión del habla es una categoría clínica multidimensional que no equivale a superar un umbral de palabras por minuto. Integra la urgencia comunicativa, la dificultad para interrumpir al paciente y la continuidad del discurso. La acústica puede medir sus componentes, mientras que la categoría clínica exige interpretación.

## Depresión

La relación entre depresión y prosodia se ha estudiado durante décadas. Cummins et al. (2015) revisaron la literatura sobre el análisis del habla en la evaluación de la depresión y del riesgo suicida. Los estudios de grupo describen en la depresión una menor variabilidad de la F0, una velocidad de habla reducida y pausas más largas, junto con cambios en la calidad de la voz y en los formantes. La misma revisión señaló la heterogeneidad de las tareas, los idiomas y los corpus, los tamaños muestrales pequeños y la escasez de validaciones en muestras independientes. El capítulo 9 presentó un resultado de este tipo, la reducción del espacio vocálico asociada a síntomas depresivos autoinformados (Scherer et al., 2016).

Dos precauciones separan estos hallazgos de su uso clínico individual. La primera es que una asociación de grupo no indica cuánto se solapan las distribuciones de pacientes y controles. Una persona con valores atípicos puede no estar deprimida y una persona deprimida puede tener valores típicos. La segunda es que la velocidad, las pausas y la variabilidad de la F0 dependen también de la tarea, del idioma, de la medicación, de la gravedad, de la edad y del estado físico. Un estudio útil debe declarar esos factores y validar sus resultados fuera de la muestra en que se obtuvieron. Con la evidencia actual, ningún patrón de voz confirma ni excluye una depresión en un paciente concreto.

## Esquizofrenia

Parola et al. (2020) metaanalizaron 55 estudios con 1254 pacientes con esquizofrenia y 699 controles. Encontraron una reducción débil de la variabilidad de la F0, relacionada con el aplanamiento afectivo. Las diferencias eran mayores en la proporción de tiempo hablado, la velocidad de habla y las pausas, relacionadas con la alogia y el aplanamiento afectivo. Los efectos eran, sin embargo, modestos en comparación con los juicios perceptivos y clínicos. Variaban, además, mucho entre estudios. Las tareas con mayor exigencia cognitiva y social producían diferencias más grandes. En un corpus posterior con varias lenguas, el mismo grupo replicó la menor variabilidad de la F0 en todas ellas, mientras que el aumento de las pausas y la menor velocidad solo se replicaron en algunas (Parola et al., 2023).

Estos resultados muestran por qué la esquizofrenia no identifica por sí sola un mecanismo vocal. Un análisis debe distinguir la organización lingüística, la prosodia, la ejecución motora, los efectos de los antipsicóticos y las condiciones de la entrevista, sin reunirlos en una única medida de «voz esquizofrénica». Los patrones de grupo no son marcadores individuales. Su dependencia de la lengua y de la tarea obliga a validarlos en cada población antes de usarlos en la clínica.

## Síntesis de voz y prosodia emocional artificial

Una voz sintética natural necesita modelar la F0, la duración, la intensidad, las pausas y el ritmo, porque pronunciar bien cada fonema no basta. Una frase segmentalmente perfecta puede sonar artificial con una prosodia inadecuada. Los sistemas actuales aprenden patrones prosódicos a partir de grandes corpus, aunque controlar su significado pragmático sigue siendo más difícil.

Algunos sistemas generan voces etiquetadas como felices, tristes o calmadas, lo que plantea un problema. Las etiquetas emocionales simplifican dimensiones continuas y culturalmente dependientes. Un sistema entrenado con actores puede aprender, además, estereotipos vocales de las emociones, alejados de sus expresiones naturales. La evaluación debe distinguir la reconocibilidad de la emoción, la naturalidad de la voz y su autenticidad en situaciones reales.

## Detección automática de emociones

Los modelos de reconocimiento de emociones en el habla usan características como la F0, el espectro, la intensidad y el ritmo. Pueden obtener buenos resultados en bases de datos controladas, aunque generalizar a la conversación clínica real es difícil por el ruido, el idioma, el hablante, la calidad de la grabación y la ambigüedad de las etiquetas. Una precisión alta en un corpus actuado no garantiza utilidad clínica.

Un sistema que informa «tristeza: 78 %» puede crear una falsa impresión de objetividad. Esa salida depende del modelo, de las clases disponibles y de los datos de entrenamiento, sin corresponder a una medición directa de un estado mental. Es una clasificación probabilística de patrones acústicos respecto de etiquetas aprendidas. La interfaz debería comunicar esa incertidumbre.

## Cómo analizar una frase prosódicamente

El análisis puede seguir seis pasos. El primero segmenta las palabras, las sílabas y las pausas. El segundo mide la F0, con su nivel, su rango y sus movimientos. El tercero identifica las sílabas prominentes y el cuarto, las fronteras de cada unidad prosódica. El quinto relaciona esas unidades con la sintaxis y el sexto, con el contexto, para decidir qué función discursiva es plausible. La secuencia evita saltar de una curva de F0 a una interpretación psicológica. En «María compró el libro», la prominencia recae sobre *María* si la pregunta previa fue quién compró el libro y sobre *libro* si fue qué compró María. La señal prosódica cambia mientras la proposición básica se mantiene, porque lo que cambia es la información discursiva.

## Rango tonal y normalización por hablante

En una frase cuya F0 va de 100 a 180 Hz, la diferencia lineal de 80 Hz no es la mejor medida perceptiva, porque la altura tonal se percibe de manera aproximadamente logarítmica. La conversión a semitonos multiplica por doce el logaritmo en base dos del cociente entre la frecuencia máxima y la mínima. En este caso da unos 10,18 semitonos. La medida se acerca más a la percepción musical y prosódica.

Comparar directamente la F0 de dos hablantes puede ser engañoso. Si uno tiene una F0 media de 110 Hz y otro de 220 Hz, un ascenso de 30 Hz equivale a unos 4,2 semitonos en el primero y a unos 2,2 en el segundo. La normalización puede expresar los valores en semitonos respecto de la media de cada hablante, en puntuaciones típicas o en rangos relativos. La medida elegida debe corresponder a la pregunta.

## Significado prosódico, intención e inferencia

Una subida de F0 no contiene literalmente una interrogación. El significado surge de la categoría prosódica, de la estructura gramatical y del contexto. Una misma señal física puede cumplir funciones diferentes. El significado prosódico es, así, relacional, lo que conecta con Saussure. Depende también de la interpretación situada, lo que conecta con la pragmática. Bolinger (1986) insistió, además, en el carácter gradual y en parte afectivo del significado entonativo. La prosodia es un dominio donde estructura y contexto interactúan de manera especialmente visible.

Un hablante puede producir una entonación sin planificar conscientemente cada movimiento de F0. Puede expresar ironía sin formular internamente la decisión de usar un contorno irónico, porque la producción lingüística automatiza numerosos patrones. La función comunicativa no coincide, por tanto, con una intención consciente explícita.

Cuando alguien piensa que una voz suena triste, realiza una inferencia. La señal puede ser compatible con la tristeza y con otras causas. En términos de Peirce, cuya semiótica presentó el capítulo 2, es una forma de abducción, en la que un patrón observado sugiere una hipótesis que podría explicarlo y que necesita contrastarse. La prosodia no da acceso directo a la emoción. Aporta evidencia parcial.

## La prosodia en el conjunto del libro

La F0, la duración y la intensidad son propiedades físicas que la prosodia organiza lingüísticamente. Una curva acústica solo se convierte en acento, tono o frontera mediante un análisis del sistema, la misma relación entre fonética y fonología de los capítulos 7 a 13. El acento se asigna sobre sílabas, las frases prosódicas agrupan palabras y los límites prosódicos modifican procesos segmentales, lo que muestra una fonología jerárquica que integra segmento, sílaba, palabra y frase. La prosodia interactúa también con el gesto, la mirada y la postura. Una pregunta puede combinar un ascenso tonal, las cejas elevadas y la orientación hacia el interlocutor sin que ninguna señal aislada baste, lo que retoma la multimodalidad del capítulo 4 con una base acústica más precisa. La puntuación intenta, por último, representar parcialmente la prosodia, sin correspondencia exacta. Una coma escrita no siempre implica una pausa; una pausa oral puede no requerir coma, porque escritura y habla son sistemas diferentes.

## Síntesis

La prosodia organiza propiedades que se extienden sobre segmentos y sílabas, cuyas dimensiones acústicas principales son la F0, la duración y la intensidad. La entonación organiza contornos melódicos sobre unidades mayores. La fonología autosegmental-métrica los representa mediante tonos abstractos, acentos tonales y tonos de frontera. La prosodia tiene una estructura jerárquica que va de la sílaba a la frase entonativa. El foco modifica la prominencia y marca alternativas informativas, con recursos que en español incluyen el orden de palabras. La entonación contribuye a diferenciar declaraciones, preguntas, órdenes y continuaciones, sin una correspondencia universal entre contorno y función, como muestran las diferencias entre variedades del español. El ritmo depende de múltiples propiedades temporales y no se reduce a una clasificación simple de las lenguas. Las pausas tienen funciones estructurales e interaccionales sin un significado psicológico fijo. La prosodia emocional aporta información probabilística sobre estados y actitudes; no permite una lectura directa de la mente.

En la clínica, el rango de F0, las pausas y la velocidad describen componentes del habla. La evidencia sobre la depresión y la esquizofrenia muestra asociaciones de grupo modestas, heterogéneas y dependientes de la lengua y de la tarea, sin especificidad diagnóstica individual. En la inteligencia artificial, la síntesis y el reconocimiento prosódicos son necesarios para la naturalidad y la comprensión del contexto. Los clasificadores emocionales deben comunicar su incertidumbre. Una propiedad acústica correlacionada con una función lingüística o con un estado afectivo no es idéntica a ellos; el análisis prosódico debe separar, por eso, señal, categoría y significado.

El capítulo 16 cierra el bloque fonológico con una comparación de modelos y un análisis integrado, que contrasta reglas, representaciones, restricciones y variación sobre conjuntos de datos completos.

## Referencias

Beckman, M. E. y Pierrehumbert, J. B. (1986). Intonational structure in Japanese and English. *Phonology Yearbook*, *3*, 255–309.

Bolinger, D. (1986). *Intonation and its parts: Melody in spoken English*. Stanford University Press.

Couper-Kuhlen, E. y Selting, M. (Eds.). (1996). *Prosody in conversation*. Cambridge University Press.

Cummins, N., Scherer, S., Krajewski, J., Schnieder, S., Epps, J. y Quatieri, T. F. (2015). A review of depression and suicide risk assessment using speech analysis. *Speech Communication*, *71*, 10–49. https://doi.org/10.1016/j.specom.2015.03.004

Grabe, E. y Low, E. L. (2002). Durational variability in speech and the rhythm class hypothesis. En C. Gussenhoven y N. Warner (Eds.), *Laboratory phonology 7* (pp. 515–546). Mouton de Gruyter.

Gussenhoven, C. (2004). *The phonology of tone and intonation*. Cambridge University Press.

Hirst, D. y Di Cristo, A. (Eds.). (1998). *Intonation systems: A survey of twenty languages*. Cambridge University Press.

Jun, S.-A. (Ed.). (2005). *Prosodic typology: The phonology of intonation and phrasing*. Oxford University Press.

Ladd, D. R. (2008). *Intonational phonology* (2.ª ed.). Cambridge University Press.

Nespor, M. y Vogel, I. (1986). *Prosodic phonology*. Foris.

Parola, A., Simonsen, A., Bliksted, V. y Fusaroli, R. (2020). Voice patterns in schizophrenia: A systematic review and Bayesian meta-analysis. *Schizophrenia Research*, *216*, 24–40. https://doi.org/10.1016/j.schres.2019.11.031

Parola, A., Simonsen, A., Lin, J. M., Zhou, Y., Wang, H., Ubukata, S., Koelkebeck, K., Bliksted, V. y Fusaroli, R. (2023). Voice patterns as markers of schizophrenia: Building a cumulative generalizable approach via a cross-linguistic and meta-analysis based investigation. *Schizophrenia Bulletin*, *49*(Supl. 2), S125–S141. https://doi.org/10.1093/schbul/sbac128

Pierrehumbert, J. B. (1980). *The phonology and phonetics of English intonation* [Tesis doctoral, Massachusetts Institute of Technology].

Prieto, P. y Roseano, P. (Eds.). (2010). *Transcription of intonation of the Spanish language*. Lincom Europa.

Scherer, K. R. (2003). Vocal communication of emotion: A review of research paradigms. *Speech Communication*, *40*(1–2), 227–256.

Scherer, S., Lucas, G. M., Gratch, J., Rizzo, A. S. y Morency, L.-P. (2016). Self-reported symptoms of depression and PTSD are associated with reduced vowel space in screening interviews. *IEEE Transactions on Affective Computing*, *7*(1), 59–73. https://doi.org/10.1109/TAFFC.2015.2440264

Wagner, M. y Watson, D. G. (2010). Experimental and theoretical advances in prosody: A review. *Language and Cognitive Processes*, *25*(7–9), 905–945.

Zubizarreta, M. L. (1998). *Prosody, focus, and word order*. MIT Press.
