• No se han encontrado resultados

3. Parámetros glóticos presentes en el estudio

3.6. Revisión del uso de parámetros glóticos en la detección de

La señal glótica, debido a su estrecha relación con el modo de vibración de los pliegues vocales ha sido analizada en el campo de la detección y clasificación de patología vocal, aunque la literatura existente es mucho menos abundante que la que se refiere al estudio de parámetros obtenidos directamente de la señal de voz.

Por otra parte, estos estudios trabajan generalmente con la fuente glótica o con su derivada, frecuentemente denominada residuo, siendo la obtención y el análisis de parámetros relacionados con la onda mucosa y la onda acústica promedio una novedad en el campo, aportada por nuestro grupo de investigación y recogida principalmente en (Gómez, P. et al, 2004d), (Gómez, P. et al, 2005b).

En (Alku, P., 2003) podemos encontrar un estudio en el que se describen algunos parámetros glóticos obtenidos mediante filtrado inverso de la señal de voz, y en el que se destaca que la obtención y utilización de estos parámetros puede ser útil en tres campos diferentes, aunque relacionados: la producción básica de la voz a través del

55

mayor conocimiento del origen de la misma es el primero de ellos, y puede derivar en cuestiones como el estudio de la intensidad vocal, del estado emocional del locutor o en investigaciones forenses como la identificación del locutor; el segundo campo que menciona el autor es precisamente la diagnosis y tratamiento de trastornos vocales; por último, los parámetros glóticos pueden ser de utilidad en el campo de la síntesis de voz.

Los parámetros analizados en (Alku, P., 2003) se dividen en tres categorías. En primer lugar aparecen, entre otros, los parámetros temporales OQ (Open Quotient),

SQ (Speed Quotient) y ClQ (Closing Quotient). El autor destaca la variación de estos

parámetros en función del género, de la fatiga vocal y de la intensidad de la fonación, entre otras variables. También propone un nuevo parámetro temporal denominado

Normalized Amplitude Quotient (NAQ), que resulta correlar fuertemente con el

parámetro ClQ siendo mucho más robusto que éste en presencia de ruido.

En segundo lugar, el trabajo estudia los denominados parámetros basados en la

amplitud, entre los que se incluyen el DC-offset (componente de señal continua

presente en la fuente glótica), el AC-flow (pico máximo de amplitud presente en la señal glótica, a partir del DC-offset) y el pico máximo de amplitud negativa presente en la derivada de la señal glótica (MFDR, Maximum Flow Declination Rate). Como en el caso anterior, el trabajo incluye relaciones de estos parámetros con los dos géneros y con la intensidad de la voz. También encuentra correlación entre el cociente del DC-

offset y el AC-flow con voces aspiradas, y entre el parámetro MFDR con

manifestaciones de hiperfunción vocal. Es conveniente destacar que para la obtención de los dos primeros parámetros es necesario obtener la señal glótica a partir del filtrado inverso de la señal obtenida en la boca (flujo de aire) mediante el uso de una máscara de Rothenberg (Rothenberg, M., 1973), (Hertegård, S. & Gauffin, J., 1992).

Por último, Alku estudia parámetros obtenidos en el dominio de la frecuencia, como la diferencia entre las amplitudes del primer y segundo armónico (H1-H2) o el parámetro HRF, definido como el cociente entre la suma de las amplitudes de determinado número de armónicos y la amplitud de la frecuencia fundamental. En el primer caso encuentra una alta correlación entre este parámetro y el parámetro temporal ClQ, y en el segundo analiza las diferencias de los valores del parámetro en función del tipo de fonación (ronca, normal o aspirada).

En (Orr, R., Cranen, B. & Jong, F.I.D., 2003) encontramos un estudio en el que también se utilizan parámetros glóticos, aunque en esta ocasión con un propósito diferente: el autor pretende comparar las medidas obtenidas a partir de la señal de voz con las obtenidas a partir del uso de una máscara de Rothenberg, bajo la hipótesis de que debería existir una fuerte correlación entre ambas.

Los parámetros escogidos para hacer la experimentación fueron la diferencia entre los dos primeros armónicos (H1-H2), una medida de la caída de la envolvente espectral (spectral slope), el cociente de velocidad (SP, Speed Quotient) y el cociente de apertura (OQ, Open Quotient).

Los resultados no confirmaron la hipótesis, no se encontraron correlaciones entre los parámetros obtenidos por las dos vías mencionadas. Es conocido que la señal de voz se puede estimar a partir de una derivada de primer orden de la señal de flujo aéreo en la boca (Flanagan, J.L., 1972), por lo que ambas señales recogen esencialmente la misma información, con la excepción de una componente de señal

56

continua presente en la fuente glótica. Por estas razones se esperaba, según los autores, que los parámetros medidos hubieran sido comparables, pero los estudios estadísticos realizados afirmaron lo contrario.

La explicación ofrecida involucra múltiples causas, una de ellas es la variabilidad interlocutor, que podría ser reducida formando grupos experimentales del mismo género, parecida edad, etcétera; otra posible causa para explicar los resultados es la variabilidad intralocutor, debida posiblemente a la incomodidad que provoca la máscara y a las propias limitaciones inherentes al uso de la misma: disminución de los primeros formantes y pérdida de información en altas frecuencias (Rothenberg, M., 1973), (Rothenberg, M., 1977), (Hertegård, S. & Gauffin, J., 1992), (Badin, P., Hertegård, S. & Karlsson, I., 1990).

En (Price, P.J., 1989) encontramos un trabajo centrado en el género y en los modos de pronunciación (voz normal, chirriante y entrecortada) que utiliza parámetros glóticos. Estos parámetros son el cociente de apertura, el denominado return quotient (medida relacionada con el máximo valor de cambio de flujo y con el flujo mínimo) y valores de energía recogidos en el dominio de la frecuencia.

El estudio cuenta con una base de datos de ocho locutores (cuatro masculinos y cuatro femeninos) que debieron realizar catorce pronunciaciones: diez normales, dos chirriantes y dos entrecortadas. Como conclusión principal se destaca el hecho que se encontraron diferencias tanto entre las pronunciaciones de ambos sexos como entre las pronunciaciones normales y las que no lo eran, y que ambos tipos de diferencias fueron similares en magnitud.

En (Kuo, J., Holmberg, E.B., & Hillman, R.E., 1999) se trabaja de manera combinada con parámetros acústicos clásicos procedentes de la señal de voz (en el dominio de la frecuencia, en este caso) y con parámetros glóticos extraidos a partir del uso de una máscara de Rothenberg. El trabajo se ocupa de estudiar, mediante análisis discriminante, los parámetros o conjuntos de los mismos que son capaces de distinguir mejor entre voces sanas y voces con presencia de nódulos en los pliegues vocales.

Los parámetros glóticos empleados fueron la presión subglótica, el flujo medio, el flujo mínimo, el pico máximo de amplitud de la señal glótica sin contabilizar la componente continua (AC flow), el cociente de apertura y el MFDR (Maximum Flow

Declination Rate).

Los resultados obtenidos indicaron que el uso combinado de todos los parámetros llevó a una tasa de acierto del 96%. Por separado, los parámetros glóticos alcanzaron el 95%, mientras que los parámetros acústicos clásicos sólo llegaron al 76%. Estudios más concretos concluyeron que la presión subglótica combinada con el cociente de apertura alcanza un 94% de tasa de acierto, constituyéndose ambos en los dos parámetros más importantes de los analizados.

Destacaremos también el trabajo de (de Oliveira Rosa, M., Pereira, J.C. & Grellet, M., 2000), en el que los autores extrajeron siete parámetros de la derivada de la fuente glótica, con el objetivo de estudiar cuáles de ellos discriminan mejor la presencia de patología vocal.

La base de datos utilizada constaba de 73 locutores, 48 de los cuales presentaron algún tipo de patología vocal. El número de patologías vocales contempladas fue

57

extenso, alcanzando las veintiuna. Entre ellas figuraban el carcinoma, el edema de Reinke, nódulos, laringitis y pólipos, entre otras.

Los parámetros empleados fueron los siguientes: MSR (Mean Square Residue, suma del cuadrado de la señal empleada), EX (Excess Coefficient, curtosis de la distribución de la señal), SFR y SFF (Spectral Flatness of Residue y Spectral Flatness of AR Filter, respectivamente, medidas relacionadas con la proporción de ruido presente en la señal), JITTER (perturbación de la frecuencia fundamental), PEAK (medida estadística relacionada con la frecuencia fundamental) y P/A (Peak of Autocorrelation, mediana del segundo pico de la autocorrelación normalizada de la señal).

Los parámetros fueron sometidos al test U de Mann-Whitney (Lehmann, E. L., & D'Abrera, H. J., 2006), y los resultados concluyeron que el parámetro que mejor discrimina es el JITTER, con un 54,79% de efectividad seguido del SFF, con un 52,52%. El peor parámetro fue el SFR, con un 36,41% de acierto. Los autores proponen, como trabajo futuro, un estudio estadístico multivariante que incluya los mejores parámetros, de cara a conseguir resultados más precisos.

Por último, mencionar que en (Lázaro-Carrascosa, C. & Gómez-Vilda, P., 2014) está publicado un breve resumen del trabajo realizado en esta tesis, esencialmente centrado en los resultados más importantes del análisis estadístico llevado a cabo. Además, en (Lázaro-Carrascosa, C. & Gomez-Vilda, P., 2015a) y en (Lázaro-Carrascosa, C. & Gomez-Vilda, P., 2015b) encontramos trabajos en los que se ha aplicado parte del protocolo de experimentación utilizado en esta tesis a un nuevo conjunto de parámetros, obteniendo resultados satisfactorios.

4. Patologías vocales, bases de datos y