La tesis que se presenta en este documento, se enmarca en el área del Reconocimiento Automático de Habla (RAH), que, básicamente, plantea como objetivo fundamental la transcripción automática de la señal de voz mediante máquinas, la conversión de habla en texto.
El habla es sin duda el método de comunicación más intuitivo y natural para los seres humanos. La Tecnología del Habla, en sentido general, está gozando de un interés cada vez más creciente por parte, no sólo de la comunidad científica internacional, sino de la sociedad en general y, entre ellas, el reconocimiento automático de habla presenta uno de los campos más atractivos de investigación.
Gracias a los tremendos avances en este campo, la imagen del ordenador HAL9000 en la película 2001: Una odisea del espacio, dirigiéndose a la tripulación con una voz de alta naturalidad e inteligibilidad y, sobre todo, atendiendo a las órdenes de aquélla, con conversaciones absolutamente espontáneas, se ve cada vez más cerca.
Hasta hace pocos años, los sistemas de reconocimiento automático de habla (SRAH) de mediana y gran complejidad (en cuanto a las tareas que abordaban), estaban disponibles casi únicamente como prototipos de laboratorio. En la actualidad, empresas como IBM, Philips, Lernout & Hauspie y Dragon Systems han abordado el terreno del mercado de gran consumo con productos de elevada calidad para dictado de textos, tanto en habla aislada como continua. Por otro lado, empresas como, por ejemplo, Telefónica I+D, Philips, Lernout & Hauspie, AT&T, Unisys, NUANCE, SpeechWorks, incluso IBM y Dragon Systems, ofrecen sistemas de suministro de información por línea telefónica de creciente habilidad para llevar a buen término un alto porcentaje de las solicitudes y transacciones requeridas por los usuarios; y cada día son más las empresas que abren (o crean) sus departamentos de I+D para explotar esta tecnología.
La intención fundamental de esta tesis es profundizar en varios puntos de importancia sobre los que no hay conclusiones claras y definitivas, a la hora de diseñar sistemas de reconocimiento de gran vocabulario.
De entrada, podemos pensar en varias aproximaciones al diseño inicial del sistema, a su arquitectura. Si nos centramos en el módulo de búsqueda, en nuestro caso, plantearemos dos líneas básicas: sistemas integrados, en los que el proceso de búsqueda utiliza simultáneamente todas las fuentes de información disponibles y suele hacerse en un único paso, con mecanismos de guiado; y sistemas no integrados, en los que la tarea se divide en sub-procesos de menor complejidad, accediendo cada uno de ellos a algunas de las fuentes de información disponibles. Los primeros presentan un mayor coste computacional, con la ventaja de producir, generalmente, mejores resultados; mientras que los segundos presentan el efecto contrario. En cada caso, se tratará de buscar el equilibrio entre ambos factores, como se discutirá más adelante. Igualmente se abordará el estudio de criterios de diseño en reconocedores multi-módulo.
En lo que respecta a detalles más concretos de implementación, en la literatura pueden encontrarse multitud de aproximaciones y enfoques para abordarlos. Un problema fundamental a la hora de estimar la bondad de una técnica determinada es que se suele presentar centrada en una tarea o aplicación concreta. Así, es difícil extrapolar hasta qué punto dicha técnica puede suponer mejoras sustanciales en otras de distinta configuración. En esta tesis, se pretenden abordar distintos sistemas y distintas tareas, sobre los que la experimentación de una serie de metodologías permitirá obtener conclusiones y claves de diseño para cada uno de ellos, con lo que se conseguirá una generalización más fundamentada de las bondades o perjuicios de cada uno.
También en ocasiones, algunas de las decisiones de diseño de los sistemas de reconocimiento automático de habla (SRAH) están basadas en criterios proporcionados por expertos humanos,
Capítulo 1. Introducción 1-38 fundamentadas en conocimiento lingüístico o en experiencia empírica previa. Las fuentes de información generalmente utilizadas suelen extraerse directamente de los datos de entrenamiento, pero detalles más concretos como, por ejemplo, el número y tipo de los modelos acústicos utilizados, la composición o derivación de los modelos léxicos, la topología usada en un modelo de Markov, o en una red neuronal, o el conjunto de parámetros generados por el preprocesador, son todos ellos muestras de decisiones y criterios definidos por el investigador o el ingeniero, de nuevo, basándose en un alto grado de conocimiento sobre la tarea, pero tratándose por tanto de fuentes de conocimiento estático (en el sentido de que son prefijados y no se modifican a partir de los datos de entrenamiento), en contraposición a, por ejemplo, los parámetros de los modelos acústicos generados.
En nuestro caso, será de interés lo que respecta a la selección de las unidades de reconocimiento y la selección de los esquemas alofónicos de las palabras del diccionario: en el idioma castellano, un sistema de conversión grafema-fonema proporciona una calidad razonable, pero es inviable en otros idiomas, debiéndose recurrir a extensos diccionarios de elaboración manual o, como mucho, semiautomática. En cualquier caso, incluso en castellano, no es razonable asumir ninguna pronunciación estándar como la única válida, si estamos pensando en extender el sistema para un conjunto amplio de usuarios (y, por tanto, de condiciones desconocidas en cuanto a acento, formación cultural, etc.).
Así, en esta tesis plantearemos soluciones que buscan la elaboración automática tanto del repertorio de unidades sub-léxicas, como de las entradas en los diccionarios de pronunciaciones de cada aplicación. En cada caso se buscarán soluciones dirigidas por datos (data-driven), es decir, las propiedades del sistema se aprenderán a partir de un conjunto de datos de entrenamiento; y también las basadas en conocimiento (knowledge-based), proponiendo la combinación de ambas como la solución más eficaz.
Profundizando en esta línea, y como tema lateral, se pretende estudiar con detalle el efecto real del incremento de tamaño del diccionario sobre el rendimiento de un sistema. Por una parte, en lo que a coste computacional se refiere (punto éste que enlaza con el que se comentará a continuación); y por otra en lo que atañe a tasa de reconocimiento, tratando de independizar al máximo dicha medida de las características intrínsecas del diccionario en sí, lo que llevará a conclusiones de interés sobre la independencia del vocabulario.
Un aspecto que no puede obviarse es la complejidad algorítmica que pone en juego un SRAH, ya que influye directamente en la posibilidad de llegar a su implementación en tiempo real, objetivo último desde un punto de vista de ingeniería. El aligerar la demanda computacional de cualquier proceso, permitirá avanzar en la aplicación práctica de técnicas cada vez más complicadas (y costosas) que aborden tareas de crecientes órdenes de dificultad. Así, en el desarrollo de esta tesis se hará énfasis en el análisis de algunas de las alternativas de optimización algorítmica, de reducción de complejidad y de reducción del espacio de búsqueda, estableciendo relaciones de compromiso entre coste y tasa, que es el binomio decisivo a la hora de abordar diseños de sistemas en tiempo real1.
Resumiendo, las ideas fundamentales en las que se centrará esta tesis son las siguientes: o Alternativas y rendimiento de arquitecturas integradas y no integradas del reconocedor.
Estudio de criterios de diseño en reconocedores multi-módulo
o Optimización algorítmica y reducción de complejidad
o Selección de las unidades de reconocimiento y selección del diccionario: múltiples
pronunciaciones.
1. Téngase en cuenta, de entrada, que el factor fundamental es la tasa de reconocimiento obtenida, de modo que la obtención de un sistema de calidad prima absolutamente sobre la obtención de un sistema veloz. Siempre se podrán plantear optimizaciones sobre un sistema caro computacionalmente, pero un sistema barato de entrada no garantizará nunca un rendimiento adecuado, o, como poco, la posibilidad de crecer en calidad (al menos fácilmente).
Apartado 1.2. Estructura del documento