En este trabajo de tesis se presenta un modelo de arquitectura de sistema inteligente para la extracción de entidades (términos, que aparecen explícitamente en el texto, y conceptos, que no tienen por qué aparecer de forma explícita) y el acceso a información cross-lingüe, implementado para un dominio particular como es el biomédico. Esta implementación permite, entre otros, el acceso en línea a los usuarios finales que, utilizando un texto digital con contenido médico escrito en inglés o en español, pueden procesarlo automáticamente obteniendo entidades nombradas de interés extraídas del
24
texto y un conjunto de fuentes de información en ambos idiomas (fiables y de calidad) con las que obtener más información sobre los términos, así como sobre otros conceptos relacionados semánticamente. El sistema está provisto, además, de un servicio Web que puede ser explotado por otros sistemas informáticos.
La evaluación por usuarios de este sistema biomédico se ha consumado en el contexto educativo de educación superior con estudiantes del grado de Medicina, a través de una actividad de aprendizaje activo en la que concurren características de metodologías de aprendizaje como las basadas en casos, en problemas, en computadoras, en Internet y en Web. La actividad de aprendizaje se ha diseñado teniendo en cuenta los factores clave mencionados para conducir este tipo de metodologías activas, es decir, el proceso previo de selección de fuentes de conocimiento por expertos, la adecuación de la información al nivel de conocimientos de los estudiantes y la comparación con los resultados de la misma actividad utilizando una búsqueda tradicional en Internet. Por otro lado, ha sido necesario valorar la elección de los procesos computacionales incluidos en el sistema, así como una interfaz apropiada, para asegurar la usabilidad durante el transcurso de la actividad.
Tras esta introducción a los contenidos generales de la memoria, en el capítulo 2 se da una visión general del modelo de sistema propuesto, previa descripción del problema que se pretende resolver y de la situación actual, las principales motivaciones para su creación y los objetivos que se persiguen. El capítulo 3 está centrado en las estrategias utilizadas para la fusión de las diferentes fuentes de información biomédica, bajo la arquitectura general diseñada, destacándose tres grandes bloques directamente relacionados con la estructura modular del diseño: el primer bloque está dedicado al reconocimiento de entidades, que engloba dos de los módulos (dedicados al
25 preprocesado y la aplicación de técnicas de PLN); el segundo está relacionado con los métodos que se han empleado para proporcionar información sobre las entidades reconocidas en el texto; mientras que el tercer bloque describe el diseño de los mecanismos de acceso al sistema. El desarrollo técnico de cada uno de los componentes y elementos del sistema biomédico se muestra en el capítulo 4, que contiene un apartado por cada uno de los módulos de la arquitectura. En el capítulo 5 se realiza un análisis de un conjunto de casos de prueba que permiten conocer la respuesta del sistema biomédico al integrar diferentes fuentes de información y procesar diferentes textos de entrada, conocimiento que es necesario para valorar las debilidades y fortalezas del software en función de varios parámetros: las dimensiones de las terminologías utilizadas para reconocer las entidades; pros y contras de la integración de los procesos remotos incorporados; las capacidades para el preprocesado en tiempo real (en línea) de textos de diferentes longitudes. En el capítulo 6 se describe la experiencia de aprendizaje puesta en práctica con los estudiantes, analizándose en detalle todos los resultados obtenidos. El capítulo 7 está dedicado a la recopilación de cada una de las aportaciones realizadas y el cumplimiento de los objetivos planteados inicialmente. Por último, en el capítulo 8 se lleva a cabo una revisión de las posibles líneas de investigación futuras.
27
CAPÍTULO 2. MODELO DE SISTEMA INTELIGENTE.
1.
Descripción del problema
Tal y como se menciona en Feldman, & Sanger, (2007), de las cuatro estructuras de texto más utilizadas para caracterizar los documentos en los algoritmos de minería de texto (i.e. caracteres, palabras, términos y conceptos), destacan las basadas en términos y en conceptos, tanto por su capacidad para representar el contenido semántico como por la capacidad de hacerlo con un número menor de características, respecto a otras representaciones como las que se basan en caracteres o palabras. La diferencia fundamental entre la representación basada en términos y la basada en conceptos, radica en que en la primera los términos extraídos están compuestos de palabras que aparecen en el documento (lo que facilita las técnicas de extracción automáticas), mientras que, en la segunda, los conceptos extraídos no tienen por qué estar presentes de forma explícita (implicando mayor complejidad en las técnicas necesarias para su extracción).
Anotación basada en conceptos
Esta caracterización se lleva a cabo a través de anotaciones que son agregadas a los documentos, incluyendo meta-información que puede ser explotada por sistemas de PLN, extracción de información, recuperación de información, categorización de textos, etc. - ver, por ejemplo, en el dominio de la biología molecular Krallinger, & Valencia, (2005) o Wilbur, Rzhetsky, & Shatkay, (2006). Dado el ritmo actual de producción de nuevo conocimiento, la anotación manual de textos se está haciendo inviable, convirtiendo a las tareas de anotación automáticas en un elemento esencial para llevar a cabo
28
este tipo de procesos, tal y como se menciona en Baumgartner, Cohen, Fox, Acquaah-Mensah, & Hunter, (2007).
En particular, las tareas de anotación usando conceptos son utilizadas e investigadas en multitud de aplicaciones (Karimi, Zobel, & Scholer, 2012), estando incorporadas en diferentes subtareas de los procesos para la extracción y la recuperación de información. Por ejemplo: para dar soporte a sistemas de detección de enfermedades a partir de informes electrónicos de salud (Xu, Fu, Shah, Chen, Peterson, Chen, Mani, et al. 2011); en
Thompson, Iqbal, McNaught, & Ananiadou, (2009) se utiliza información sobre los conceptos biológicos para generar un corpus con información enriquecida; en Liu, Lu, Hao, & Liu, (2011) se utilizan conceptos de Wordnet y de la ontología Tagger para anotar textos cortos procedentes de sistemas que tratan de dar respuesta a consultas de usuarios; el sistema Essie (empleado en los motores de búsqueda de algunos de los sitios Web de la NLM), presentado en Ide, Loane, & Demner-Fushman, (2007),se utiliza para la expansión de los términos de las consultas, o, con un enfoque similar en
Matos, Arrais, Maia-Rodrigues, & Oliveira, (2010) donde se expanden las consultas utilizando conceptos relacionados con los genes que aparecen en el texto introducido por el usuario; en Baldoni, Baroglio, Patti, & Rena, (2011) se emplea la idea de conceptos emocionales para dar soporte al análisis de sentimientos y la minería de opiniones; en Embley, & Zitzelberger, (2010) se propone el enriquecimiento de los contenidos Web con metadatos relacionados con conceptos incluidos en ontologías; o en
Trieschnigg, Pezik, Lee, De Jong, Kraaij, & Rebholz-Schuhmann, (2009) donde se estudian diferentes mecanismos para la mejora de la clasificación de documentos utilizando la anotación automática con conceptos de MeSH.
29 Sistemas para el acceso inteligente a la información
Las investigaciones en el campo de estudio del acceso inteligente a la información están muy relacionadas con todas estas tareas que se acaban de esbozar en torno al procesamiento del lenguaje natural, la extracción de información, la recuperación de información y la minería de textos, entre otras (Armano, Gemmis, Semerano, & Vargiu, 2010). De forma general, este campo de estudio se refiere a aquellos desarrollos en los que se integran y hace uso de recursos implementados por otros grupos (Chen, & Li, 2010), dando lugar a utilidades que, basándose en las tecnologías semánticas, facilitan procesos como los llevados a cabo para el reconocimiento de conceptos o la anotación, agregando meta-información a partir de información desestructurada, así como en la aplicación de técnicas de procesamiento de lenguaje natural tales como el reconocimiento de entidades nombradas (Davies, Grobelnik, & Mladenić, 2009).
Ontologías
Las ontologías tienen un papel muy relevante en Inteligencia Artificial y en las ciencias de la computación en general con diferentes propósitos, tales como la gestión del conocimiento, la integración de datos y el soporte a la decisión (Bodenreider, 2008; Abecker, & Elst, 2009). Muchos de los sistemas, mencionados en el apartado anterior, utilizan ontologías como base de conocimiento del que extraer y sobre el que almacenar la información relacionada con el contenido semántico de los conceptos, convirtiéndose en un componente clave en los procesos de acceso a la información semántica de la Web y, más específicamente, en los procesos de anotación de los contenidos con meta-datos basados en ontologías, cuyo
30
uso está cada vez más extendido en el contexto de la Web semántica (Motik, Maedche, & Volz, 2002). Además, la incorporación de las ontologías en los sistemas de extracción de información facilita la actualización del conocimiento, al disgregarlo de otros componentes del sistema y actualizarse conjuntamente con la ontología, así como la portabilidad a otros dominios de conocimiento (Karkaletsis, Fragkou, Petasis, & Iosif, 2011).
Las ontologías biomédicas, tal y como se menciona en (Jonquet, Musen y Shah, 2010), son un elemento cada vez más utilizado a la hora de afrontar tareas de anotación en las investigaciones de biomedicina, permitiendo así una mejor integración de los datos y favoreciendo los descubrimientos traslacionales. Sin embargo, debido a la gran cantidad de ontologías y la heterogeneidad de formatos disponibles, cuando se desea hacer uso de los datos almacenados en las ontologías se encuentran dificultades cuya resolución normalmente requiere el consumo de mucho tiempo y recursos, como por ejemplo: decidir qué ontologías utilizar; seleccionar el modo en el que ensayar con las seleccionadas; el desarrollo o la selección de las herramientas necesarias para procesar los datos.
Gran parte del trabajo orientado a la generación de bases de conocimiento ontológico puede ser extremadamente útil para cubrir necesidades en el dominio biomédico. Gracias a la creciente proliferación de ontologías biomédicas y sin dominio específico, así como la existencia de servicios que permiten el acceso a la información que contienen, es posible crear sistemas de acceso inteligente a la información que integren conocimiento con el objetivo de facilitar y mejorar la comprensión de textos a los usuarios. Algunos ejemplos de ontologías utilizadas en el dominio biomédico son GO (Gene Ontology), MeSH (Medical Subject Headings), GALEN, UMLS (Unified
31 Medical Language System), SNOMED CT, ON9 y muchas otras (Gómez-Pérez, Fernández-López, & Corcho, 2004; Rubin, Shah, & Noy, 2008). Estas ontologías incluyen un amplio número de datos básicos sobre los conceptos médicos, tales como el tipo o la clase a la que pertenecen y cómo se relacionan (e.g. síntoma, enfermedad, tratamiento). Una descripción formal de la estructura interna de las ontologías se puede encontrar en Gruber, (1993) donde se identifican los siguientes elementos constituyentes: Clases (conceptos abstractos o concretos), Relaciones (asociaciones entre conceptos), Funciones (relaciones que admiten parámetros en su definición), Instancias (tópicos) y Axiomas formales (sentencias que siempre son ciertas).