Relaci´ on entre los propiedades y la construcci´ on: Teorema de Representaci´ on

5. Consolidaci´ on de ontolog´ıas Datalog ±

5.3. Relaci´ on entre los propiedades y la construcci´ on: Teorema de Representaci´ on

Hasta el momento hemos introducido las propiedades que se esperan de un operador de consolidación de ontolog´ıas Datalog±, presentando además una construcción posible para tal operador basada en el uso de Kernel Contraction. Estamos listos entonces para establecer la relación entre el conjunto de postulados para operadores de consolidación de

ontolog´ıas Datalog± y el operador de consolidación presentado. En lo que sigue denotare- mos con Υρ,%un operador de consolidación definido como en la Definición 5.6 dondeρy %

corresponden a funciones arbitrarias de incisi´on en restricciones y datos, respectivamente.

Teorema 5.1 (Teorema de Representaci´on) El operadorΥρ,%es un operador de con-

solidación de ontolog´ıas Datalog± basado en Kernel Contraction para una ontolog´ıa Datalog± KB si y sólo si satisface Inclusión, Exito para Restricciones,´ Exito pa-´ ra Datos, Vacuidad para Restricciones, Vacuidad para Datos, Optimalidad Local para Restricciones y Optimalidad Local para Datos.

Demostración: ver Apéndice A [página 199].

Es importante remarcar que, si bien no requerimos expl´ıcitamente que un operador de consolidaci´on de ontolog´ıas Datalog± produzca una ontolog´ıa consolidada coherente y consistente, del Teorema 5.1 se sigue que un operador como el presentado en la Defini- ci´on 5.6 satisface las requerimientos esperados de Coherencia y Consistencia.

Corolario 5.6 (Corolario del Teorema 5.1) El operador Υρ,% satisface Coherencia

y Consistencia.

Demostración: ver Apéndice A [página 204].

El Corolario 5.6 dice que el operador de consolidaci´on basado en Kernel Contraction como es introducido en la Definici´on 5.6 computa una ontolog´ıa consolidada coherente y consistente.

5.4. Ejemplo completo de consolidaci´on de ontolog´ıas

Datalog

En las secciones previas hemos introducido una construcción posible para un operador de consolidación de ontolog´ıas Datalog±. A continuación presentaremos un ejemplo completo (inspirado en uno similar introducido en [LMS12]) donde se detalla tal proceso.

Ejemplo 5.5 (Consolidaci´on de ontolog´ıas Datalog±) Supongamos que tenemos la siguiente ontolog´ıa KB (incoherente e inconsistente), la cual expresa la informaci´on que hemos podido recabar acerca del funcionamiento de cierta empresa.

KB =                                                                                                               

D: {a1 :jef e(walter), a2 :supervisa(walter, jesse),

a3 :toma desiciones(walter), a4 :toma desiciones(jesse),

a5 :supervisa(skyler, walter), a6 :empleado(walter),

a7 :a cargo de(jesse, distribution),

a8 :a cargo de(walter, cooking)

a9 :en huelga(mike)}

Σ_{N C} : {τ1 :obedece ordenes(X)∧toma desiciones(X)→ ⊥,

τ2 :supervisa(Y, X)∧supervisor(X)→ ⊥,

τ3 :ausente(X)∧en huelga(X)→ ⊥}

Σ_E : {ν1 :a cargo de(X, Y)∧a cargo de(X, Y0)→Y =Y0}

Σ_T : {σ1 :empleado(X)→es supervisado(X),

σ2 :es supervisado(X)→obedece ordenes(X),

σ3 :jef e(X)→obtiene ganancias(X),

σ4 :supervisa(Y, X)→supervisor(Y),

σ5 :supervisa(Y, X)→empleado(X),

σ6 :es supervisado(X)→toma desiciones(X),

σ7 :es supervisado(X)→tiene tarea(X),

σ8 :tiene tarea(X)→recibe paga(X),

σ9 :tiene tarea(X)→ ∃Y a cargo de(X, Y),

σ10 :en huelga(X)→ausente(X)}                                                                                                               

Ahora, para comenzar con la primer parte del proceso de consolidaci´on, esto es, con la resoluci´on de incoherencias por medio de hacer el conjunto Σ_T satisfacible, obtenemos los kernels de dependencias paraKB:

A continuación, debemos establecer el orden entre estas TGDs. Como hemos explicado previamente en la Sección 5.1.1, en nuestra definición de operadores de consolidación no introducimos una relación_l particular, sino que usamos una relación general abstracta. Sin embargo, para el presente ejemplo asumiremos que en el entorno de aplicación particular en el que se están usando los operadores tal relación es usada para modelar cuanta información se pierde cuando borramos alguna fórmula en la ontolog´ıa (midiendo esto como la cantidad de átomos que no pueden ser inferidos luego de la remoción), y la plau- sibilidad asociada a las fórmulas como desempate entre aquellas fórmulas que inducen la misma pérdida de átomos. Remarcamos, de todas formas, que esto es un simple ejemplo de cómo la relación _l puede ser definida; relaciones más complejas pueden ser usadas si las mismas son necesarias en entornos de aplicación particulares, ya que los operadores son definidos de forma independiente a la relación particular usada para seleccionar fórmulas para remoción. Comenzamos mostrando los átomos perdidos cuando se remueven TGDs, y luego introducimos los ordenes de preferencia entre las mismas.

Atomos que ya no pueden ser inferidos luego de remover σ2 :

{obedece ordenes(walter), obedece ordenes(jesse)}.

Atomos que ya no pueden ser inferidos luego de remover σ6 : ninguno.

Atomos que ya no pueden ser inferidos luego de remover σ10:{ausente(mike)}.

Luego, el orden para estas TGDs es σ6 lσ10lσ2. El comportamiento de la funci´on de

incisi´on en restricciones es el siguiente:

ρ({σ2, σ6}) ={σ6}

ρ({σ10}) = {σ10}

Por lo tanto, ahora podemos hacer Σ_T satisfacible (y por lo tanto KB coherente) elimi- nando del mismo las dos TGDs seleccionadas por ρ. A continuación, comienza la segunda parte del proceso de consolidación: la resolución de inconsistencias. Como fue explicado previamente, para esta parte el operador considera solamente TGDs que efectiva- mente pertenecerán a la ontolog´ıa final consolidada. Para el ejemplo en cuestión esto es Σ0_T = Σ_T \ {σ6, σ10}. A partir de aqu´ı sea KB? = (D,Σ0); basado en KB? calculamos los

⊥⊥(D,KB?) ={{a2, a4},{a3, a5},{a3, a6},{a2, a5}}

Siguiendo el enfoque utilizado para las TGDs, a continuaci´on introducimos la relaci´on

lparticular usada en este ejemplo para calcular el orden entre ´atomos. De esta manera,

la función de incisión en datos puede seleccionar para remoción átomos en los kernels de datos. Los átomos que no pueden ser inferidos luego de las remociones son:

Atomos que ya no pueden ser inferidos luego de remover

a2 : {supervisa(walter, jesse), supervisor(walter), empleado(jesse),

es supervisado(jesse), obedece ordenes(jesse), tiene tarea(jesse), recibe paga(jesse), a cargo de(jesse, n1)}.

Atomos que ya no pueden ser inferidos luego de remover a3 :

{toma decisiones(walter)}.

Atomos que ya no pueden ser inferidos luego de remover a4 :

{toma decisiones(jesse)}.

Atomos que ya no pueden ser inferidos luego de remover a5 :

{supervisa(skyler, walter), supervisor(skyler)}.

Atomos que ya no pueden ser inferidos luego de remover a6 : ninguno.

Ademas, asumamos que consideramos más plausible el átomo a3 que el átomo a4, y el

orden para los ´atomos en kernels de datos es entonces a6la4 la3 la5la2. Entonces,

tenemos que

%({a2, a4}) ={a4}

%({a3, a5}) ={a3}

%({a3, a6}) ={a6}

%({a2, a5}) ={a5}

Por lo tanto, usando un operador de consolidaci´on de ontolog´ıas Datalog± basado en Kernel Contraction como fue definido en la Definici´on 5.6 obtenemos la siguiente ontolog´ıa coherente y consistente:

Υρ,%(KB) =                                                                                           

D0 : {jef e(walter), supervisa(walter, jesse), a cargo de(jesse, distribution),

a cargo de(walter, cooking)

en huelga(mike)}

Σ0

NC : {obedece ordenes(X)∧toma desiciones(X)→ ⊥, supervisa(Y, X)∧supervisor(X)→ ⊥,

ausente(X)∧en huelga(X)→ ⊥}

Σ0_E : {a cargo de(X, Y)∧a cargo de(X, Y0)→Y =Y0}

Σ0

T : {empleado(X)→es supervisado(X), es supervisado(X)→obedece ordenes(X),

jef e(X)→obtiene ganancias(X), supervisa(Y, X)→supervisor(Y), supervisa(Y, X)→empleado(X), es supervisado(X)→tiene tarea(X),

tiene tarea(X)→recibe paga(X), tiene tarea(X)→ ∃Y a cargo de(X, Y)

                                                                                          

5.5. Conclusiones

En este cap´ıtulo hemos presentado un enfoque que posibilita la consolidación de ontolog´ıas Datalog±. Tal proceso está basado en las ideas de Hansson [Han94, Han99] de atacar conflictos m´ınimos conocidos como kernels, removiendo de los mismos fórmulas para resolver los conflictos. Además de atender conflictos de inconsistencia, los operadores definidos también se enfocan en el otro tipo de conflictos que pueden surgir en entornos ontológicos: la incoherencia. De esta forma puede verse a los operadores como unos que trabajan en dos fases: los mismos comienzan por resolver los problemas de incoherencia que aparezcan en la ontolog´ıa mediante la remoción de TGDs, para luego dar paso a la restauración de la consistencia a través de la eliminación de átomos del componente D. En ambos casos, las selecciones se hacen a través de funciones de incisión que deciden

qu´e remover en base a una relaci´on general _l, mirando para ello localmente en cada kernel en la ontolog´ıa.

Para caracterizar apropiadamente el proceso de consolidación de ontolog´ıas hemos introducido un conjunto de postulados, adaptando intuiciones introducidas para otros formalismos de representación de conocimiento por Hansson [Han94], Konieczny y Pino- Pérez [KP02], y Fuhrmann [Fuh97]. A tales propiedades las hemos aumentado con los postulados de Optimidad Local para Restricciones y Optimidad Local para Datos, los cuales son utilizados para enfocarnos en aquellas consolidaciones que minimizan la pérdida de información con respecto a_l, donde la misma es considerada localmente, esto es,para cada conjunto minimalmente inconsistente/incoherente. El conjunto básico de Postulados (OCP1-OCP7) versa entonces en diferentes aspectos de la consolidación de ontolog´ıas, desde requerir que nada sea agregado a la ontolog´ıa original hasta que aquello que no involucra conflictos sea retenido. Este conjunto básico de postulados implica a su vez ciertas otras propiedades. En particular, dos propiedades que se derivan del conjunto de postulados básicos y que son muy importantes a efectos del objetivo de los operadores de consolidación son los de Coherencia y Consistencia. Es importante remarcar que, como es tradicional en la teor´ıa de cambios, los operadores no se encuentran atados a las construcciones particulares que se presentan en la presente tesis, sino que son un aporte general a cualquier operador de consolidación de ontolog´ıas Datalog± (y que pueden ser incluso generalizados a otros lenguajes ontológicos con relativa sencillez). Es decir, cualquier operador de consolidación de ontolog´ıas Datalog± puede ser analizado a la luz de los postulados presentados, y no solamente aquellos introducidos en este trabajo. Por lo tanto, el conjunto de postulados introducidos corresponde un marco formal general del comportamiento de operadores de consolidación.

Luego de presentar los postulados que moldean el comportamiento de los operadores de consolidación de ontolog´ıas Datalog±, el el presente cap´ıtulo nos hemos dedicado a la definición de una clase particular de tales operadores, presentando para ello una cons- trucción completa que puede generarlos. Para ello primeramente procedimos a definir que corresponden con kernels de dependencias (conjuntos insatisfacibles de TGDs m´ınimos bajo inclusión conjuntista) y kernels de datos (conjuntos m´ınimos de átomos que hacen a la ontolog´ıa inconsistente). En particular, para los kernels de dependencias hemos de- mostrado que los mismos son independientes de la instancia particular del componenteD

mente interesante porque nos da la pauta de que el conjunto de kernels de dependencias de una ontolog´ıa puede ser obtenido sin considerar el componente D de la misma, lo que es de utilidad a la hora de separar la resoluci´on de incoherencias de la resoluci´on de inconsistencias.

Una vez que hemos identificado los kernels sobre los que aplicaremos las operaciones de contracción en pos de resolver incoherencias e inconsistencias, debemos establecer como tales problemas son resueltos. Para ello utilizamos funciones de incisión, que toman como argumento de entrada kernels de dependencias y kernels de datos y selecciona qué TGDs serán removidas de Σ_T y qué átomos serán removidos deD. Es posible definir funciones de incisión generales, que consideran al mismo tiempo tanto incoherencia como inconsistencia. Sin embargo, tal enfoque acarrea un problema:para hacer esto deber´ıamos calcular los kernels de dependencias y de datos y resolver los conflictos al mismo tiempo. Como se mostró el en Ejemplo 5.4, en la presencia de incoherencia esto puede no ser la mejor so- lución, al considerarlo a la luz de la pérdida m´ınima de información. Esto es generalizado por la Proposición 5.4 y por el Corolario 5.5, que establecen que para el caso de átomos relevantes a conjuntos insatisfacibles los mismos deben ser obligatoriamente eliminados por una función de incisión general, incluso cuando al mismo tiempo la función de inci- sión resuelve el problema de incoherencia que hac´ıa que el átomo relevante sea un kernel (resolviendo indirectamente la inconsistencia).

Para resolver tal situación es que hemos introducido una separación entre las funciones de incisión que trabajan sobre el conjunto de TGDs de una ontolog´ıa de aquellas que se encargan de la remoción de átomos de la misma. En base a tal separación definimos a los operadores de consolidación de ontolog´ıas Datalog± como aquellos que utilizan una función de incisión en restricciones sobre el componente Σ y una función de incisión en datos sobre D. Se puede considerar que tales operadores trabajan en “fases” separadas: primero se resuelven todos los problemas de incoherencia, y luego la resolución de inconsistencias se hace sobre la ontolog´ıa intermedia obtenida mediante la remoción de TGDs. Es decir, por un lado, las TGDs son removidas de Σ (solamente TGDs, ya que los kernels de dependencias no contienen EGDs ni NCs). Por el otro lado, como la función de incisión en datos usa la ontolog´ıa intermediaKB? en lugar de KB entonces sólo átomos deD que estén en conflicto con Σ\ρ(KB) son removidos, ya que los kernels de datos son calculados en base a las restricciones obtenidas luego de aplicar sobre Σ la función de incisión en restricciones.

Por último, hemos establecido la relación entre los postulados y la construcción presentada a través de un teorema de representación, el cual establece que la relación biun´ıvoca entre el conjunto de postulados OCP1-OCP7 y la construcción en base a funciones de incisión. La importancia de tal resultado es que determina que cualquier construcción que satisfaga tales postulados se corresponderá necesariamente con los operadores presentados en este cap´ıtulo, y por lo tanto los resultados de esos operadores pueden ser obtenidos por nuestra construcción.

Refinamiento del proceso de

consolidaci´on de ontolog´ıas Datalog

±

En el Cap´ıtulo 5 hemos introducido un proceso novel para la consolidación de ontolog´ıas Datalog±. Tal operador posee varias propiedades que hacen que la ontolog´ıa final obtenida del proceso de consolidación tenga las caracter´ısticas deseadas de coherencia y consistencia. Sin embargo, el proceso introducido puede ser refinado cuando consideramos el aspecto de m´ınima pérdida de información, el cual es un concepto muy arraigado a la teor´ıa de cambio de creencias. Como veremos en el presente cap´ıtulo, un operador basado en Kernel Contraction puede inducir remociones innecesarias de fórmulas. En el presente cap´ıtulo de la tesis elaboramos sobre los operadores ya introducidos para conseguir una variante optimal (respecto de pérdida de información) de los mismos, los operadores de consolidación de ontolog´ıas Datalog± basados en Cluster Contraction.

6.1. Necesidad de refinamiento

A continuación analizaremos el comportamiento de los operadores introducidos en el Cap´ıtulo 5 a la luz de una nueva perspectiva, la (excesiva) pérdida de información. Pa- ra esto miraremos en mayor detalle el ejemplo del comportamiento de tales operadores presentado previamente, poniendo de evidencia tal debilidad. Una vez que hayamos establecido claramente la situación que queremos evitar procederemos a proponer una nueva propiedad para los operadores de consolidación de ontolog´ıas Datalog±, la que una vez satisfecha asegura que tal situación no sucede.

6.1.1. Problemas asociados a la consolidaci´on basado en Kernel

Contraction

A pesar de obtener una ontolog´ıa final coherente y consistente, los operadores introducidos en el Cap´ıtulo 5 tienen una importante desventaja: incluso cuando el operador sólo selecciona una fórmula por cada kernel, bajo ciertas condiciones el operador puede remover más fórmulas de las absolutamente necesarias para obtener una ontolog´ıa adecuadamente consolidada.

Para ver tal situación consideremos nuevamente el comportamiento del operador de consolidación de ontolog´ıas Datalog± basado en Kernel Contraction en el Ejemplo 5.5 de la Sección 5.4. En tal ejemplo se puede ver que el proceso de consolidación presentado tiene ciertas fallas y puede ser refinado. Centremos la atención en los kernels de datos en el ejemplo, y como los distintos problemas de consistencia son finalmente resueltos; claramente ciertas remociones efectuadas por el operador son innecesarias. Por ejemplo, considere los kernels de datos {a2, a5} y {a3, a5}. Como en el orden entre conjuntos de

atomos tenemos que a3l1a5l1 a2, para el primer kernel la funci´on de incisi´on en datos

remueve el ´atomoa5, mientras que para el segundo kernel remueve a3, lo que ciertamente

es innecesario ya que la inconsistencia que surg´ıa del segundo kernel ya está resuelta si decidimos removera5 para resolver el conflicto en {a2, a5}. Es más, el átomo a3 se pierde

en el proceso de consolidaci´on porque el mismo no puede ser generado por la aplicaci´on de ninguna de las TGDs remanentes al considerarlas con la base de datosD obtenida.

6.1.2. Una propiedad adicional: la m´ınima p´erdida de informa-

ci´on

Para paliar la situación presentada comenzaremos expandiendo el conjunto de Postula- dos presentados previamente con uno adicional que expresa formalmente nuestra noción de m´ınima pérdida de información para operadores de consolidación de ontolog´ıas Datalog±, que luego servirá de gu´ıa para el desarrollo de una nueva construcción que cumpla con la misma. La propiedad que se espera sea satisfecha por un operador optimal (en el sentido de m´ınimo cambio) es la de M´ınima Pérdida de Información.

(M´ınima P´erdida de Informaci´on): Si KB0 ⊆ KB es coherente y consistente, entonces se verifica que Υ(KB)6⊂KB0.

No existe una ontolog´ıa coherente y consistente obtenida a partir de la ontolog´ıa original que contenga estrictamente a la ontolog´ıa consolidada.

La intuición detrás del postulado es que un operador de consolidación que lo satisface nos dará como resultado una ontolog´ıa tal que si agregamos cualquiera de las fórmulas eli- minadas entonces laKB resultante ser´ıa incoherente o inconsistente; es decir, el operador realizó una cantidad de cambios m´ınima en la resolución de conflictos.

6.2. Operador de consolidaci´on basado en Cluster

Contraction

Es claro que un operador de consolidación como el definido en la Definición 5.6 no logra satisfacerM´ınima Pérdida de Información. Por ejemplo, considerando Υ(KB) =

{D0,Σ0}en el Ejemplo 5.5 (esto es,la ontolog´ıa consolidada obtenida finalmente) tenemos que {Υ(KB)∪ {a3}} ( KB es coherente y consistente. A su vez, claramente Υ(Ψ) (

{Υ(Ψ)∪ {a3}}, y la pérdida de información es mayor de la necesaria en la resolución de

conflictos de (en este caso) consistencia.

La razón detrás de la no minimalidad del operador presentado anteriormente es el uso de kernels de manera aislada, sin tener en cuenta aquellas ocasiones donde los conflictos minimales están en una relación de “colisión”. A continuación presentamos un refinamien- to del proceso de consolidación basado en Kernel Contraction introducido previamente cuyo objetivo es satisfacer el requerimiento de m´ınimo cambio atacando la fuente de tales problemas. Para lograr esto definimos un nuevo operador de consolidación que satisface tanto el principio de M´ınima Pérdida de Información como las propiedades de

Coherencia y Consistencia presentadas en el Cap´ıtulo 5.

6.2.1. Clusterizaci´on

Como anticipamos, la base del refinamiento propuesto al uso de kernels se basa en la detecci´on de aquellos que se relacionan entre ellos de alguna forma. Para lograr esto, en lugar de realizar incisiones sobre kernels el nuevo operador realiza las mismas sobre

como la base para el manejo de inconsistencias en [LMS12, MPP+14]. La estructura de los clusters hace posible identificar conflictos relacionados para de esta forma encarar una resolución más global teniendo en cuenta tal relación. Los clusters son obtenidos a través de una relación de solapamiento (overlapping) entre kernels.

Definici´on 6.1 (Solapamiento, Equivalencia) Sea L un lenguaje de primer orden,

R ⊂ L un esquema relacional y LR el sublenguaje generado por R. Dados A ⊂ LR y B ⊂ LR, decimos que los mismos se solapan, denotado A θB, si y s´olo si AT

B 6=

∅. Adicionalmente, dado un conjunto de conjuntos de f´ormulas de primer orden M ⊂

2LR _{denotamos por} _θ∗

M la relaci´on de equivalencia obtenida sobre M a trav´es del cierre transitivo y reflexivo de θ.

Mediante la explotaci´on de la relaci´on de solapamiento entre kernels de dependencias y datos podemos definir losclusters de dependenciasy losclusters de datos, respectivamente.

Definici´on 6.2 (Clusters de dependencias) Sea KB = (D,Σ) una ontolog´ıa Datalog±, y ⊥⊥(Σ,KB) el conjunto de kernels de dependencias para KB. Sea θ la relaci´on

de solapamiento, y K =⊥⊥(Σ,KB)/θ∗_⊥_⊥

(Σ,KB) el conjunto cociente para la relaci´on de equi-

valencia obtenida sobre⊥⊥(Σ,KB). Un cluster de dependenciases un conjunto X = S

Y∈[κ]

Y, donde[κ]∈ K. Denotamos por⊥⊥⊥(Σ,KB) el conjunto de todos los clusters de dependencias

de KB.

In document Consolidación de ontologías Datalog+ (página 136-200)