• No se han encontrado resultados

Resultados para la selección y ponderación de vecinos en Foursquare

6. Evaluación de Estrategias Combinadas

6.1.1. Resultados para la selección y ponderación de vecinos en Foursquare

En esta sub-sección presentamos los resultados obtenidos utilizando el conjunto de datos de Foursquare. A partir de estos datos, fue posible derivar dos tipos de matrices de preferencias, las cuales fueron utilizadas para evaluar el comportamiento de las combinaciones de estrategias. En primer lugar se muestran los resultados experimentales de las estrategias evaluadas según la mé- trica del error en la estimación (MAE) en la matriz de preferencias basadas en las visitas, luego los relacionados a la matriz de preferencias extraídas de los tips y en tercer lugar se realiza un análisis donde se consideran los demás aspectos de evaluación (número de usuarios involucrados

en la creación del vecindario y cobertura).

6.1.1.1. Resultados en la matriz de preferencias basada en visitas

La Figura 6.1 muestra los resultados experimentales obtenidos para la estrategia de selección de vecinos derivada del grafo social (relación social nivel 1, nivel 2 y nivel 3) y la ponderación a través de los scorings propuestos. Según se observa, la selección de vecinos realizada a través de la relación directa de amistad (nivel 1) y en combinación con cualquier scoring no genera mejoras en la etapa de estimación de preferencias ya que en su mayoría se obtuvieron errores por arriba a los obtenidos por la línea base. Sin embargo, se observa que en vecindarios de ta- maño 5, existen ciertos scorings con igual desempeño que la línea base. Con respecto al nivel 2 es decir una relación de amistad indirecta (amigos de mis amigos), se observa que ponderar a estos vecinos por los scorings s1, s2, s8, s9 o s10, es decir dar mayor confianza aquellos vecinos según sus coincidencias en la discretización de la matriz de preferencias (s1 y s2) o según su relación en el grafo de visitas comunes (s8, s9 y s10), se obtiene menor error en la estimación en comparación con la línea base. Este comportamiento se observó para tamaños de vecindarios superior a 30 usuarios. Luego también para este mismo nivel de red social, se observa que to- mando un vecindario de tamaño 5 y a diferencia de s14 todos los otros scorings obtuvieron un buen desempeño en términos del error en la estimación de preferencias. Por último, obteniendo vecinos potenciales de la red social a nivel 3, es decir que se van a considerar una mayor canti- dad de usuarios para generar el vecindario, se observa que ponderar a los vecinos seleccionados con los scorings propuestos produce resultados similares a lo ocurrido en el nivel 2, donde se volvieron a destacar s1 y s2 como también s8, s9 y s10 en vecindarios de tamaños superiores a 100 usuarios.

La Figura 6.2 muestra los resultados experimentales obtenidos para la estrategia de selección de vecinos derivada del grafo de visitas comunes (relación visitas comunes nivel 1, nivel 2 y ni- vel 3) y la ponderación a través de los scorings propuestos. Según se observa en la selección de vecinos realizada a través de la relación directa de visitas comunes, es decir sólo se consideran potenciales vecinos aquellos usuarios que coincidieron en algún lugar con el usuario objetivo, proporciona cierta mejoras al ponderar con los scorings s1 y s2 en tamaños de vecindarios supe- riores a 20 usuarios. En vecindarios de tamaño 5 o 10 usuarios, siempre la ponderación con los scorings produjeron errores mayores a lo producido por la línea base. A su vez, la selección de vecinos realizada a través de la “Red visitas (nivel 2)”, los resultados mostraron una tendencia similar al nivel 1, donde en vecindarios de tamaño superior a 20 usuarios se volvieron a desta- car s1 y s2. Con respecto a la selección de vecinos realizada con el nivel 3 de la red de visitas comunes, se observó que el comportamiento de los scorings combinado con esta estrategia de selección tiende a aproximarse a la línea base y al igual que en los otros niveles se destacan los scorings s1 y s2.

Figura 6.1: Resultados experimentales para selección en red social y ponderación según los scorings en la matriz de preferencias basadas en las visitas

Red social(nivel 1) Red social(nivel 2) Red social(nivel 3)

5 10 20 30 50 100 150 200 250 300 5 10 20 30 50 100 150 200 250 300 5 10 20 30 50 100 150 200 250 300 0.0 0.2 0.4 0.6 0.8 Cantidad vecinos MAE Linea base s1 s2 s3 s4 s5 s6 s7 s8 s9 s10 s11 s12 s13 s14 s15

Figura 6.2: Resultados experimentales para selección en red de visitas y ponderación según scorings en la matriz de preferencias basadas en las visitas

Red visita(nivel 1) Red visita(nivel 2) Red visita(nivel 3)

5 10 20 30 50 100 150 200 250 300 5 10 20 30 50 100 150 200 250 300 5 10 20 30 50 100 150 200 250 300 0.0 0.5 1.0 1.5 Cantidad vecinos MAE Linea base s1 s2 s3 s4 s5 s6 s7 s8 s9 s10 s11 s12 s13 s14 s15

según estado o condado combinada con las estrategias de ponderación o scorings propuestas. Se observa que los errores tienden a estabilizarse aproximándose más a la línea base a medida que se incrementan la cantidad de vecinos al momento de estimar las preferencias. Este comportamiento en general es similar para todos los scorings en las dos opciones de la estrategia de selección (Estado o Condado). Luego según la selección realizada por “Condado”, es decir considerando usuarios que son del mismo condado que el usuario objetivo y ponderarlos con los scorings s1 o s2 generan los mejores resultados en términos del MAE, ya que independientemente del tamaño de vecindario seleccionado los errores estuvieron por debajo de la línea base y de los demás scorings. Además se observa que para vecindarios de tamaño menor a 100 usuarios se destaca s10, produciendo MAE ligeramente menores que la línea base. También se destaca el mal desempeño de s14 (ponderar a los vecinos según las coincidencias temporales) ya que a partir de tamaños de vecindarios mayor a 20 usuarios los errores producidos están por arriba de la linea base y de los demás scorings. En lo que respecta a los demás scorings, éstos en general obtuvieron errores ligeramente superiores al de la línea base. En lo que respecta a la selección de vecinos según “Estado”, es decir que al seleccionar el vecindario se consideró los usuarios del mismo estado que el usuario objetivo, esta relación entre los usuarios ponderada con el scorings s2 produce valores del MAE por debajo de la línea base y de los démas scoring en cualquier tamaño de vecindario analizado. También se observa que para vecindarios de tamaño entre 30 y 100 usuarios los scorings s8, s9 y s10, es decir aquellos que consideran las relaciones de los usuarios en el grafo de visitas comunes, también tienen menor error que la línea base. En cuanto a s14, éste tuvo un buen desempeño en vecindarios pequeños (tamaño menor a 50 usuarios), para luego incrementar sus valores de MAE llegando a valores por arriba de todos.

La Figura 6.4 muestra los resultados obtenidos al aplicar la estrategia de selección según la distancia entre las áreas de visitas de los usuarios (considerando 3 distancias posibles) combina- da con las estrategias de ponderación o scorings propuestas. Se observa que los errores tienden a estabilizarse aproximándose más a la línea base a medida que se incrementan la cantidad de vecinos al momento de estimar las preferencias. Este comportamiento en general es similar para todos los scorings en los tres tipos de radio analizados (radios 1km, 2km y 3km). Según la selec- ción realizada considerando usuarios que tienen un área de visita a menos de 1 km de distancia a la del usuario objetivo. Se observa que para vecindarios de tamaño de hasta 20 usuarios la ponderación a través de cualquiera de los scorings produjeron menor error en la estimación de las preferencias en comparación con la línea base. Además se destacan s1, s2 y s14, ya que obtu- vieron los mejores resultados entre los scorings. Por otro lado, cuando el tamaño del vecindario es mayor (entre 30 y 100 usuarios) se observa que los errores producidos por los scorings se aproximan al producido por la línea base y a medida que la cantidad de vecinos supera los 100 usuarios los scorings producen peores resultados que la línea base, siendo la peor ponderación de todas s14. Con respecto a considerar como vecinos a aquellos usuarios a 2 km de distancia del usuarios objetivo, se observa que para vecindarios de hasta 50 usuarios los scorings en ge-

Figura 6.3: Resultados experimental para selección según estado o condado y ponderación según los scorings en la matriz de preferencias basadas en las visitas

Condado Estado 5 10 20 30 50 100 150 200 250 300 5 10 20 30 50 100 150 200 250 300 0.0 0.2 0.4 0.6 Cantidad vecinos MAE Linea base s1 s2 s3 s4 s5 s6 s7 s8 s9 s10 s11 s12 s13 s14 s15

Figura 6.4: Resultados experimental para selección con según el área de visita y la ponderación según scorings en la matriz de preferencias basadas en las visitas

Area visita(radio 1 km) Area visita(radio 2 km) Area visita(radio 3 km)

5 10 20 30 50 100 150 200 250 300 5 10 20 30 50 100 150 200 250 300 5 10 20 30 50 100 150 200 250 300 0.0 0.2 0.4 0.6 Cantidad vecinos MAE Linea base s1 s2 s3 s4 s5 s6 s7 s8 s9 s10 s11 s12 s13 s14 s15

neral obtienen menor error comparado con la línea base. Se destacan entre los scorings s1, s2 y aquellos también derivados de la red de visitas comunes como s9 y s10. Luego a partir de vecindarios de mayor tamaño (más de 50 usuarios) los scorings producen errores más cercanos a la línea base manteniéndose por debajo de ella los mencionados anteriormente, mientras que los otros scorings empiezan a empeorar superando a la linea base. Por ultimo, respecto de selec- cionar vecinos según “Área visita(radio 3km)”, es decir que se consideraron una mayor cantidad de usuarios involucrados en la creación del vecindario, se observa un comportamiento de los scorings similar a lo ocurrido en los otros dos radios (1 km y 2 km), donde se destacan s1 y s2 por generar los menores errores en la estimación de las preferencias para cualquier tamaño de vecindario.

6.1.1.2. Resultados en la matriz de preferencias derivada de los tips

La Figura 6.5 muestra los resultados experimentales obtenidos para la estrategia de selección de vecinos derivada del grafo social (relación social nivel 1, nivel 2 y nivel 3) y la ponderación a través de los scorings propuestos evaluados en la matriz de preferencias derivada de los tips.

Según se observa en la figura, a medida que se incrementa la profundidad de exploración en la red los errores producidos por los scorings tienden a incrementarse aproximándose a la línea base. La selección de vecinos realizada a través de la relación directa de amistad “Red social (nivel 1)” combinada con algunos scorings genera mejoras en la etapa de estimación de preferencias. Se observa que para vecindarios de tamaño de hasta 20 usuarios, en general todos generan menor o igual error al producido por la línea base. Luego también se observa que a medida que el tamaño de vecindarios empieza a crecer (como mínimo 30 usuarios) los errores producidos por los scorings empiezan a aproximarse al de la línea base. Se destacan en este nivel de profundidad, los que ponderan a los vecinos según su relación en el grafo de visitas comunes (s8 y s9), ya que éstos generan errores por debajo de la línea base en todos los tamaños de vecindarios. Si se considera a los usuarios con relación social indirecta, es decir amigos de mis amigos (“Red social (nivel 2)”), se observa similar comportamiento al producido por el nivel 1, donde a medida que incrementa el tamaño del vecindario los errores tienden a estabilizarse aproximándose a la línea base. En este nivel de exploración se destaca la ponderación con s14 (ponderar más a aquellos vecinos que tienen similar comportamiento temporal), donde para un vecindarios de tamaño 10 obtuvo el menor de los MAE. También en este nivel de exploración se destacan s1 y s2, además de los mencionadas en el nivel 1, s8 y s9. En lo que respecta al nivel 3 de exploración, es decir seleccionar vecinos explorando la red social a 3 niveles de profundidad, se observa que los errores producidos son muy similares a la línea base en todos los tamaños de vecindarios. En este nivel se destaca el scoring s2, el cual genera menor error en vecindarios de tamaño menor o igual a 20 usuarios luego en vecindarios de mayor tamaño se comporta similar a los demás aproximándose a la línea base.

La Figura 6.6 muestra los resultados experimentales obtenidos para la estrategia de selección de vecinos derivada del grafo de visitas comunes (relación visitas comunes nivel 1, nivel 2 y ni- vel 3) y la ponderación a través de los scorings propuestos evaluadas en la matriz de preferencias derivada de los tips. Según se observa, la selección de vecinos realizada a través de la relación directa de visitas comunes (nivel 1) y ponderados por la mayoría de los scorings propuestos pro- porcionan mejoras en la estimación de las preferencias ya que como se observa sin considerar s12 (ponderación temporal según las categorías de los lugares) generan menores o igual error que la línea base. En este nivel se destacan s1 y s2, ya que siempre están por debajo de la línea base para todos los tamaños de vecindarios. También se observan con un buen desempeño de aquellos scorings derivados del grafo social (s5, s6 y s7), es decir que ponderar a los vecinos por la relación social influye de manera positiva en la estimación de preferencias. Con respecto a los vecinos seleccionados según el nivel 2 de esta red, se observa que a medida que el tamaño del vecindario se incrementa los errores producidos por los scorings son similares a la línea base. En este nivel se vuelven a destacar s1, s2 con menores errores que el resto de los scorings. En lo que respecta a la selección de vecinos según la red de visitas nivel 3, es decir se tuvieron en consi- deración una mayor cantidad de usuarios al generar el vecindario, se observa que en vecindarios

Figura 6.5: Resultados experimental en la matriz de preferencias basadas en los tips

Red social(nivel 1) Red social(nivel 2) Red social(nivel 3)

5 10 20 30 50 100 150 200 250 300 5 10 20 30 50 100 150 200 250 300 5 10 20 30 50 100 150 200 250 300 0.25 0.50 0.75 1.00 1.25 Cantidad vecinos MAE Linea base s1 s2 s3 s4 s5 s6 s7 s8 s9 s10 s11 s12 s13 s14 s15

Figura 6.6: Resultados experimental para selección en red de visitas y ponderación segun sco- rings en la matriz de preferencias derivada de tips

Red visita(nivel 1) Red visita(nivel 2) Red visita(nivel 3)

5 10 20 30 50 100 150 200 250 300 5 10 20 30 50 100 150 200 250 300 5 10 20 30 50 100 150 200 250 300 0.00 0.25 0.50 0.75 1.00 1.25 Cantidad vecinos MAE Linea base s1 s2 s3 s4 s5 s6 s7 s8 s9 s10 s11 s12 s13 s14 s15

pequeños (como máximo 20 usuarios) ponderar a los vecinos por los scorings propuestos genera menor error en comparación con la línea base. También se vuelven a destacar s1 y s2 del resto de los scorings. Por otro lado a medida que se incrementa el tamaño del vecindario los errores tienden a estabilizarse aproximándose a la línea base.

La Figura 6.7 muestra los resultados obtenidos al aplicar la estrategia de selección según estado o condado combinando con las estrategias de ponderación o scorings propuestas. Se ob- serva que los errores tienden a estabilizarse aproximándose más a la línea base a medida que se incrementan la cantidad de vecinos al momento de estimar las preferencias. Este comporta- miento en general es similar para todos los scorings en las dos estrategias de selección (Estado o Condado). Luego según la selección realizada por «Condado», es decir considerando usua- rios que son del mismo condado que el usuarios objetivo y ponderar con los scorings producen menores errores que la línea base cuando el tamaño de vecindarios es 5 o 10 usuarios. En este punto se destacan s1, s2, s14, s8 y s9. Luego a medida que incremente el tamaño del vecindario los errores están próximos a la línea base. Se destaca entre todos el scoring s14 (pondera a los vecinos según una variable temporal) ya que siempre estuvo por debajo de la línea base. En lo

Figura 6.7: Resultados experimental para selección según Estado o Condado y ponderación se- gun scorings en la matriz de preferencias derivada de los tips

Condado Estado 5 10 20 30 50 100 150 200 250 300 5 10 20 30 50 100 150 200 250 300 0.25 0.50 0.75 1.00 Cantidad vecinos MAE Linea base s1 s2 s3 s4 s5 s6 s7 s8 s9 s10 s11 s12 s13 s14 s15

que respecta a la selección de vecinos según «Estado», es decir que al seleccionar el vecindario considero los usuarios del mismo estado que el usuario objetivo, se observa que s14 vuelve a tener un buen despeño en cualquier tamaño de vecindario. También se destacan los derivados de la red de visitas comunes s8 y s9 donde producen errores menores a los de la línea base, pero superior a s14 en vecindarios de hasta 100 usuarios.

La Figura 6.8 muestra los resultados obtenidos al aplicar la estrategia de selección según la distancia entre las áreas de visitas de los usuarios (considerando 3 distancias) combinando con las estrategias de ponderación o scorings propuestas. Se observa que los errores tienden a estabilizarse aproximándose más a la línea base a medida que se incrementan la cantidad de vecinos al momento de estimar las preferencias. Este comportamiento en general es similar para todos los scorings en los tres tipos de radio analizados (radio 1km, radio 2km, radio 3km). Según la selección realizada por «Área visita (radio 1km)», es decir considerando usuarios que tienen un área de visita a menos de 1 km de distancia a la del usuario objetivo, se observa que para vecindarios de tamaño de hasta 20 usuarios la ponderación a través de cualquiera de los scorings se produjeron menor error en la estimación de las preferencias en comparación con la línea base.

Figura 6.8: Resultados experimental para selección con «Area de visita» y ponderación segun scorings en la matriz de preferencias derivada de los tips

Area visita(radio 1 km) Area visita(radio 2 km) Area visita(radio 3 km)

5 10 20 30 50 100 150 200 250 300 5 10 20 30 50 100 150 200 250 300 5 10 20 30 50 100 150 200 250 300 0.00 0.25 0.50 0.75 1.00 1.25 Cantidad vecinos MAE Linea base s1 s2 s3 s4 s5 s6 s7 s8 s9 s10 s11 s12 s13 s14 s15

Además se observa que s14 nuevamente se destaca entre los scorings obteniendo menor MAE que los demás. También se observa s2 con buen comportamiento para vecindarios de tamaño menor o igual a 20 usuarios. Los scorings derivados de la red de visitas comunes como s8, s9 y s10, tuvieron buen desempeño produciendo errores por debajo de la línea base en cualquier tamaño de vecindario analizado. Con respecto a considerar como vecinos a aquellos usuarios a 2 km de distancia del usuarios objetivo, se observa que las curvas de errores producidos por los scorings se comportan similar a lo descripto anteriormente, donde se destacan s14, s8, s9, s10 y s2, en vecindarios pequeños (hasta 20 usuarios) pero luego tienden a estabilizarse próximos al de la línea base. Por último con respecto al seleccionar vecinos según «Área visita(radio 3km)», se observa un comportamiento de los scorings similar a lo ocurrido en los otros dos radios (1 y 2 km), donde se destaca s2 por generar los menores errores en la estimación de las preferencias en tamaño de vecindario menor o igual a 30 usuarios. También se observa que los scorings derivados de la red de visitas comunes como s8, s9 y s10 obtuvieron errores por debajo de la línea base para cualquier tamaño de vecindario; s14 también obtiene errores menores a la línea base, pero mayores a los obtenidos en los otros radios analizados.

6.1.1.3. Análisis

La combinación de las estrategias de selección de vecinos con las estrategias de ponderación en términos generales obtuvieron resultados positivos, ya que en muchas de las combinaciones posibles los errores producidos estuvieron por debajo del producido por la línea base. Cuando la selección estuvo dada por la red social (nivel 1, nivel 2 y nivel 3), es decir que los usuarios que pueden contribuir a la estimación de las preferencias son aquellos que están conectados socialmente ya sea por amistad directa (nivel 1) o indirecta (nivel 2 o nivel 3), se observó que esta relación entre los usuarios ponderada por los scorings derivados de la discretización de la matriz de preferencia (s1 y s2) obtuvo buenos resultados en ambas matrices evaluadas, en la matriz basada en visitas a partir del nivel 2 de profundidad y en la matriz de preferencias derivadas de los tips en todos los niveles de profundidad. Luego también se observó que una buena combinación con esta estrategia de selección fueron los scorings derivados de la red de visitas como s8, s9 y s10. Esto también se observó para las dos matrices de preferencias.

También es importante remarcar el comportamiento de las combinaciones donde la selección fue dada por las relaciones directas de amistad en la matriz de preferencias basada en visitas, donde siempre los errores estuvieron por arriba de la línea base. Esto puede deberse al tamaño reducido de usuarios involucrados en la búsqueda del vecindario ya que como lo muestra la Fi- gura 6.9 (a) sólo se consideran en promedio al 1 % de los usuarios. Por otro lado una ventaja adicional de esta estrategia es la reducción del espacio de búsqueda en la generación del vecin- dario para el usuarios objetivo, ya que para un nivel 2 de profundidad el número de usuarios involucrados en la generación del vecindario en promedio fue un 70 % menos que la línea base y para un nivel 3 de profundidad este número se redujo a un 30 % como lo muestra la Figura 6.9 (a). Además esta estrategia en los niveles 2 y 3 obtuvieron en general valores de cobertura aceptables como lo muestra la Figura 6.9 (b).

Con respecto a la estrategia de selección de vecinos a través de la red de visitas comunes, esta estrategia combinada con los scorings propuestos en cierto sentido obtuvo mejor resultados que la red social, ya que en un nivel 1 de profundidad los errores estuvieron por debajo de la línea base cuando se combinaron con los scorings derivados de la discretización de la matriz de preferencias; esto se observó en la dos matrices evaluadas. En la matriz de visitas, se observó que al ponderar esta estrategia con el scoring que considera la variable temporal no tuvo efecto positivo ya que siempre los errores fueron muy superiores a la línea base en cualquier profundi-