Con los resultados obtenidos tras la aplicación de nuestro modelo de automatización de análisis textual, podemos ya dar paso a la interpretación del tema que guía nuestra investigación: el drástico aumento y traslación de lectores entre los diez periódicos digitales más leídos en España en el mes de marzo de 2020.
Si recordamos los datos recogidos por el medidor de audiencias digitales Comscore (mostrados en las figuras 4 y 5), en referencia al mes de marzo, nos encontrábamos con que, en total, son cuatro los periódicos que experimentan cambios severos distinguiéndose de la tendencia del mes a un aumento controlado de lectores:
1. Eldiario: por su rotundo aumento de lectores (61,8%), escalando a la primera
posición en la lista de variaciones de marzo.
2. OkDiario: con una subida del 41%, siendo el segundo medio con mayor aumento.
3. La Vanguardia: con un aumento moderado, que sin embargo no le impide
encabezar de nuevo la lista de medios digitales generalistas más leídos.
4. El Confidencial: su poco crecimiento de lectores, en comparación a la subida en
otros medios, le hacen descender en la lista general.
Si ponemos el foco en estos cuatro medios, y revisamos los datos obtenidos en nuestro caso de estudio, podemos extraer algunas conclusiones generales como las que se presentan a continuación.
Nuestra nube de palabras y el cálculo de los diez términos más frecuentes por medio generados en la primera fase de análisis de texto revelan cómo los dos periódicos triunfantes en los cambios de audiencia de marzo se especializan en temas de política nacional y económica respectivamente.
En el caso de OkDiario la información recopilada del mes de marzo tiende a tratar asuntos de política interna, en las que destacan las numerosas referencias al actual presidente y vicepresidente del Gobierno. Estas referencias, además de revelar un interés por las políticas de contención del virus, parecen interesarse por los casos de ministros, consejeros o senadores bajo amenaza de contagio durante el mes.
63
Figura 18. Nube de palabras del periódico OkDiario
En el caso de eldiario, la información recopilada tanto desde el cómputo de frecuencia como la nube de palabras revelan un interés por el sector económico ligado a una apuesta por la información de datos. También destaca su atención a la situación de empresas y laboral de la población española.
Figura 19. Nube de palabras del periódico eldiario
Por su parte, podemos ver cómo los temas más destacados de una exploración completa del medio La Vanguardia descubren un mayor seguimiento a cuestiones internacionales como el avance de la pandemia en Italia, primer foco europeo de la pandemia de coronavirus desde la identificación del primer contagiado el 28 de febrero. Otro de los intereses del medio parece ser las cuestiones económicas.
Figura 20. Nube de palabras del periódico La Vanguardia
Por otro lado, la variedad en la expresión, que observamos en la figura 12. Cálculo de la riqueza lingüística (ver figura 12) de la medición de la riqueza lingüística de los medios, parece actuar en contra de lo esperado: es precisamente la menor variedad expresiva la técnica utilizada por los medios mejor posicionados.
En completa oposición al periódico El Confidencial (principal afectado en el nuevo posicionamiento), se encuentran los favorecidos OkDiairo, eldiario, y La Vanguardia. Esta tendencia revela cómo la información clara de los hechos, con la creación de tópicos y reiteración de referencias y términos de actualidad, mejora la recepción de las comunicaciones en un periodo de impaciencia y confusión.
También en este sentido, en la figura 12. Cálculo de la media de palabras por artículo (§ figura 12) vemos cómo los comunicados breves y directos parecen ser los vencedores en la captación de lectores. Con una media entre las 300 y 400 palabras, el contenido se vuelve más atractivo y aumenta la difusión en las publicaciones.
Por su parte, el análisis de sentimiento, aunque ya concluimos no del todo ajustado a nuestros fines en la fase de estudio, por haber sido entrenado sobre un corpus de valoraciones que poca luz pueden arrojar para fines periodísticos, sí nos ha permitido confirmar una atmósfera de negatividad en la redacción de toda la prensa estudiada del mes. En este sentido, Jones et al. (Jones, Waters, Holland, Bevins, & Iverson, 2010) estudian la forma en que una advertencia de miedo generalizada en situaciones en que solo existe un riesgo hipotético, como ocurre en este mes preludio de las primeras consecuencias del virus en nuestro país, favorecen una confrontación más liviana llegados los peores escenarios.
65
Como lo resuelven Carmen Costa-Sánchez y Xosé López-García, en los estadios previos a una pandemia los mensajes deben enfocarse a incrementar el conocimiento de la enfermedad e informar de los comportamientos de protección para reducir el riesgo de su transmisión (Costa-Sánchez & López-García, Comunicación y crisis del coronavirus en España. Primeras lecciones, 2020, pág. 4). Este estudio, además, muestra claramente el cambio de paradigma en las comunicaciones en diferentes canales desde una etapa “precrisis”, que alentaba a conservar la calma y equiparaba la enfermedad a otra gripe estacional, al cambio radical en el mensaje a partir del mes de marzo y el drástico incremento de infectados en el país. Es en este momento cuando, al tener que alertar a la población contra los mensajes tranquilizadores anteriores, esta reacciona con miedo provocando excesos como el desabastecimiento de supermercados, la vuelta a la prensa tradicional (por confiar en la mayor veracidad de sus mensajes) y, en general, el aumento en el consumo de información. Sin duda, nuestro análisis de sentimiento sí revela esta tendencia a la dramatización y alarma en las publicaciones.
Por último, la aproximación a los tópicos detectados y destacados en cada medio vuelve a mostrar similitudes en la transmisión de los acontecimientos por los dos periódicos líderes en crecimiento de audiencia. En conclusión, otra de las claves que podría haber atraído a muchas de las personas alarmadas y, más tarde, confinadas, es la atención concedida a la política nacional y crisis económica.
A este respecto, recordamos que las conexiones lingüísticas identificado como tema propio por nuestro modelo LDA incluía diferentes nombres de agentes gubernamentales que, en toda situación de crisis, se vuelven los actantes más importantes. La decisión de proporcionar actualizaciones continuas de sus comunicaciones públicas ha servido a estos medios para aumentar la credibilidad en la información proporcionada.
Conclusiones
En conclusión, con nuestro modelo hemos podido explorar una gran cantidad de datos textuales en muy poco tiempo y con relativamente pocos recursos. Gracias a este acercamiento hemos podido sacar algunas conclusiones generales que nos han ayudado a dar respuesta a la pregunta con que partía nuestra investigación: los cambios de audiencia que la situación de incertidumbre provocada por la crisis sanitaria y posterior confinamiento de la población habían provocado en los hábitos de consumo de prensa digital. Todo ello ha sido posible gracias a, en primer lugar, la revolución digital en el sector periodístico, que abre la puerta a exploraciones de minería de textos en gran cantidad de sus publicaciones, y los logros del campo del Procesamiento del Lenguaje Natural, que facilitan la exploración de la información textual aplicada a todo tipo de ámbitos.
Para la consecución de nuestros fines, hemos definido un modelo específico de exploración del ámbito periodístico y publicado el mismo para futuros usos de análisis con datos diferentes. Dentro de este, algunas de las tareas han resultado más concluyentes, como la medición estadística de diferentes fenómenos a partir de la elaboración de una matriz lingüística o el modelado automático de tópicos de tipo LDA. El análisis de sentimiento, otro de los objetivos fijados, no se valora como solución definitiva por no haber sido creado ad hoc para nuestros propósitos, presentando problemáticas tan notorias como el cambio en la semántica que términos como “positivo” y “negativo” tienen en estas circunstancias, apareciendo en considerables ocasiones en los corpus y que llegan a alterar la precisión de la tecnología utilizada.
Aunque se trata de un modelo no demasiado osado, resulta una buena muestra de los beneficios que las tecnologías informáticas de exploración textual ofrecen a campos de negocio como la medición de audiencia dentro del periodismo digital. Entre sus futuras mejoras se considera la implementación de limpieza por stemming o acortamiento de los términos de la matriz a su raíz, y una mayor exploración en los recursos de análisis de sentimiento, que hasta ahora continúan siendo escasos para su aplicación al idioma español.
67
Bibliografía
Andréu Abrela, J. (2002). Las técnicas de análisis de contenido: una revisión actualizada. Fundación Centro de Estudios Andaluces.
Arora, S., Ge, R., Halpern, Y., Mimno, D., Moitra, A., Sontag, D., . . . Zhu, M. (2013). A practical algorithm for topic modeling with provable guarantees. 30th Intl conf on machine
learning, 280-288.
Bello, H. J. (s.f.). https://github.com/sentiment-analysis-spanish/sentiment-analysis-model- neural-network.
Bird, S., Loper, E., & Klein, E. (2009). Natural language processing with Python:. California: O’Reilly Media, Inc.
Blei, D. M. (2012). Topic modeling and digital Humanities. Journal of digital humanities, 2(1), 8- 11. Obtenido de http://journalofdigitalhumanities.org/2-1/topic-modeling-and-digital- humanities-by-david-m-blei/
Blei, D. M., & Lafferty, J. D. (2007). A correlated topic model of science. Princeton: University and Carnegie Mellon University.
Breton, P., & Proulx, S. (1989). La explosión de la comunicación. Barcelona: Civilización Ediciones.
Cambria, E., Schuller, B., Liu, B., & Wang, H. (2013). Knowledge-based approaches to concept- level sentiment analysis. IEEE intelligent systems, 28(2), 12-14.
Castells, M. (1996). he Rise of the Network Society, The Information Age: Economy, Society, and
Culture. Oxford: Blackwell.
Chowdhury, G. G. (2003). Natural language processing. Annual review of information science
and technology, 37, 51–89.
Costa-Sánchez, C., & López-García, X. (2020). Comunicación y crisis del coronavirus en España. Primeras lecciones. El profesional de la información, 9(3), 1-14.
Costa-Sánchez, C., & López-García, X. (2020). Comunicación y crisis del coronavirus en España. Primeras lecciones. El profesional de la información, 29(3), 1-14.
Data is Beautiful. (19 de octubre de 2019). Most Popular Programming Languages 1965 - 2019. EEUU. Recuperado el 2 de agosto de 2020, de
https://www.youtube.com/watch?v=Og847HVwRSI
David M Blei, A. Y. (2003). Latent dirichlet allocation. Journal of machine Learning research, 3, 993–1022.
de Moragas i Spà, M. (1981). Teorías de la comunicación. Investigaciones sobre. Barcelona: Gustavo Gili.
Edo, C. (2003). Periodismo informativo e interpretativo: el impacto de Internet en la noticia, las
Esparza, J. (2016). Epidemias y pandemias virales emergentes: ¿Cuál será la próxima?
Investigación clínica, 57(3), 231-235.
Feldman, S. (1999). NLP meets the jabberwocky. Online, 23, 62-72.
G. Miner, D. D. (2012). The Seven Practice Areas of Text Analytics. En D. D. G. Miner, Practical
Text Mining and Statistical Analysis for Non-structured Text Data Applications (págs.
29-41). Har/Dvdr: Academic Press.
Gou-Núñez, M. (2017). Crisis de salud en los medios de comunicación : El ébola en España.
Análisis de los diarios La Vanguardia, El Mundo y El País. Univeritat Autònoma de
Barcelona, Grau en Periodisme).
Harvey, D. (1990). The Condition of Postmodernity. An Enquiry into the Origins of Cultural
Change. Oxford: Blackwell.
Hearst. (1999). Untangling Text Data Mining. Proc. of ACL’99: The 37th Annual Meeting of the
Association for Computational. University of Maryland.
Hernández, D., & Navarro, B. (2015). Una aproximación a la recomendación de artículos científicos según su grado de especificidad, Procesamiento del Lenguaje Natural, 55, 91-98.
Jones, D. E. (1997). Investigació sobre comunicació social a l’Espanya de les autonomies.
Anàlisi. Quaderns de comunicació i cultura, 101-120.
Jones, S. C., Waters, L., Holland, O., Bevins, J., & Iverson, D. (2010). Developing pandemic communication strategies: Preparation without panic. Journal of business research,
63(2), 126-132.
Kanayama, H. &. (2006). Fully Automatic Lexicon Expansion for DomainOriented Sentiment Analysis. Proceedings of the 2006 Conference on Empirical Methods in Natural
Language Processing (págs. 355–363). Association for Computational Linguistics.
Kechaou, Z., Ben-Ammar, M., & Alimi, A. (2013). A multi-agent based system for sentiment analysis. International journal on artificial intelligence tools, 22(2), 1-28.
Kodratoff. (1999). Knowledge Discovery in Texts: A Definition. Proc. of the 11th International
Symposium on Foundations of Intelligent Systems (ISMIS-99), (págs. 16-29).
Leetaru, K.-H. (2011). Data mining methods for the content analyst: An introduction to the
computational analysis of informational center. New York: Routledge.
Liddy, E. (1998). Enhanced text retrieval using natural language processing. Bulletin of the
American Society for Information Science, 24, 14-16.
Llisterri, J. (15 de diciembre de 2019). Aplicaciones del procesamiento del lenguaje natural. Obtenido de
http://liceu.uab.cat/~joaquim/language_technology/NLP/PLN_aplicaciones.html McKeown, V. H. (1997). Predicting the Semantic Orientation of Adjectives. Proc. of the 35th
69 Monjas-Eleta, M., & Gil-Torres, A. (2017). Comunicación institucional y tratamiento
periodístico de la crisis del ébola en España entre el 6 y el 8 de octubre de 2014.
Revista de comunicación, 6(1), 97-121.
Parés i Maicas, M. (1997). La recerca europea en comunicació social. Anàlisi.Quarderns de
comunicació i cultura, 21, 21-234.
Rodríguez Serrano, A., & Gil Soldevilla, S. (2018). Investigar en la era neoliberal. Visiones
críticas sobre la investigación en comunicación en España. Universitat Pompeu Fabra :
Universitat Autònoma de Barcelona, Servei de Publicacions : Universitat de València, Servei de Publicacions.
Rossmann, C., Meyer, L., & Schulz, P. J. (2018). The mediated amplification of a crisis:
Communicating the A/H1N1 pandemic in press releases and press coverage in Europe.
Risk analysis, 38(2), 357-375.
Salaverría Aliaga, R., del Pinar Martínez-Costa, M., & Breiner, J. (2018). Mapa de los
cibermedios de España en 2018: análisis cuantitativo. Revista Latina de Comunicación
Social, 1034-1053.
Sojo, C. A. (2003). El periodismo en Internet. Universidad Central de Venezuela: Fondo editorial de Humanidades y Educación.
Turing, A. M. (1950). Computing machinery and intelligence. Mind, New Series, 59(236), 433- 460.
Vega, F. (24 de marzo de 2020). https://www.comscore.com/lat/Prensa-y-Eventos/Blog/Los-
medios-tradicionales-recuperan-poder-y-credibilidad-con-la-pandemia-provocada-por- el-Coronavirus. Obtenido de https://www.comscore.com/:
https://www.comscore.com/esl/Prensa-y-Eventos/Blog/Los-medios-tradicionales- recuperan-poder-y-credibilidad-con-la-pandemia-provocada-por-el-Coronavirus Verdejo Maillo, M. F. (1994). Procesamiento del lenguaje natural: fundamentos y aplicaciones.
UNED, Curso de Verano.
Wilson, T. W. (2005). Recognizing contextual. Proceedings of the conference on human
language technology and empirical methods in natural language processing, 347-354.
Wolton, D. (2000). Internet, ¿y después?. Una Teoría Crítica Sobre los Nuevos “Media”. Barcelona: Gedisa.
World Health Organization. (2004). Sixth Futures Forum on Crisis Communication. Obtenido de https://www.euro.who.int/__data/assets/pdf_file/0004/90535/E85056.pdf
World Health Organization. (2013). Health and environment: communicationg the risks. Obtenido de
https://www.euro.who.int/__data/assets/pdf_file/0011/233759/e96930.pdf
World Health Organization. (2020). Risk communication and community engagement readiness
and response to coronavirus disease (Covid-19).
Yan X., G. J. (2013). A Biterm Topic Model for Short Texts. CAS Beijin: Institute of Computing Technology.
71
Anexos
ANEXO 1
CONFLICTOS RESUELTOS EN UNA SEGUNDA FASE DE LIMPIEZA PERSONALIZADA En la siguiente tabla se recogen las cuestiones resueltas en la fase de limpieza personalizada para nuestro caso de estudio.
EMOJIS
HIPERVÍNCULOS
EXTRAÍDO
DEL MEDIO
GAZAPOS LINGÜÍSTICOS
� � � � � � �
� pic.twitter.com IXu EA3EHu5 ABC explicandome
�
�
� pic.twitter.com 8n6D0Pap EL ABC videconferencia
�
�
�
�
� pic.twitter.com NJSd R2o EST ABC ncohe
❗ pic.twitter.com W0KTaqirrj ABC permanante
� � � � � � � �
� pic.twitter.com r ZRls Y2Mf ABC infeciones
�
� pic.twitter.com m Pa VNz IHMz ABC níumero
�
� � �
� pic.twitter.com c Nw Z7z HU2X ABC desifectado
�
�
� pic.twitter.com Iv AKFc Oq9q ABC auentan
�
�
�
�
�
� pic.twitter.com 1Jt Ira4 .36 ABC explcado
�
�
� pic.twitter.com r ZRls Y2Mf5 ABC osbtante
�
�
� pic.twitter.com IKpagpq Gpu El Español reisgo
�
�
� pic.twitter.com 8ZYVnkh QSr El Español miemo
� � �
� �
� pic.twitter.com 9Te6a FP0Ri El Español percepcion
�
� � � �
� pic.twitter.com Tgu WH6Blij El Español pdieramos
� pic.twitter.com VJRQpj AAl8 El Español prohibe
€ pic.twitter.com ejw FYwl LKJ El Español cornavirus
$ pic.twitter.com z W0GLl SCq2 El Español madrido
pic.twitter.com ud XCb Z2apq El Español encuentan
pic.twitter.com dbn Uzi43i R El Español manentenemos
pic.twitter.com AOy Ll7z0r
FComo El Español proque
pic.twitter.com 1Ixr Be30g5 El Español cotagio
pic.twitter.com cj JT89Od ND El Español producieron
pic.twitter.com E9rwp9o D3I El Español desemparada
https: t.co LVha Yrd IGE
pic.twitter.com zmfnae VZL5 El Español interveniendo
pic.twitter.com IKpagpq Gpu El Español detatallado
https: t.co Hi J1c Pd Eyc El Español principaes
https: t.co ddq Ft2P6Nv El Español prevenención
pic.twitter.com 9Te6a FP0Ri El País cuerentena
pic.twitter.com d MIJiv GXl I El País indetificado
https: t.co 4jqgfc UHno El País entreteniento
pic.twitter.com b3h8dns Qe A El Periódico funciomiento
https: t.co Nw2b Ssjwho pic.twitter.com v Rjs
E5BBk PA El Periódico contínuamente
https: t.co z2yd4Rlw XO pic.twitter.com Bqy
Vd0QQxb El Periódico insitencia
pic.twitter.com gl QKg4MYl V El Periódico auque
pic.twitter.com Umwiv ANw SV El Periódico econóimica
pic.twitter.com l5bh WXDi Ut El Periódico excecpcionales
pic.twitter.com k Zk Eadmes8 El Periódico autónomomas
pic.twitter.com j N3v DB678h El Periódico covd
pic.twitter.com p Tg Jzt UXqo El Periódico
https: t.co s P3t Aj YSm1 El Periódico
https: t.co S54n Hwax Lr pic.twitter.com e
AB4QPVthi El Periódico
https: t.co TIF6DD El Periódico
https: t.co p1qs OYVADw El Periódico
https: t.co FFB1eyn US7 El Periódico
https: t.co 8q Gj JQJEJF El Periódico
https: t.co xra7FDBV83 El Periódico
https: t.co S54n Hwax Lr pic.twitter.com e
AB4QPVthi El Periódico
https: t.co JODY3WB36Q#coronavirus El Confidencial
https: t.co Wf6ph S2wa G pic.twitter.com Zm
U3Nealhr El Confidencial
https: t.co AEc MZTRwyz El Confidencial
https: t.co Ps OXAlh Ohq El Confidencial
pic.twitter.com Xlp Cv Fh0mv El Confidencial
pic.twitter.com TFs Tlhbr Im El Confidencial
pic.twitter.com 67r S4XBE5J El Confidencial
pic.twitter.com i Ls Gu7YXb8 El Confidencial
pic.twitter.com 95z R4Gw2vg El Confidencial
pic.twitter.com Jpr No NA2r6 El Confidencial
pic.twitter.com 07n SL8V1pv El Confidencial
pic.twitter.com 9Te6a FP0Ri El Confidencial
pic.twitter.com 67r S4XBE5J El Confidencial
pic.twitter.com i Ls Gu7YXb8 El Confidencial
pic.twitter.com 95z R4Gw2vg El Confidencial
pic.twitter.com Jpr No NA2r6 El Confidencial
pic.twitter.com 07n SL8V1pv El Confidencial
pic.twitter.com Xy R3Zfz Q5u El Confidencial
pic.twitter.com cs Y0Dc El Confidencial
pic.twitter.com yk6d tf El Confidencial
https://t.co/hr3GM8rGHS\n elDiario
https: t.co hr3GM8r GHS elDiario
73
ANEXO 2
CÁLCULO DE LOS DIEZ TÉRMINOS MÁS REPETIDOS POR MEDIO
En la siguiente tabla se recogen los diez términos más frecuentes por medio, así como su total de apariciones en el corpus por periódico y la media correspondiente de frecuencia por noticia.
Periódico Palabras Apariciones Media de apariciones por noticia
20Minutos marzo 28 0,875 casa 27 0,84375 residencias 26 0,8125 confinamiento 22 0,6875 comunidad 22 0,6875 ancianos 19 0,59375 semana 19 0,59375 salir 17 0,53125 sánchez 16 0,5 mayores 16 0,5 ABC sanidad 68 2 italia 65 1,911764706 sábado 61 1,794117647 informa 61 1,794117647 china 61 1,794117647 comunidad 58 1,705882353 simón 57 1,676470588 marzo 53 1,558823529 horas 52 1,529411765 hospital 51 1,5 El Español casa 79 1,144927536 iglesias 51 0,739130435 sanidad 48 0,695652174 pasado 48 0,695652174 alimentos 45 0,652173913 sociales 45 0,652173913 bien 44 0,637681159 semanas 41 0,594202899 euros 40 0,579710145 italia 40 0,579710145 El Mundo domingo 174 3,411764706 horas 125 2,450980392
covid 111 2,176470588 sanidad 110 2,156862745 sánchez 109 2,137254902 informa 108 2,117647059 sábado 100 1,960784314 comunidad 93 1,823529412 número 93 1,823529412 ministerio 84 1,647058824 generalitat 84 1,647058824 El País enfermedad 56 1,272727273 países 54 1,227272727 confinamiento 53 1,204545455 china 51 1,159090909 comunidad 48 1,090909091 semana 46 1,045454545 epidemia 43 0,977272727 millones 42 0,954545455 mundo 40 0,909090909 sistema 40 0,909090909 El Periódico información 97 2,487179487 confinamiento 40 1,025641026 casa 40 1,025641026 barcelona 28 0,717948718 pacientes 25 0,641025641 empleo 24 0,615384615 síntomas 22 0,564102564 jornada 21 0,538461538 hospital 21 0,538461538 enfermedad 21 0,538461538 El Confidencial sánchez 133 3,41025641 sanidad 112 2,871794872 comunidad 93 2,384615385 sábado 92 2,358974359 ciudadanos 84 2,153846154 iglesias 81 2,076923077 medida 80 2,051282051 cierre 74 1,897435897 enfermedad 74 1,897435897 consejo 73 1,871794872 La Vanguardia economía 39 0,829787234 millones 35 0,744680851 deuda 34 0,723404255 italia 31 0,659574468 pasado 29 0,617021277
75 epidemia 29 0,617021277 confianza 26 0,553191489 semanas 25 0,531914894 confinamiento 25 0,531914894 casa 25 0,531914894 OkDiario sánchez 87 1,45 iglesias 79 1,316666667 sanidad 57 0,95 ejecutivo 55 0,916666667 pedro 48 0,8 marzo 45 0,75 pablo 40 0,666666667 ministros 40 0,666666667 sociales 37 0,616666667 pasado 36 0,6 eldiario información 120 2,727272727 mundo 105 2,386363636 boletín 70 1,590909091 hazte 70 1,590909091 respuestas 67 1,522727273 datos 63 1,431818182 eldiario 61 1,386363636 minuto 59 1,340909091 vida 55 1,25 epidemia 54 1,227272727