{"id":1680,"date":"2024-05-30T10:55:34","date_gmt":"2024-05-30T13:55:34","guid":{"rendered":"https:\/\/datamining.dc.uba.ar\/predictivos\/?p=1680"},"modified":"2024-05-30T11:17:26","modified_gmt":"2024-05-30T14:17:26","slug":"la-pandemia-en-palabras-dinamica-del-cambio-semantico-a-partir-de-redes-semanticas","status":"publish","type":"post","link":"https:\/\/datamining.dc.uba.ar\/predictivos\/?p=1680","title":{"rendered":"La pandemia en palabras: din\u00e1mica del cambio sem\u00e1ntico a partir de redes sem\u00e1nticas"},"content":{"rendered":"<p><span style=\"font-weight: 400;\">Por <strong>Vanesa Copa<\/strong> (Magister en Explotaci\u00f3n de Datos y Descubrimiento de Conocimiento \u2013 UBA, Bioqu\u00edmica y Farmac\u00e9utica \u2013 UBA).<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Gracias a la Maestr\u00eda tuve la oportunidad de conocer a quien fue mi directora de Tesis\u00a0 la Dra. <strong>Laura Kaczer<\/strong> y por intermedio de ella a mi co-director <strong>Sebasti\u00e1n Pinto<\/strong>, ambos con grandes cualidades docentes. Conocerlos me dio la posibilidad de iniciar mi tesis en el tema que m\u00e1s me interesaba: Procesamiento del Lenguaje Natural.<\/span><\/p>\n<h3><b>Motivaci\u00f3n<\/b><\/h3>\n<p><span style=\"font-weight: 400;\">Comprender el cambio en el significado de las palabras en diferentes contextos y per\u00edodos de tiempo es crucial para revelar el papel del lenguaje en la evoluci\u00f3n social y cultural. La pandemia de COVID-19 ofreci\u00f3 una oportunidad \u00fanica para investigar en terrenos cuantitativos los cambios en el significado de las palabras [3, 4]. En este trabajo investigamos c\u00f3mo podemos detectar cambios en el significado de las palabras expresadas a partir del uso de redes sem\u00e1nticas. Nuestra hip\u00f3tesis es que los cambios en el uso y significado de diferentes t\u00e9rminos se ver\u00e1n reflejados en la variaci\u00f3n de propiedades de estas redes en las diferentes etapas del desarrollo de la pandemia (a\u00f1os 2019, 2020 y 2021).<\/span><\/p>\n<h3><b>Datos\u00a0<\/b><\/h3>\n<p><span style=\"font-weight: 400;\">\u00bfCon qu\u00e9 datos trabajamos? Levantamos un conjunto grande de tweets p\u00fablicos y originales (es decir, que no son retweets) buscando captar expresiones espont\u00e1neas de un grupo cualquiera de usuarios. Nos enfocamos en tweets cuya fecha de publicaci\u00f3n pertenece a un per\u00edodo anterior a la pandemia de COVID-19 (a\u00f1o 2019) y a diferentes etapas de la misma (a\u00f1os 2020 y 2021), para captar el impacto de la misma en el lenguaje. A su vez nos quedamos con tweets geo-etiquetados, limit\u00e1ndonos a aquellos publicados desde Argentina, a fin de captar textos escritos en espa\u00f1ol rioplatense.\u00a0<\/span><\/p>\n<p><span style=\"font-weight: 400;\">De estos tweets nos quedamos con aquellos que pertenec\u00edan a 200 usuarios que detectamos que tuvieron suficiente actividad en cada uno de los tres a\u00f1os mencionados. Nuevamente la motivaci\u00f3n de ello fue contar con datos que nos permitan \u201crepetir el experimento\u201d con los mismos usuarios en tres per\u00edodos diferentes (antes, durante y casi llegando al fin de la pandemia). El conjunto de datos resultante estuvo finalmente formado por 3.477.422 tweets publicados por dichos 200 autores.\u00a0<\/span><\/p>\n<h3><b>Metodolog\u00eda\u00a0<\/b><\/h3>\n<p><span style=\"font-weight: 400;\">Los primeros pasos fueron los t\u00edpicos que se realizan en muchos trabajos que involucran procesamiento de lenguaje natural: eliminamos URLs, menciones a usuarios, s\u00edmbolos emoji y caracteres especiales, transformamos las palabras a min\u00fasculas, y eliminamos palabras no informativas (stopwords) como preposiciones y art\u00edculos. A su vez <\/span><i><span style=\"font-weight: 400;\">lematizamos<\/span><\/i><span style=\"font-weight: 400;\"> [5] las palabras restantes. Lematizar es llevar las palabras a su ra\u00edz. Por ejemplo, si aparecen las palabras \u201ccorren\u201d y \u201ccorrieron\u201d se transforman en \u201ccorrer\u201d. Esto permite eliminar redundancia y homogeneizar los textos. Finalmente, <\/span><i><span style=\"font-weight: 400;\">tokenizamos<\/span><\/i><span style=\"font-weight: 400;\">, es decir, separamos los tweets en palabras, transformando cada tweet en una lista de palabras que sobrevivieron a los filtros anteriores.\u00a0<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Luego de tokenizar los tweets, construimos redes sem\u00e1nticas. Estas est\u00e1n compuestas por nodos que representan a las palabras y enlaces que representan una relaci\u00f3n entre las mismas. En principio, estas redes las definimos como pesadas, es decir, que cada enlace tiene adem\u00e1s un n\u00famero asociado que llamamos \u201cpeso\u201d. Definimos este peso a partir de la informaci\u00f3n mutua puntual normalizada (NPMI) [2]. El NPMI es un n\u00famero entre -1 y 1, donde, en nuestro caso, 1 indica que dos palabras siempre aparecer\u00e1n en los mismos tweets, -1 que son completamente excluyentes (es decir, que cuando encontramos una palabra la otra nunca va a estar) y 0 que no tienen ninguna relaci\u00f3n (el hecho que aparezcan en un mismo tweet o no es por puro azar).<\/span><\/p>\n<p><span style=\"font-weight: 400;\">A estas redes las definimos para cada uno de los 200 usuarios y cada periodo (2019, 2020, 2021) y para tener una representaci\u00f3n del peri\u00f3do promediamos sobre todos los usuarios (es decir, el peso entre dos palabras es el promedio de los pesos entre esas palabras para cada usuario). Finalmente, para simplificar el an\u00e1lisis posterior, en cada red nos quedamos con los enlaces m\u00e1s significativos (aquellos cuyo peso se desv\u00eda suficiente de lo esperado por azar) [6], transformando nuestras redes pesadas en binarias (el enlace existe o no) que son las que efectivamente analizamos.\u00a0<\/span><\/p>\n<h3><b>Resultados\u00a0<\/b><\/h3>\n<p><span style=\"font-weight: 400;\">Los resultados se basaron en el an\u00e1lisis de las redes obtenidas para cada uno de los tres per\u00edodos. Por un lado evaluamos diferentes m\u00e9tricas de las redes sem\u00e1nticas, entre ellas, la cantidad de nodos totales, el grado medio (n\u00famero de enlaces promedio), el di\u00e1metro de la red, el coeficiente de clustering y la asortatividad, sin encontrar grandes diferencias en estas m\u00e9tricas en los distintos per\u00edodos, lo cual nos hizo entender que la estructura global de las redes no var\u00eda significativamente.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Donde s\u00ed encontramos grandes diferencias fue en las comunas emergentes en cada red. Una comuna es un conjunto de nodos que tienden a interactuar m\u00e1s entre s\u00ed que con el resto de los nodos. Para detectarlas utilizamos el algoritmo de Louvain [1], muy usado en el \u00e1rea. Por ejemplo, la Figura 1 muestra las principales palabras relacionadas con la comunidad que etiquetamos como \u201cf\u00fatbol\u201d detectada en los a\u00f1os 2019 y 2021. As\u00ed como esta encontramos muchas otras que resumimos en el Cuadro 1, donde podemos ver la aparici\u00f3n de \u00e9stas en funci\u00f3n del tiempo.\u00a0<\/span><\/p>\n<p><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2024\/05\/Figura-1-y-2.png\"><img decoding=\"async\" loading=\"lazy\" class=\"alignleft size-full wp-image-1698\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2024\/05\/Figura-1-y-2.png\" alt=\"\" width=\"917\" height=\"347\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2024\/05\/Figura-1-y-2.png 917w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2024\/05\/Figura-1-y-2-300x114.png 300w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2024\/05\/Figura-1-y-2-768x291.png 768w\" sizes=\"(max-width: 917px) 100vw, 917px\" \/><\/a><\/p>\n<h6><\/h6>\n<h6><\/h6>\n<h6>a) A\u00f1o 2019, Comunidad\u00a0 <em>f\u00fatbol\u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0<\/em>b) A\u00f1o 2021, Comunidad <em>f\u00fatbol<\/em><\/h6>\n<h6><strong>Figura 1.<\/strong> Comunidades obtenidas en los tres per\u00edodos, el tama\u00f1o y color indican el valor de <em>eigenvector centrality <\/em>de los nodos.<\/h6>\n<h5><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2024\/05\/Imagen-3.png\"><img decoding=\"async\" loading=\"lazy\" class=\" wp-image-1685 aligncenter\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2024\/05\/Imagen-3.png\" alt=\"\" width=\"412\" height=\"437\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2024\/05\/Imagen-3.png 502w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2024\/05\/Imagen-3-283x300.png 283w\" sizes=\"(max-width: 412px) 100vw, 412px\" \/><\/a><\/h5>\n<h6><strong>Cuadro 1.<\/strong> Principales temas y porcentaje de nodos respecto a la componente gigante que contiene esa comunidad.<\/h6>\n<p>&nbsp;<\/p>\n<p><span style=\"font-weight: 400;\">Finalmente, seguimos espec\u00edficamente algunas palabras y vimos c\u00f3mo cambiaba el entorno de las mismas.\u00a0 Por ejemplo, en la Figura 2 podemos ver c\u00f3mo cambian las palabras m\u00e1s cercanas a \u201cinmunidad\u201d, cuyo significado se vi\u00f3 muy afectado por la aparici\u00f3n de la pandemia \u201cCOVID-19\u201d. Haciendo este estudio m\u00e1s sistem\u00e1ticamente, encontramos que el entorno de las palabras ligadas la pandemia (como por ejemplo, \u201cinmunidad\u201d, \u201cprotocolo\u201d, entre otros), cambi\u00f3 notablemente del 2019 al 2020, (pasando de una asociaci\u00f3n con temas judiciales a otra con inmunolog\u00eda) y no tanto del 2020 al 2021. Es decir, entendimos que el efecto de la pandemia alter\u00f3 el significado de las palabras, quedando ya establecido en el \u00faltimo per\u00edodo.<\/span><\/p>\n<p><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2024\/05\/Imagen-4.png\"><img decoding=\"async\" loading=\"lazy\" class=\"wp-image-1686 aligncenter\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2024\/05\/Imagen-4.png\" alt=\"\" width=\"657\" height=\"419\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2024\/05\/Imagen-4.png 782w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2024\/05\/Imagen-4-300x191.png 300w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2024\/05\/Imagen-4-768x490.png 768w\" sizes=\"(max-width: 657px) 100vw, 657px\" \/><\/a><\/p>\n<h6><strong>Figura 2. <\/strong>Subgrafo de la palabra \u201cinmunidad\u201d de los tres per\u00edodos. Cada per\u00edodo se se\u00f1ala en la figura. Se puede observar el cambio de vecindad de la palabra \u201cinmunidad\u201d asociado a un cambio en su uso sem\u00e1ntico.<\/h6>\n<p>&nbsp;<\/p>\n<h3><b>Conclusiones<\/b><\/h3>\n<p><span style=\"font-weight: 400;\">El presente estudio tuvo como objetivo desarrollar un m\u00e9todo novedoso para abordar cambios sem\u00e1nticos a partir de la red social Twitter. Mediante el seguimiento de los tweets de un grupo de usuarios a lo largo de 3 per\u00edodos (2019\/2020\/2021), pudimos capturar cambios sutiles e informativos en las representaciones mentales l\u00e9xicas. Encontramos que varias palabras se desviaron de sus vecindarios sem\u00e1nticos anteriores, revelando ahora asociaciones con la pandemia de COVID-19, como as\u00ed tambi\u00e9n la emergencia de nuevas comunidades en la redes. Por lo tanto, el m\u00e9todo propuesto podr\u00eda ser \u00fatil para comprender cambios r\u00e1pidos en el significado de las palabras en un escenario colectivo.\u00a0<\/span><\/p>\n<p>&nbsp;<\/p>\n<p><b>Referencias<\/b><\/p>\n<ol>\n<li><span style=\"font-weight: 400;\"> Newman, M. E. and Girvan, M. (2004). Finding and evaluating community structure in networks. <\/span><i><span style=\"font-weight: 400;\">Physical review E<\/span><\/i><span style=\"font-weight: 400;\">, 69(2):026113.<\/span><\/li>\n<li><span style=\"font-weight: 400;\"> Bouma, G. (2009). Normalized (pointwise) mutual information in collocation extraction. <\/span><i><span style=\"font-weight: 400;\">Proceedings of GSCL<\/span><\/i><span style=\"font-weight: 400;\">, 30:31\u201340.<\/span><\/li>\n<li><span style=\"font-weight: 400;\"> Carrillo, F., Cecchi, G. A., Sigman, M., and Slezak, D. F. (2015). Fast distributed dynamics of semantic networks via social media. <\/span><i><span style=\"font-weight: 400;\">Computational intelligence and\u00a0 neuroscience<\/span><\/i><span style=\"font-weight: 400;\">, 2015:50\u201350.<\/span><\/li>\n<li><span style=\"font-weight: 400;\"> Laurino, J., De Deyne, S., Cabana, A., and Kaczer, L. (2023). The pandemic in words: tracking fast semantic changes via a large-scale word association task. <\/span><i><span style=\"font-weight: 400;\">Open mind<\/span><\/i><span style=\"font-weight: 400;\">, pages 1\u201319.<\/span><\/li>\n<li><span style=\"font-weight: 400;\"> Qi, P., Zhang, Y., Zhang, Y., Bolton, J., and Manning, C. D. (2020). Stanza: A python natural language processing toolkit for many human languages. <\/span><i><span style=\"font-weight: 400;\">arXiv preprint arXiv:2003.07082<\/span><\/i><span style=\"font-weight: 400;\">.<\/span><\/li>\n<li><span style=\"font-weight: 400;\"> Serrano, M. \u00c1., Bogun\u00e1, M., and Vespignani, A. (2009). Extracting the multiscale backbone of complex weighted networks. <\/span><i><span style=\"font-weight: 400;\">Proceedings of the national academy of sciences<\/span><\/i><span style=\"font-weight: 400;\">, 106(16):6483\u20136488.<\/span><\/li>\n<\/ol>\n<p>&nbsp;<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Por Vanesa Copa (Magister en Explotaci\u00f3n de Datos y Descubrimiento de Conocimiento-UBA, Bioqu\u00edmica y Farmac\u00e9utica-UBA). La pandemia de COVID-19 ofreci\u00f3 una oportunidad \u00fanica para investigar en terrenos cuantitativos los cambios en el significado de las palabras. En este trabajo de tesis investigamos c\u00f3mo podemos detectar cambios en el significado de las palabras expresadas a partir del uso de redes sem\u00e1nticas.<\/p>\n","protected":false},"author":4,"featured_media":1683,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_mi_skip_tracking":false},"categories":[24,25,29],"tags":[21,31,30],"_links":{"self":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1680"}],"collection":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/users\/4"}],"replies":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=1680"}],"version-history":[{"count":17,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1680\/revisions"}],"predecessor-version":[{"id":1702,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1680\/revisions\/1702"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/media\/1683"}],"wp:attachment":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=1680"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=1680"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=1680"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}