{"id":1235,"date":"2020-09-30T14:11:36","date_gmt":"2020-09-30T17:11:36","guid":{"rendered":"http:\/\/datamining.dc.uba.ar\/predictivos\/?p=1235"},"modified":"2020-09-30T14:17:19","modified_gmt":"2020-09-30T17:17:19","slug":"analisis-textual-de-reclamos-ambientales-en-la-cuenca-baja-del-matanza-riachuelo","status":"publish","type":"post","link":"https:\/\/datamining.dc.uba.ar\/predictivos\/?p=1235","title":{"rendered":"An\u00e1lisis textual de reclamos ambientales en la cuenca baja del Matanza-Riachuelo"},"content":{"rendered":"<p><span style=\"font-weight: 400;\">Por Ignacio Uman &#8211; <\/span><a href=\"https:\/\/www.linkedin.com\/in\/milena-dotta-a11172139\/\" target=\"_blank\" rel=\"noopener noreferrer\"><b>Milena Dotta<\/b><\/a><b> es Especialista en Explotaci\u00f3n de Datos (UBA) y est\u00e1 por finalizar la cursada de la Maestr\u00eda.\u00a0 Licenciada en Econom\u00eda (UBA), actualmente es Data Scientist en una fintech y se desempe\u00f1\u00f3 en diversas organizaciones privadas y p\u00fablicas.\u00a0<\/b><\/p>\n<div id=\"attachment_1238\" style=\"width: 210px\" class=\"wp-caption alignleft\"><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/09\/milena-dotta.jpg\"><img aria-describedby=\"caption-attachment-1238\" decoding=\"async\" loading=\"lazy\" class=\"size-full wp-image-1238\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/09\/milena-dotta.jpg\" alt=\"\" width=\"200\" height=\"200\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/09\/milena-dotta.jpg 200w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/09\/milena-dotta-150x150.jpg 150w\" sizes=\"(max-width: 200px) 100vw, 200px\" \/><\/a><p id=\"caption-attachment-1238\" class=\"wp-caption-text\">Milena Dotta<\/p><\/div>\n<p><b>Su destacado trabajo de Especializaci\u00f3n <\/b><a href=\"https:\/\/observatorylatinamerica.org\/es\/trabajo-de-especializacion-analisis-de-anticipaciones-urbanas-extra-disciplinares-en-caba-y-en-amba\/\" target=\"_blank\" rel=\"noopener noreferrer\"><b>\u201c<\/b><b><i>An\u00e1lisis de Anticipaciones Urbanas extra-disciplinares en CABA y AMBA<\/i><\/b><\/a><b>\u201d, surgi\u00f3 a partir de una colaboraci\u00f3n directa con un grupo de arquitectos y planificadores urbanos de la Facultad de Arquitectura de la Universidad de Buenos Aires y el Observatorio Latino Americano (OLA) de la Universidad <\/b><b><i>The New York School<\/i><\/b><b>. Este grupo viene analizando diversas expresiones p\u00fablicas en redes sociales, medios de comunicaci\u00f3n o publicaciones digitales en temas ambientales y urbanos, las cuales suelen ser difundidas por integrantes de la sociedad civil, correspondientes a la Regi\u00f3n Metropolitana. El proyecto, dirigido por la investigadora Margarita Gutman, apunta a visibilizar diversas necesidades territoriales de vivienda e infraestructura para conocer en mayor medida las expectativas urbanas de estas comunidades y poder mejorar su planificaci\u00f3n e intervenci\u00f3n p\u00fablica.<\/b><\/p>\n<p><b>En di\u00e1logo con Predictivos, Milena comenta sobre los pormenores de su trabajo final y su experiencia de aprendizaje durante la Maestr\u00eda.<\/b><span style=\"font-weight: 400;\">\u00a0<\/span><\/p>\n<p><b>\u00bfC\u00f3mo surgi\u00f3 la idea de tu trabajo final y la colaboraci\u00f3n con el grupo de FADU-OLA?<\/b><\/p>\n<p><span style=\"font-weight: 400;\">El director de la Maestr\u00eda, Dr. Marcelo Soria, me present\u00f3 a la investigadora Margarita Gutman, Arquitecta y Doctora en Historia con una reconocida trayectoria en el tema de la anticipaci\u00f3n como elemento de un proyecto urbano e identitario. Ella coordina un grupo de investigaci\u00f3n conformado por arquitectos y planificadores urbanos de la Facultad de Arquitectura (FADU-UBA) y el Observatorio Latino Americano (OLA) de la Universidad <\/span><i><span style=\"font-weight: 400;\">The New York School<\/span><\/i><span style=\"font-weight: 400;\">. Este grupo hab\u00eda realizado una importante tarea de recolecci\u00f3n de informaci\u00f3n de las denominadas \u201cAnticipaciones urbanas extra-disciplinares\u201d, que funcionan como mensajes de distintas fuentes digitales, redes, blogs, videos o noticias en boletines barriales sobre problem\u00e1ticas ambientales. Hicieron todo un relevamiento bastante grande y se hizo una categorizaci\u00f3n a mano. El proyecto original de relevamiento de notas hab\u00eda comenzado en 1990 y finaliz\u00f3 en el a\u00f1o 2015.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Lo que me propusieron fue poder aportar un enfoque m\u00e1s sistem\u00e1tico y metodol\u00f3gico desde el an\u00e1lisis y procesamiento de esos datos, de modo de poder llegar a conclusiones interesantes que asocien los reclamos de estas comunidades sobre problem\u00e1ticas socio-ambientales (vivienda e infraestructura de cada municipio y\/o comuna) con las iniciativas para poder solucionarlas. Entiendo que tambi\u00e9n les interes\u00f3 mi perfil porque, como economista, he trabajado en ciertas cuestiones de an\u00e1lisis social en el sector p\u00fablico.<\/span><\/p>\n<p><b>Para comprenderlo mejor, \u00bfpodr\u00edas definir estas \u201canticipaciones\u201d urbanas, en el contexto de la investigaci\u00f3n y por qu\u00e9 ser\u00edan extra-disciplinarias?<\/b><\/p>\n<p><span style=\"font-weight: 400;\">T\u00e9cnicamente estas anticipaciones son un conjunto de \u201c<\/span><i><span style=\"font-weight: 400;\">ideas, proyectos y planes que son propuestos y\/o difundidos por colectivos o individuos de la sociedad civil, como organizaciones no gubernamentales, prensa y periodistas locales, o p\u00fablico en general<\/span><\/i><span style=\"font-weight: 400;\">\u201d. Al estudiar dichas anticipaciones se busca identificar y analizar las demandas difundidas por la sociedad civil en el espacio digital.\u00a0 Se llaman extra-disciplinares en contraposici\u00f3n con las anticipaciones disciplinares, es decir, aquellas producidas por profesionales en el \u00e1mbito de la planificaci\u00f3n urbana institucional, tales como los planes urbanos municipales o sectoriales.<\/span><\/p>\n<p><b>Contame un poco sobre tu actividad con la informaci\u00f3n textual y las variables de las publicaciones. \u00bfC\u00f3mo hiciste para generar el set de datos?<\/b><\/p>\n<p><span style=\"font-weight: 400;\">El grupo ten\u00eda una matriz de 909 registros con 148 variables. No es Big Data pero es una base mediana. El tema es que los datos eran dif\u00edciles de abarcar porque cada caso ten\u00eda muchas variables, muchos cortes, entonces hubo que reconfigurar y limpiar la base. Aparecieron all\u00ed cuestiones propias del Excel, como celdas agrupadas, columnas que ten\u00edan tres niveles de jerarqu\u00eda juntos, valores marcados con una cruz y a veces con un puntito, a veces con un s\u00ed y a veces con un no. Entonces en vez de tener una variable con muchas categor\u00edas, ten\u00edas una grilla con todos los posibles valores que pod\u00eda tomar la variable y todas cruces (X) y unos (1). Por lo que llegar a una reconversi\u00f3n de esto a un formato m\u00e1s ordenado la verdad que fue bastante laborioso. Hab\u00eda adem\u00e1s algunas inconsistencias internas, como datos sin ID o datos geogr\u00e1ficos incorrectos (se asignaban variables del partido de La Matanza a CABA por ej.). El ajuste m\u00e1s fuerte lo hice con Python y llegu\u00e9 a armar una base principal con 48 variables y despu\u00e9s bases auxiliares m\u00e1s espec\u00edficas que hac\u00edan foco en ciertas tem\u00e1ticas urbanas.<\/span><\/p>\n<p><b>Con respecto al Procesamiento del Lenguaje Natural, \u00bfcon qu\u00e9 criterio elegiste las t\u00e9cnicas y qu\u00e9 ventajas tuvieron estas por sobre otras?<\/b><\/p>\n<p><span style=\"font-weight: 400;\">Mi objetivo fue validar la tem\u00e1tica asignada a cada una de las publicaciones en base a lo que dec\u00eda el resumen y el t\u00edtulo. Las t\u00e9cnicas m\u00e1s avanzadas de procesamiento del lenguaje natural (NLP por sus siglas en ingl\u00e9s), como por ejemplo <\/span><i><span style=\"font-weight: 400;\">topic modelling<\/span><\/i><span style=\"font-weight: 400;\"> y <\/span><i><span style=\"font-weight: 400;\">sentiment analysis<\/span><\/i><span style=\"font-weight: 400;\">, trabajan con redes neuronales por lo que\u00a0 se necesita una gran cantidad de informaci\u00f3n para que los resultados sean confiables.\u00a0<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Como la base a analizar no era lo suficientemente grande para usar dichas t\u00e9cnicas de NLP m\u00e1s avanzadas, opt\u00e9 por usar <\/span><i><span style=\"font-weight: 400;\">Wordclouds<\/span><\/i><span style=\"font-weight: 400;\"> para ver cu\u00e1les eran las palabras clave que m\u00e1s aparec\u00edan, lo cual es com\u00fanmente aceptado como un indicador del tema ya que \u201cpara temas similares se utilizan palabras similares\u201d. Antes de realizar cualquier an\u00e1lisis de NLP es necesario realizar un pre-procesamiento y limpieza del texto. En primer lugar se sacan del texto la puntuaci\u00f3n, las tildes, las palabras conectoras o preposiciones (<\/span><i><span style=\"font-weight: 400;\">stop words<\/span><\/i><span style=\"font-weight: 400;\">)\u00a0 y se generan los denominados <\/span><i><span style=\"font-weight: 400;\">tokens<\/span><\/i><span style=\"font-weight: 400;\">, que son las unidades m\u00ednimas de texto a analizar.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Luego de obtener el texto tokenizado, proced\u00ed a encontrar las llamadas <\/span><i><span style=\"font-weight: 400;\">collocations<\/span><\/i><span style=\"font-weight: 400;\">. Las collocations son las palabras compuestas, por lo general nombres propios, como por ejemplo Buenos Aires, R\u00edo Negro, etc. Este paso es de suma importancia ya que si no se consideran las palabras compuestas el an\u00e1lisis tiende a perder riqueza y sentido. Por ejemplo, si la palabra \u201caire\u201d (ejemplo sin marcar las collocations) surge como muy frecuente dentro del corpus es muy diferente a que surja \u201cBuenos Aires\u201d.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Con el texto tokenizado y con las collocations encontradas, se procede a la lematizaci\u00f3n del texto, lo cual consiste en llevar a las palabras a su forma sin inflexi\u00f3n. Dos ejemplos de lematizaci\u00f3n son llevar los verbos de sus formas conjugadas al infinitivo (reclamaban, reclamaste se transforman en reclamar) y llevar sustantivos y verbos a su forma sin inflexi\u00f3n (vecinos, vecinas se transforman en vecino). En general las librer\u00edas disponibles en Python para realizar este procedimiento funcionan bien en ingl\u00e9s pero no en espa\u00f1ol. Por suerte en este caso pude encontrar una librer\u00eda confiable de la Universidad de Stanford que se llama Stanza. Tiene un Git muy prolijo, hace un buen tratamiento de las collocations y tiene un excelente lematizador . Esto, en definitiva, hizo que pueda lograr mejores resultados.<\/span><\/p>\n<p><b>\u00bfC\u00f3mo fue el trabajo anal\u00edtico de comparaci\u00f3n y visualizaci\u00f3n de las notas una vez que pudiste consolidar su procesamiento?<\/b><\/p>\n<p><span style=\"font-weight: 400;\">Primero valid\u00e9 las conclusiones que el grupo de investigaci\u00f3n hab\u00eda extra\u00eddo. Luego me surgi\u00f3 el inter\u00e9s de reconocer una problem\u00e1tica ambiental general y de comparar entre regiones, CABA y GBA. La clave fue ver anal\u00edticamente las diferencias entre los reclamos de cada regi\u00f3n y tambi\u00e9n observar que ten\u00eda un correlato con los censos realizados. A su vez, se encuentra una coherencia entre los reclamos y los \u00edndices de necesidades b\u00e1sicas insatisfechas (NBI). Estas diferencias entre regiones marcaron el tipo de pol\u00edtica a llevar a cabo para resolverla y quedaron claramente mapeadas.\u00a0<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Qued\u00f3 bastante claro que la zona sur de CABA tiene un problema serio en lo que es vivienda y lo que es GBA trae aparejado problemas de infraestructura severa: cloacas, agua potable y recolecci\u00f3n de residuos. Esta \u00faltima es una problem\u00e1tica muy grande en La Matanza sumada a la problem\u00e1tica del Riachuelo. El enfoque del proyecto fue tratarlo desde la cuenca baja y media del r\u00edo Matanza-Riachuelo, siendo la zona de an\u00e1lisis, que engloba a las comunas del sur de CABA y toda la parte sur de AMBA y La Matanza.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">\u00a0En cuestiones de infraestructura las diferencias son claras:<\/span><\/p>\n<p><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/09\/registros-infraestructura.png\"><img decoding=\"async\" loading=\"lazy\" class=\"alignleft wp-image-1236\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/09\/registros-infraestructura.png\" alt=\"\" width=\"796\" height=\"399\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/09\/registros-infraestructura.png 818w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/09\/registros-infraestructura-300x150.png 300w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/09\/registros-infraestructura-768x385.png 768w\" sizes=\"(max-width: 796px) 100vw, 796px\" \/><\/a><\/p>\n<p><b>WC Infraestructura CABA &#8211; WC Infraestructura GBA<\/b><\/p>\n<p><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/09\/WC.png\"><img decoding=\"async\" loading=\"lazy\" class=\"alignleft size-full wp-image-1237\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/09\/WC.png\" alt=\"\" width=\"803\" height=\"404\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/09\/WC.png 803w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/09\/WC-300x151.png 300w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/09\/WC-768x386.png 768w\" sizes=\"(max-width: 803px) 100vw, 803px\" \/><\/a><\/p>\n<p><b>\u00bfQu\u00e9 correlaciones pudiste encontrar entre la demanda o reclamo de la comunidad y las propuestas generadas por vecinos y vecinas?<\/b><\/p>\n<p><span style=\"font-weight: 400;\">Los <\/span><i><span style=\"font-weight: 400;\">Wordclouds<\/span><\/i><span style=\"font-weight: 400;\"> mostraron expl\u00edcitamente qu\u00e9 es lo que se ped\u00eda. Definitivamente existen ciertas variaciones en los niveles de concreci\u00f3n de los pedidos entre las distintas zonas pero m\u00e1s que nada prima el hecho de que las propuestas tienen estado de concreci\u00f3n nulo o preliminar y que hab\u00eda pocas propuestas avanzadas. La escala suele ser barrial, con proyecciones a corto plazo, el per\u00edodo de propuesta es muy breve y la b\u00fasqueda de soluci\u00f3n es inmediata.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Un problema fue no haber podido acceder a las fuentes originales de los reclamos ya que al trabajar con res\u00famenes realizados por un conjunto limitado de personas se pierde parte de la riqueza de los textos. En un momento pens\u00e9 en scrapear cada una de las p\u00e1ginas relevadas,\u00a0 pero era muy dif\u00edcil ya que como todas las fuentes son distintas, sus c\u00f3digos HTML difieren mucho entre s\u00ed y la limpieza de los mismos hubiera sido muy tediosa. Por eso mi recomendaci\u00f3n para futuras iteraciones fue conservar las fuentes originales, ya que tambi\u00e9n podr\u00edan servir, por ejemplo, para hacer an\u00e1lisis de sentimientos de los mensajes escritos en estas comunidades.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">\u00a0<\/span><b>\u00bfCu\u00e1l fue el mayor desaf\u00edo del trabajo?<\/b><\/p>\n<p><span style=\"font-weight: 400;\">Durante el uso de la librer\u00eda Stanza no fue tan simple entender el tema de la implementaci\u00f3n de la b\u00fasqueda de collocations. Sin embargo, finalmente logr\u00e9 estructurar un Pipeline de trabajo bastante limpio donde s\u00f3lo es necesario tener como imput el corpus para obtener como resultado de salida el texto limpio. Gener\u00e9 un par de archivos .py desde los cuales se puede ir llamando a las diferentes funciones creadas y cada .py comprende un conjunto de funciones de un tema. Por ejemplo, si llamo a la funci\u00f3n \u201climpieza de texto\u201d dentro de esa limpieza de texto est\u00e1 estructurada la limpieza de las puntuaciones, de tildes, <\/span><i><span style=\"font-weight: 400;\">tokenizaci\u00f3n<\/span><\/i><span style=\"font-weight: 400;\">, <\/span><i><span style=\"font-weight: 400;\">collocations<\/span><\/i><span style=\"font-weight: 400;\"> y directamente se recibe el texto lematizado. Eso fue importante para poder estructurar la investigaci\u00f3n, un desaf\u00edo m\u00e1s a nivel personal, ya que el valor fue generar un c\u00f3digo de limpieza de texto que se pueda aplicar a cualquier corpus m\u00e1s all\u00e1 de que si uno ve en el trabajo el c\u00f3digo principal hay s\u00f3lo 3 funciones.<\/span><\/p>\n<p><b>Por \u00faltimo, \u00bfqu\u00e9 opini\u00f3n te merece la Maestr\u00eda y c\u00f3mo fue tu experiencia de aprendizaje?<\/b><\/p>\n<p><span style=\"font-weight: 400;\">El posgrado me sirvi\u00f3 un mont\u00f3n, fue un giro para mi carrera profesional y me quedan dos materias. Creo que la cursada depende mucho de uno c\u00f3mo aprovecharla. En lo personal aprend\u00ed a programar por mi cuenta, arranqu\u00e9 la Maestr\u00eda y ya sab\u00eda programar. Not\u00e9 que hab\u00eda compa\u00f1eros que estaban a la expectativa de que les ense\u00f1en a programar. Pero yo tuve otra expectativa, a m\u00ed la Maestr\u00eda me dio todo el background de formaci\u00f3n de las t\u00e9cnicas y metodolog\u00edas. Porque hay muchas librer\u00edas y cursos disponibles, pero entender un poco la ciencia tras bambalinas es lo que termina de marcar la labor de cada uno.\u00a0<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Despu\u00e9s l\u00f3gicamente es cuesti\u00f3n de d\u00f3nde cada uno le aporta una impronta, su ingrediente a los trabajos finales o de tesis, su originalidad a las investigaciones. Por otro lado, a modo de sugerencia, considero que quiz\u00e1s se podr\u00eda optimizar el recorrido de aprendizaje, mejorando la interacci\u00f3n y comunicaci\u00f3n entre los docentes de las diferentes materias, como para saber desde d\u00f3nde arrancar y no solapar el dictado de algunos temas en las diferentes materias y tambi\u00e9n para no quedarse desactualizado. Es una cuesti\u00f3n de tener en cuenta la correlatividad de contenidos y, al mismo tiempo, de aggiornarse permanentemente.<\/span><\/p>\n<p>&nbsp;<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Milena Dotta es Especialista en Explotaci\u00f3n de Datos (UBA) y est\u00e1 por finalizar la cursada de la Maestr\u00eda.  Licenciada en Econom\u00eda (UBA), actualmente es Data Scientist en una fintech y se desempe\u00f1\u00f3 en diversas organizaciones privadas y p\u00fablicas.  En di\u00e1logo con Predictivos, Milena comenta sobre los pormenores de su trabajo final \u201cAn\u00e1lisis de Anticipaciones Urbanas extra-disciplinares en CABA y AMBA\u201d.<\/p>\n","protected":false},"author":4,"featured_media":1239,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_mi_skip_tracking":false},"categories":[24,34,36,25],"tags":[21,35,37,31],"_links":{"self":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1235"}],"collection":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/users\/4"}],"replies":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=1235"}],"version-history":[{"count":3,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1235\/revisions"}],"predecessor-version":[{"id":1242,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1235\/revisions\/1242"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/media\/1239"}],"wp:attachment":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=1235"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=1235"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=1235"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}