{"id":1018,"date":"2019-04-01T11:07:32","date_gmt":"2019-04-01T14:07:32","guid":{"rendered":"http:\/\/datamining.dc.uba.ar\/predictivos\/?p=1018"},"modified":"2019-04-11T17:58:25","modified_gmt":"2019-04-11T20:58:25","slug":"el-analisis-automatico-de-grandes-volumenes-de-textos-abre-una-nueva-ventana-para-estudiar-temas-de-las-ciencias-sociales","status":"publish","type":"post","link":"https:\/\/datamining.dc.uba.ar\/predictivos\/?p=1018","title":{"rendered":"\u201cEl an\u00e1lisis autom\u00e1tico de grandes vol\u00famenes de textos abre una nueva ventana para estudiar temas de las ciencias sociales\u201d"},"content":{"rendered":"<h5><strong>Edgar Altszyler es doctor en F\u00edsica de la Universidad de Buenos Aires y Licenciado y Mag\u00edster en F\u00edsica del Instituto Balseiro.\u00a0 Actualmente, es becario postdoctoral en el Laboratorio de Inteligencia Artificial Aplicada\u00a0 (LIAA) de Exactas-UBA. Sus investigaciones se centran en la aplicaci\u00f3n de t\u00e9cnicas de miner\u00eda de textos y aprendizaje autom\u00e1tico para el estudio del comportamiento social y cultural, la psicolog\u00eda y la salud mental. Recientemente se incorpor\u00f3 como profesor de la Maestr\u00eda en Data Mining-UBA y tambi\u00e9n trabaja como consultor de ciencia de datos para la Fundaci\u00f3n Sadosky.<\/strong><\/h5>\n<h5><strong>En esta entrevista con el <a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\">Blog Predictivos<\/a>, Edgar nos cuenta qu\u00e9 valor agregado considera que aporta un posgrado a quienes est\u00e9n interesados en formarse en ciencia de datos, qu\u00e9 se investiga en el \u00e1rea de procesamiento de textos y cu\u00e1les son los grandes desaf\u00edos en los que est\u00e1 trabajando actualmente.<\/strong><\/h5>\n<p><strong>\u00bf<\/strong><strong>Qu\u00e9 importancia cre\u00e9s que tiene la Maestr\u00eda en Data Mining para generar una nueva camada de profesionales en ciencia de datos?<\/strong><\/p>\n<p>La ciencia de datos es un \u00e1rea que est\u00e1 en un crecimiento exponencial y es muy atractiva. Todos los temas alrededor como Big Data e Inteligencia Artificial y las nuevas herramientas que est\u00e1n apareciendo -que a veces parecen de ciencia ficci\u00f3n- confluyen en que haya much\u00edsimas personas interesadas en aprender estas t\u00e9cnicas.<\/p>\n<p>Ese inter\u00e9s es f\u00e1cilmente canalizable a trav\u00e9s de espacios en los que uno puede aprender de manera autoadministrada, por ejemplo los cursos de Coursera. Est\u00e1 al alcance de la mano pero hay una limitaci\u00f3n que tiene que ver con las bases estad\u00edsticas y de conocimiento formal que uno necesita para desempe\u00f1arse profesionalmente. Por este motivo creo que el posgrado provee una base s\u00f3lida que quiz\u00e1s con algunos cursos cortos no se van a poder alcanzar. Un ejemplo, uno puede bajarse de internet un Tutorial para hacer un clasificador de redes neuronales en 5 l\u00edneas de c\u00f3digo en Python. Ahora bien, \u00bfc\u00f3mo se puede saber qu\u00e9 l\u00edneas usar exactamente para tu problema a resolver? Es algo que requiere un entendimiento m\u00e1s profundo.<\/p>\n<p><strong>\u00bfPodr\u00edas contarme sobre el aporte puntual de la Miner\u00eda de Textos, que en particular es el nombre de la materia que dict\u00e1s?<\/strong><\/p>\n<p>La Miner\u00eda de Textos o com\u00fanmente Procesamiento del Lenguaje Natural, es la manera de desarrollar un an\u00e1lisis cuantitativo a partir de texto concreto. Para ello usamos todo el bagaje de la ciencia de datos, como t\u00e9cnicas estad\u00edsticas, redes neuronales, clustering y predicciones.<\/p>\n<p>Hay una gran variedad de m\u00e9todos, desde capturar partes de palabras o frases del texto, a partir de las reglas de qu\u00e9 letras las componen\u00a0 hasta herramientas que permiten detectar t\u00f3picos comunes, de qu\u00e9 habla un corpus de textos, es decir, una colecci\u00f3n de varios documentos.\u00a0 Uno puede usar estos m\u00e9todos para estudiar de qu\u00e9 habla la Wikipedia, un diario online o un grupo de usuarios de las redes sociales, entre otros ejemplos. \u00a0Tambi\u00e9n existen nuevas herramientas que nos permiten cuantificar qu\u00e9 tan cerca est\u00e1n las palabras entre s\u00ed seg\u00fan un conjunto determinado de textos.<\/p>\n<p><strong>\u00bfC\u00f3mo ser\u00eda esa cuantificaci\u00f3n?<\/strong><\/p>\n<p><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/04\/categorias-post.png\"><img decoding=\"async\" loading=\"lazy\" class=\"alignleft wp-image-1020\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/04\/categorias-post.png\" alt=\"\" width=\"419\" height=\"312\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/04\/categorias-post.png 667w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/04\/categorias-post-300x223.png 300w\" sizes=\"(max-width: 419px) 100vw, 419px\" \/><\/a>Por ejemplo, si yo te pido que ubiques el n\u00famero 25 entre el 0 y el 100, todos coincidiremos en que es el cuarto de la recta. Ahora, si te pido que\u00a0 ubiques a la palabra \u201cbote\u201d entre el \u201cmar\u201d y la \u201clicuadora\u201d, no es tan obvio ubicar num\u00e9ricamente c\u00f3mo las palabras se relacionan entre s\u00ed. Por lo pronto, estamos de acuerdo en que el concepto de mar est\u00e1 m\u00e1s cerca del concepto de bote que el de una licuadora. Lo que se estudia es si las palabras est\u00e1n relacionadas entre s\u00ed, algo que se denomina \u201csimilaridad sem\u00e1ntica\u201d: qu\u00e9 tan cercanas est\u00e1n las palabras entre s\u00ed seg\u00fan su significado.<\/p>\n<p>Esto se suele hacer en forma autom\u00e1tica. En uno de los trabajos del Laboratorio de Inteligencia Artificial Aplicada (LIAA), desarrollados con un psic\u00f3logo y un investigador del \u00e1rea de neurociencia, usamos herramientas que nos permiten cuantificar c\u00f3mo se asocian las palabras entre s\u00ed para testear una hip\u00f3tesis de teor\u00eda de sue\u00f1os. Ten\u00edamos una colecci\u00f3n de m\u00e1s de 20 mil textos de sue\u00f1os escritos, donde la gente se levantaba a la ma\u00f1ana y describ\u00eda en un texto qu\u00e9 so\u00f1aba. Lo que quer\u00edamos atacar es una teor\u00eda que dice que uno de los motivos de so\u00f1ar es aprovechar esta realidad virtual para entrenarnos sobre c\u00f3mo enfrentar situaciones de amenaza. En la vida real si te enfrent\u00e1s con un le\u00f3n, vas a tener pocas chances de entrenarte para eso. Pero en un sue\u00f1o pod\u00e9s entrenarte muchas veces, si es un sue\u00f1o reiterado. Con estas herramientas le pregunt\u00e1bamos a los textos de los sue\u00f1os, qu\u00e9 so\u00f1aban los individuos cuando corr\u00edan y encontramos que se escapaban de situaciones de peligro.<\/p>\n<p>Pero si buscamos un texto de internet o de un libro, uno corre en situaciones deportivas por ejemplo. De esa manera pudimos testear esta teor\u00eda. Le preguntamos a la herramienta, cu\u00e1les son las palabras m\u00e1s asociadas al verbo \u201ccorrer\u201d, tanto en los textos de sue\u00f1os como en los textos donde uno est\u00e1 despierto.<\/p>\n<p><strong>\u00bfY est\u00e1s trabajando tambi\u00e9n en temas de datos para el \u00e1rea de la salud?<\/strong><\/p>\n<p>El a\u00f1o pasado trabajamos en un proyecto de Triage Autom\u00e1tico (clasificaci\u00f3n seg\u00fan gravedad) de mensajes en foros y redes sociales. Esto surgi\u00f3 a partir de una competencia internacional. El caso era de una red social de salud mental en Australia, un espacio donde distintos j\u00f3venes pueden charlar sobre las situaciones que le suceden, relacionados con problemas psicol\u00f3gicos y\/o emocionales. Los moderadores de la red leen permanentemente los mensajes y, en funci\u00f3n de ello, brindan asesoramiento. Lo que sucedi\u00f3 es que hab\u00eda tantos mensajes que los moderadores no daban abasto para leerlos todos. Entonces se contactaron con un grupo de investigadores que desarrollaron esta competencia en el marco de \u00a0uno de los congresos m\u00e1s relevantes del \u00e1rea de psiquiatr\u00eda computacional. El prop\u00f3sito era armar un sistema de aprendizaje autom\u00e1tico que pudiera detectar el grado de urgencia que ten\u00eda cada mensaje.<\/p>\n<p>Los organizadores nos invitaron a participar de la competencia en Estados Unidos, donde hab\u00eda otros equipos. Y nos fue muy bien, ya que de las 4 tareas en 3 obtuvimos el primer puesto y en la otra tarea obtuvimos el segundo puesto. Estos resultados los presentamos en un workshop \u00a0de Ling\u00fc\u00edstica Computacional y Psicolog\u00eda Cl\u00ednica en New Orleans. El paper publicado junto a otros autores es:\u00a0 \u201c<a href=\"https:\/\/www.aclweb.org\/anthology\/W18-0606\"><em>Using contextual information for automatic triage of posts in a peer-support forum<\/em><\/a>\u201d (Proceedings of the Fifth Workshop on Computational Linguistics and Clinical Psychology: From Keyboard to Clinic).<\/p>\n<p><strong>\u00bfQu\u00e9 t\u00e9cnicas utilizaron para procesar los mensajes?<\/strong><\/p>\n<p>De toda la red ten\u00edamos mil ejemplos de mensajes ya clasificados manualmente por expertos seg\u00fan la gravedad de cada caso: de los m\u00e1s cr\u00edticos, de los que eran situaciones intermedias y de los que no requer\u00edan atenci\u00f3n. A partir de estos mensajes ya anotados manualmente por los expertos, las herramientas de aprendizaje autom\u00e1tico aprenden los patrones o elementos caracter\u00edsticos que sirven para poder clasificar e identificar los distintos grupos de mensajes. As\u00ed cuando llega un nuevo mensaje, ya autom\u00e1ticamente se puede hacer el triage.<\/p>\n<p>Para este proyecto utilizamos software libre como Python, que cuenta con paquetes espec\u00edficos de aprendizaje autom\u00e1tico, pero la parte de creatividad del trabajo es saber elegir qu\u00e9 elementos extraer de los textos, teniendo en cuenta aquellos que ser\u00e1n \u00fatiles para clasificar. Por ello requiere un trabajo de programaci\u00f3n manual de la herramienta.<\/p>\n<p><strong>Por \u00faltimo, \u00bfcu\u00e1les son las oportunidades m\u00e1s importantes que est\u00e1s viendo en el procesamiento de textos?<\/strong><\/p>\n<p>En el \u00e1rea de Procesamiento del Lenguaje Natural hoy contamos con grandes vol\u00famenes de texto que antes eran inimaginables como acceder a una Wikipedia, un diario o revista o una red social entera por ejemplo. Esto abre una nueva ventana a estudiar especialmente ciertos elementos de la sociolog\u00eda, que quiz\u00e1s antes se hac\u00edan 100% manualmente. Personalmente me atrae mucho el estudio y uso de estas herramientas en colaboraci\u00f3n con profesionales de las ciencias sociales.<\/p>\n<p>&nbsp;<\/p>\n<h4><strong>Un f\u00edsico de los datos textuales<\/strong><\/h4>\n<h5><strong>Edgar Altszyler tiene\u00a0 33 a\u00f1os y se gradu\u00f3 en el Instituto Balseiro a los 24 a\u00f1os. Trabajaba en F\u00edsica At\u00f3mica pero reconoce que siempre en su carrera le gust\u00f3 la Estad\u00edstica aplicada a temas interdisciplinarios: \u201c<em>Hice un doctorado en la UBA en temas de biolog\u00eda computacional y en la mitad de mi doctorado fui a una charla anual de la Maestr\u00eda en Data Mining y qued\u00e9 fascinado con el Procesamiento del Lenguaje Natural. Desde ese momento empec\u00e9 a leer e investigar por mi cuenta, por eso desde el posdoctorado finalmente me insert\u00e9 en el Laboratorio en este \u00e1rea<\/em>\u201d.<\/strong><\/h5>\n<h5><strong>Ante la pregunta sobre c\u00f3mo le sirvi\u00f3 la f\u00edsica para estudiar estos problemas, responde \u201c<em>Para m\u00ed la f\u00edsica es el modelado de la naturaleza a trav\u00e9s de la matem\u00e1tica.\u00a0 Es justamente este background que nos permite pensar estos problemas de modelado matem\u00e1tico m\u00e1s f\u00e1cilmente y que se complementa con cualquier otra formaci\u00f3n<\/em>\u201d.<\/strong><\/h5>\n<p>&nbsp;<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Edgar Altszyler es doctor en F\u00edsica de la Universidad de Buenos Aires y Licenciado y Mag\u00edster en F\u00edsica del Instituto Balseiro.\u00a0 Actualmente, es becario postdoctoral en el Laboratorio de Inteligencia Artificial Aplicada\u00a0 (LIAA) de Exactas-UBA. Sus investigaciones se centran en la aplicaci\u00f3n de t\u00e9cnicas de miner\u00eda de textos y aprendizaje autom\u00e1tico para el estudio del comportamiento social y cultural, la psicolog\u00eda y la salud mental. [&hellip;]<\/p>\n","protected":false},"author":4,"featured_media":1019,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_mi_skip_tracking":false},"categories":[24,36,22,25],"tags":[21,37,19,31],"_links":{"self":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1018"}],"collection":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/users\/4"}],"replies":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=1018"}],"version-history":[{"count":5,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1018\/revisions"}],"predecessor-version":[{"id":1025,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1018\/revisions\/1025"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/media\/1019"}],"wp:attachment":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=1018"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=1018"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=1018"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}