{"id":566,"date":"2016-11-11T18:28:35","date_gmt":"2016-11-11T18:28:35","guid":{"rendered":"http:\/\/triton.exp.dc.uba.ar\/predictivos\/?p=566"},"modified":"2016-11-11T18:33:35","modified_gmt":"2016-11-11T18:33:35","slug":"el-gran-desafio-que-tenemos-es-la-biologia-de-sistemas","status":"publish","type":"post","link":"https:\/\/datamining.dc.uba.ar\/predictivos\/?p=566","title":{"rendered":"\u201cEl gran desaf\u00edo que tenemos es la Biolog\u00eda de Sistemas\u201d"},"content":{"rendered":"<p><strong><a href=\"https:\/\/triton.exp.dc.uba.ar\/predictivos\/wp-content\/uploads\/2016\/11\/Marcelo-Soria-OK.jpg\" rel=\"attachment wp-att-567\"><img decoding=\"async\" loading=\"lazy\" class=\"alignleft size-medium wp-image-567\" src=\"https:\/\/triton.exp.dc.uba.ar\/predictivos\/wp-content\/uploads\/2016\/11\/Marcelo-Soria-OK-300x230.jpg\" alt=\"Marcelo Soria\" width=\"300\" height=\"230\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2016\/11\/Marcelo-Soria-OK-300x230.jpg 300w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2016\/11\/Marcelo-Soria-OK-768x590.jpg 768w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2016\/11\/Marcelo-Soria-OK-1024x787.jpg 1024w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2016\/11\/Marcelo-Soria-OK-1200x922.jpg 1200w\" sizes=\"(max-width: 300px) 100vw, 300px\" \/><\/a>Hablemos primero de tus principales proyectos de investigaci\u00f3n. \u00bfQu\u00e9 t\u00e9cnicas de ciencia de datos est\u00e1s utilizando? <\/strong><\/p>\n<p>Las l\u00edneas de trabajo son en bioinform\u00e1tica, una intersecci\u00f3n de ciencias de datos con biolog\u00eda y gen\u00e9tica. Tengo dos l\u00edneas principales, una primera que es de ecolog\u00eda microbiana en la Facultad de Agronom\u00eda, espec\u00edficamente en el INBA, que es un instituto UBA\/CONICET.<\/p>\n<p>Usamos una serie de t\u00e9cnicas de laboratorio y de ciencia de datos para entender c\u00f3mo se modifican las comunidades microbianas como resultado de procesos de deforestaci\u00f3n y de cambios en el uso agr\u00edcola del suelo. La idea es determinar si esas modificaciones en las comunidades microbianas terminan generando cambios en la calidad del suelo. En este proyecto, podemos secuenciar ADN a muy bajo costo, con miles o millones de secuencias a partir de una sola muestra. Entonces, podemos tener una muestra de suelo, de esa muestra amplificar un gen que nos interese ver, secuenciarlo e identificar a qu\u00e9 microorganismo pertenece.<\/p>\n<p>Con un enfoque similar, tambi\u00e9n estamos analizando las comunidades de bacterias que viven en el intestino de insectos como las termitas, para intentar descubrir nuevos genes que degradan restos vegetales y que se pueden usar en biotecnolog\u00eda, en la producci\u00f3n de biocombustibles.<\/p>\n<p>Como suele suceder en ciencia de datos, se requiere una primera etapa de limpieza de los datos y preparaci\u00f3n de los datos que lleva bastante tiempo. Los secuenciadores tienen errores, hay que tratar de corregir esos errores y normalizar los datos. Luego nos proponemos identificar esas secuencias y denominar a cada bacteria. Tenemos algoritmos disponibles para hacer coincidir secuencias conocidas en bases de datos. A diferencia de lo que suceder\u00eda en una base tradicional, para nosotros muchas la identidad no es tan importante como saber a qui\u00e9n se parece.<\/p>\n<p>A partir de estas t\u00e9cnicas estamos aprendiendo much\u00edsimo m\u00e1s sobre c\u00f3mo se organizan y qu\u00e9 hacen los microorganismos en diferentes comunidades. Podemos armar perfiles de las miles de especies que conviven en cualquier ambiente. Lo interesante es que los perfiles van cambiando no solamente de acuerdo al ambiente sino por ejemplo en el caso de las comunidades microbianas que tenemos en el intestino, de acuerdo a las dietas o a las enfermedades.<\/p>\n<p>Estamos observando una gran cantidad de comunidades microbianas que var\u00edan con las condiciones ambientales y hay un punto donde uno se empieza a preguntar si estas variaciones son causa o consecuencia. Eso todav\u00eda lo estamos aprendiendo. Los microorganismos parecer\u00edan ser la causa de algunas enfermedades. En otros casos, en situaciones de contaminaci\u00f3n ambiental, por ejemplo, la comunidad microbiana va a cambiar y se va a adaptar a esos contaminantes nuevos y ah\u00ed es donde el cambio va a ser una consecuencia de la contaminaci\u00f3n.<\/p>\n<p>La segunda l\u00ednea de trabajo que tenemos es el estudio de la bacteria que causa la tuberculosis bovina. Desde nuestro instituto, colaboramos desde el a\u00f1o 2008 con el Laboratorio de Tuberculosis Bovina del Instituto Nacional de Tecnolog\u00eda Agropecuaria (INTA), que est\u00e1 funcionando en el Instituto de Biotecnolog\u00eda que tiene el INTA en Castelar. Ellos poseen todo el manejo experimental certificado para poder trabajar con pat\u00f3genos. Nosotros en el Laboratorio hacemos la parte de Bioinform\u00e1tica, que tiene muchos cruces con ciencia de datos. Una tarea t\u00edpica en esta l\u00ednea es secuenciar ADN pero de un solo microorganismo, con el objetivo de poder saber c\u00f3mo es el genoma de ese microorganismo.<\/p>\n<p><strong>\u00bfEl estudio de la tuberculosis bovina permite saber m\u00e1s sobre la tuberculosis en humanos?<\/strong><\/p>\n<p>Entre \u201c<em>Mycobacterium bovis<\/em>\u201d (tuberculosis bovina) y \u201c<em>Mycobacterium tuberculosis<\/em>\u201d (tuberculosis humana) existe una similitud del genoma entre 97 y 98%.\u00a0 Por lo tanto, encontramos bastantes puntos en com\u00fan entre una y otra enfermedad. En este caso, buscamos similitudes y diferencias en las secuencias de ADN de los genomas de variantes de estas bacterias que tienen diferentes niveles de patogenicidad. Lo que intentamos encontrar son cambios en las secuencias de ADN que expliquen esas diferencias. Tambi\u00e9n analizamos c\u00f3mo cambian los patrones de expresi\u00f3n de genes en diferentes mutantes de esta bacteria y bajo diferentes condiciones ambientales.<\/p>\n<p>El genoma de la bacteria de la tuberculosis en vacas contiene 4 millones y medio de nucle\u00f3tidos. No existe ning\u00fan equipo que nos d\u00e9 la secuencia ordenada de eso. Lo que tenemos son equipos que proveen fragmentos al azar y, luego, se utiliza todo un proceso para reconstruir esos fragmentos con diferente software.<\/p>\n<p>En estas \u00e1reas la gran mayor\u00eda de los datos son p\u00fablicos, con lo cual uno puede trabajar con datos que no se hayan producido en su propio laboratorio ni en el laboratorio con el que uno colabora. Adem\u00e1s de las bases de datos de bibliograf\u00eda, una cantidad enorme de datos gen\u00e9ticos est\u00e1n disponibles en fuentes p\u00fablicas.<\/p>\n<p>Hace un tiempo empezamos a trabajar con Crhistian Cardona, un alumno de la Maestr\u00eda en Data Mining, \u00a0para organizar esta informaci\u00f3n utilizando bases de datos de grafos. Este fue el trabajo de tesis de Crhistian.<\/p>\n<p><strong>S\u00e9 por otras entrevistas que prefer\u00eds hablar de Ciencia de Datos antes que de Big Data. \u00bfC\u00f3mo ves la relaci\u00f3n entre ciencia de datos y datos biol\u00f3gicos, particularmente con la cantidad de aplicaciones que existen?<\/strong><\/p>\n<p>Lo que est\u00e1 pasando ahora es que muchas \u00e1reas de la biolog\u00eda se est\u00e1n transformando en \u00e1reas Dato-intensivas. Realmente cuesta conseguir estudiantes para cubrir ciertas posiciones de posgrado. Porque el estudiante que viene de carreras biol\u00f3gicas no suele tener este background de datos y programaci\u00f3n para este tipo de proyectos. Al mismo tiempo, a los estudiantes de inform\u00e1tica tambi\u00e9n les resulta dif\u00edcil llegar a entender los procesos biol\u00f3gicos, los problemas y el lenguaje espec\u00edfico, ya que la biolog\u00eda es una ciencia de sistemas complejos. Cuando uno sit\u00faa los procesos biol\u00f3gicos a nivel de \u00e1reas de estudio, existen carreras muy diferentes: agronom\u00eda, medicina, biolog\u00eda, biotecnolog\u00eda, etc. Hay varias \u00e1reas de la biolog\u00eda que se est\u00e1n transformando en Dato-intensivas, es important\u00edsimo tener alguien que no solamente maneje el enfoque estad\u00edstico o de bases de datos, se necesita alguien con una visi\u00f3n m\u00e1s integral que es lo que requiere la Ciencia de Datos.<\/p>\n<p><strong>\u00bfY cu\u00e1nto se hace de Data Mining en los grupos de investigaci\u00f3n actuales, teniendo en cuenta que hacer Bioinform\u00e1tica no es lo mismo que hacer Data Mining?<\/strong><\/p>\n<p>Pero hay una convergencia entre ambas cosas. Si bien la bioinform\u00e1tica tuvo un nacimiento independiente del Data Mining, los dos t\u00e9rminos empiezan a aparecer en el mismo momento, a principios de los a\u00f1os 80 ya se hablaba de esto. Dir\u00eda que bioinform\u00e1tica implica aplicar la miner\u00eda de datos a procesos biol\u00f3gicos. Alguien que haya estudiado ciencia de datos y se quiera aproximar a la biolog\u00eda, va a tener a la biolog\u00eda como barrera. En cambio, todo lo que sepa de ciencia de datos le va a sumar. Pero vemos cuestiones muy locales. Por ejemplo, todos los algoritmos para encontrar patrones en secuencias, est\u00e1n restringidos a la biolog\u00eda en particular. No necesariamente se encuentran en los libros de ciencia de datos. No son m\u00e9todos trasladables a otras \u00e1reas, como por ejemplo, cuando uno trabaja con grafos, clasificaci\u00f3n, agrupamientos, etc. lo cual es horizontal a diversas disciplinas.<\/p>\n<p><strong>\u00bfC\u00f3mo imagin\u00e1s el futuro de Ciencia de Datos y Bioinform\u00e1tica?<\/strong><\/p>\n<p>30 a\u00f1os atr\u00e1s uno pod\u00eda pensar conceptualmente en secuenciar el ADN de toda una familia para encontrar las causas de una enfermedad hereditaria. El concepto estaba pero no se pod\u00eda hacer porque el costo era alt\u00edsimo.<\/p>\n<p>Con la secuenciaci\u00f3n gen\u00f3mica completa de la planta <em>Arabidopsis thaliana<\/em>, poco tiempo despu\u00e9s del desciframiento del genoma humano en el a\u00f1o 2000, la ciencia abri\u00f3 una puerta hacia nuevas aplicaciones de inter\u00e9s agron\u00f3mico, ambiental, energ\u00e9tico e industrial. El problema surgi\u00f3 cuando hubo que ordenar los cientos y miles de datos que este descubrimiento ofrec\u00eda: la soluci\u00f3n fue hacerlo en forma autom\u00e1tica.<\/p>\n<p>Muchas de las cosas que vemos hoy suceden porque se desarrollan mejores instrumentos que tienen mayor rendimiento, los costos bajan y la tendencia es que estos costos sigan reduci\u00e9ndose. De hecho, est\u00e1n apareciendo secuenciadores que cada vez secuencian fragmentos m\u00e1s largos. Antes pod\u00edamos medir hasta 800 nucle\u00f3tidos. Ahora en un solo tramo podemos tener secuencias de varios miles de nucle\u00f3tidos.<\/p>\n<p>Es muy probable que dentro de poco tiempo cada uno pueda tener su genoma secuenciado y analizado por menos de mil d\u00f3lares. Eso va a abrir m\u00faltiples posibilidades. No solamente va a haber una demanda para hacer an\u00e1lisis m\u00e1s r\u00e1pido y m\u00e1s eficiente sobre una cantidad de datos en aumento, sino que se va a generar conocimiento nuevo. En los casos tecnol\u00f3gicos de Google y Facebook, han trabajado e investigado sobre su propia complejidad de datos. Lo mismo va a pasar con nosotros, en biolog\u00eda va a haber una revoluci\u00f3n conceptual de lo que vayamos aprendiendo de este volumen de datos sin precedentes.<\/p>\n<p><strong>\u00bfCu\u00e1l es hoy tu mayor desaf\u00edo a nivel profesional?<\/strong><\/p>\n<p>Hay todo un tema en biolog\u00eda que ser\u00eda como el siguiente paso de la bioinform\u00e1tica: la Biolog\u00eda de Sistemas. Durante mucho tiempo la biolog\u00eda molecular, que tiene que ver con toda la cuesti\u00f3n gen\u00f3mica que estuve mencionando anteriormente, fue un enfoque muy exitoso pero reduccionista. Tratar de llevar eso a c\u00f3mo funciona el organismo en un ambiente o relacionar la influencia del ambiente sobre el estado de salud de la persona, es un salto grande. Ahora empieza a haber una convergencia con este enfoque que fue acusado de reduccionista pero como result\u00f3 tan exitoso y gener\u00f3 un enorme volumen de datos, necesita integrarse a marcos de an\u00e1lisis mucho m\u00e1s grandes.<\/p>\n<p>En diferentes \u00e1reas biol\u00f3gicas surgen datos que se fueron generando por diferentes m\u00e9todos experimentales, de acuerdo a la tecnolog\u00eda disponible (informaci\u00f3n gen\u00f3mica o metab\u00f3lica, datos de ecosistemas, procesamiento de im\u00e1genes, historias cl\u00ednicas, etc.). Ahora bien, en un sistema biol\u00f3gico no est\u00e1 todo dividido como compartimientos estancos, sino que est\u00e1 funcionando todo junto.<\/p>\n<p>La Biolog\u00eda de Sistemas es el gran desaf\u00edo que tenemos, porque est\u00e1 tratando de apuntar a la integraci\u00f3n de ese gran volumen de datos, que sabemos que fueron recolectados con diferentes contenedores. Una forma natural de un bi\u00f3logo es empezar a dibujar el problema en un pizarr\u00f3n, aunque no sepa que est\u00e1 haciendo grafos. Ac\u00e1 es donde se est\u00e1n utilizando Bases de Datos de Grafos. Porque conceptualmente el grafo mapea perfectamente este tipo de problemas. Pr\u00e1cticamente en biolog\u00eda, todos los sistemas complejos se pueden representar efectivamente con grafos y ver la interacci\u00f3n compleja entre estos componentes biol\u00f3gicos. El pr\u00f3ximo paso es poder integrar y representar todo estos datos en un sistema computacional, generando nuevo conocimiento.<\/p>\n<div id=\"address\">\n<h5>EN FOCO: LA MAESTR\u00cdA<\/h5>\n<h3>Quer\u00eda tener una breve reflexi\u00f3n sobre tu experiencia docente en la Maestr\u00eda&#8230;<\/h3>\n<p>Ser docente de la Maestr\u00eda es demandante. El otro d\u00eda estaba revisando cursos de hace unos 6 a\u00f1os atr\u00e1s y son totalmente diferentes a los de hoy. Justamente es un \u00e1rea del conocimiento que se est\u00e1 moviendo tanto que todos los a\u00f1os hay que actualizar algo con una velocidad considerable para mantener relevante el contenido. M\u00e1s all\u00e1 de mi planificaci\u00f3n, voy ajustando el dictado en tiempo real porque es muy din\u00e1mica la cursada.<\/p>\n<p>Lo otro interesante es que tenemos alumnos con formaciones muy diversas. Tenemos perfiles de inform\u00e1tica, de computaci\u00f3n con una formaci\u00f3n b\u00e1sica como la de Exactas, de Ingenier\u00eda, de Inform\u00e1tica pero orientada a negocios como en Econ\u00f3micas. Y despu\u00e9s la gente que viene de otras carreras: Matem\u00e1tica, F\u00edsica, Estad\u00edstica, Econom\u00eda,\u00a0 Sociolog\u00eda, etc. Es muy enriquecedor tener un \u00e1mbito donde converjan personas con or\u00edgenes tan diferentes y con presentes profesionales tan diferentes. Esto hace que surjan inquietudes muy diversas.<\/p>\n<\/div>\n","protected":false},"excerpt":{"rendered":"<p>Marcelo Soria es profesor e investigador de la Facultad de Agronom\u00eda de la Universidad de Buenos Aires (UBA). Forma parte del Instituto de Investigaciones en Biociencias Agr\u00edcolas y Ambientales (INBA) y de la C\u00e1tedra de Microbiolog\u00eda. All\u00ed lidera proyectos que utilizan la Bioinform\u00e1tica y la Ciencia de Datos para construir modelos computacionales con grandes vol\u00famenes de informaci\u00f3n gen\u00e9tica de microorganismos. Se desempe\u00f1a como docente de la Maestr\u00eda en Explotaci\u00f3n de Datos y Descubrimiento del Conocimiento de la UBA. Es bi\u00f3logo, doctor en ciencias biol\u00f3gicas y realiz\u00f3 un posdoctorado en la Universidad de California (UC DAVIS, Department of Plant Sciences). <\/p>\n","protected":false},"author":1,"featured_media":567,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_mi_skip_tracking":false},"categories":[18],"tags":[],"_links":{"self":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/566"}],"collection":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=566"}],"version-history":[{"count":3,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/566\/revisions"}],"predecessor-version":[{"id":570,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/566\/revisions\/570"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/media\/567"}],"wp:attachment":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=566"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=566"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=566"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}