{"id":1101,"date":"2019-10-14T21:17:23","date_gmt":"2019-10-15T00:17:23","guid":{"rendered":"http:\/\/datamining.dc.uba.ar\/predictivos\/?p=1101"},"modified":"2019-10-15T10:20:03","modified_gmt":"2019-10-15T13:20:03","slug":"hoy-tenemos-mas-tiempo-para-entender-como-se-estan-utilizando-los-modelos-de-machine-learning-y-poder-interpretarlos","status":"publish","type":"post","link":"https:\/\/datamining.dc.uba.ar\/predictivos\/?p=1101","title":{"rendered":"\u201cHoy tenemos m\u00e1s tiempo para entender c\u00f3mo se est\u00e1n utilizando los modelos de Machine Learning y poder interpretarlos\u201d"},"content":{"rendered":"<h5><strong>Por Ignacio Uman. <a href=\"https:\/\/www.stat.berkeley.edu\/~ledell\/\">Erin LeDell <\/a>es <i>Chief Machine Learning Scientist<\/i> en H2O.ai, la compa\u00f1\u00eda que desarroll\u00f3 la plataforma open source de aprendizaje autom\u00e1tico H2O. Referente en aprendizaje autom\u00e1tico y estad\u00edstica computacional; realiz\u00f3 su doctorado sobre la tem\u00e1tica en UC Berkeley. Asimismo es fundadora de <i>Women in Machine Learning &amp; Data Science<\/i> y una de las co-fundadoras de <i>R-Ladies Global<\/i>.<\/strong><\/h5>\n<h5><strong><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/10\/20191003_104658.jpg\"><img decoding=\"async\" loading=\"lazy\" class=\"alignleft wp-image-1105\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/10\/20191003_104658.jpg\" alt=\"\" width=\"202\" height=\"174\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/10\/20191003_104658.jpg 528w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/10\/20191003_104658-300x259.jpg 300w\" sizes=\"(max-width: 202px) 100vw, 202px\" \/><\/a>Luego de haber participando como oradora principal de <a href=\"https:\/\/latin-r.com\/\">LatinR<\/a>\u00a0 -la conferencia latinoamericana que se desarroll\u00f3 en Santiago de Chile a fines de septiembre- estuvo de visita en Buenos Aires, donde aprovech\u00f3 para brindar una serie de <em>meetups<\/em> sobre Auto Machine Learning escalable. En esta ENTREVISTA con <a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/\">PREDICTIVOS<\/a> (post Seminario en el <a href=\"https:\/\/www.ic.fcen.uba.ar\/\">Instituto de C\u00e1lculo <\/a>de Exactas-UBA), LeDell abord\u00f3 diferentes temas de gran inter\u00e9s: desde la formaci\u00f3n en ciencia de datos hasta la diversidad e inclusi\u00f3n de mujeres en la disciplina, como as\u00ed tambi\u00e9n de qu\u00e9 modo AutoML transforma el trabajo en aprendizaje autom\u00e1tico.<\/strong><\/h5>\n<p>&nbsp;<\/p>\n<p><b>\u00bfC\u00f3mo fue el proceso de pasar de una carrera en matem\u00e1tica a convertirte en cient\u00edfica de datos con un doctorado en bioestad\u00edstica?<\/b><\/p>\n<p>Empec\u00e9 a interesarme por la computaci\u00f3n al finalizar mi formaci\u00f3n de grado. Mientras hac\u00eda la maestr\u00eda en matem\u00e1ticas, decid\u00ed comenzar un doctorado en matem\u00e1ticas pero me di cuenta de que no era lo que realmente quer\u00eda hacer. La realidad es que cuando termin\u00e9 mi carrera no sab\u00eda programar pero ten\u00eda muchas ganas de aprender. Fui aprendiendo sobre la marcha en mi trabajo, sobre todo fui autodidacta y aprend\u00ed, sin haberlo tenido como tema en la universidad, c\u00f3mo programar en Python, PHP y entornos web. Tambi\u00e9n me di cuenta de que deb\u00eda saber algo de R.<\/p>\n<p>Durante unos 6 a\u00f1os trabaj\u00e9 como ingeniera de software, desarrollando aplicaciones web y bases de datos. La verdad que no hab\u00eda nada de aprendizaje autom\u00e1tico en mi trabajo. Pero en alg\u00fan momento quise cambiar esa rutina de desarrollo de software y empec\u00e9 a aprender algo de <i>analytics<\/i>. Me di cuenta que pod\u00eda combinar temas de matem\u00e1tica y estad\u00edstica con programaci\u00f3n.<\/p>\n<p>Corr\u00eda el a\u00f1o 2008, momento en el que no hab\u00eda ning\u00fan campus de entrenamiento, programa de maestr\u00eda ni nada parecido. Y entend\u00ed que si quer\u00eda trabajar realmente en aprendizaje autom\u00e1tico de alto nivel, podr\u00eda optar por un doctorado. Como profesional vinculada a las matem\u00e1ticas, me inclin\u00e9 por la estad\u00edstica, en lugar de ciencias de la computaci\u00f3n, para aplicar a un programa de doctorado en <a href=\"https:\/\/statistics.berkeley.edu\/\">UC Berkeley<\/a>. Finalmente me aceptaron y curs\u00e9 de 2011 a 2015. El trabajo se centr\u00f3 en c\u00f3mo escalar con eficiencia algoritmos a Big Data. Para todo el procesamiento de los datos encontr\u00e9 un primer paquete que result\u00f3 demasiado lento, necesitaba una soluci\u00f3n m\u00e1s r\u00e1pida. Fue ah\u00ed cuando encontr\u00e9 H2O y combin\u00e9 su uso tanto con investigaci\u00f3n aplicada en el desarrollo de software como con una base te\u00f3rica del tema. Finalmente, ese valioso aprendizaje del doctorado me llev\u00f3 a trabajar full time a <a href=\"https:\/\/www.h2o.ai\/\">H2O.ai<\/a>.<\/p>\n<p><b>Teniendo en cuenta que en la actualidad hay m\u00faltiples maneras de formarse en ciencia de datos y aprendizaje autom\u00e1tico, \u00bfqu\u00e9 diferencias observ\u00e1s en la ense\u00f1anza formal de la ciencia de datos en los diferentes niveles, tanto en grado como posgrado o bien como disciplina extra universitaria?<\/b><\/p>\n<p>Creo que es importante formarse en cualquier nivel. No tiene sentido hacer toda una carrera de grado que no est\u00e9 integrada a esta tem\u00e1tica. Considero, sin dudas, que los programas de maestr\u00eda son una de las maneras m\u00e1s convenientes de aprender ciencia de datos, ahora es m\u00e1s sencillo que antes y no hace falta tener un doctorado para convertirse en <i>data scientist<\/i>. Adem\u00e1s seg\u00fan la carrera optada en grado, puede ser m\u00e1s o menos dif\u00edcil encarar una formaci\u00f3n de posgrado en estad\u00edstica, siempre se necesita alg\u00fan tipo de preparaci\u00f3n previa e ir molde\u00e1ndose una manera de pensar y encarar los problemas. En mi caso, estoy permanentemente vinculada a actividades de docencia complementarias como seminarios, cursos o <i>meetups<\/i> o incluso me invitan a dar clases a universidades, por lo que me interesa brindar este enfoque m\u00e1s l\u00f3gico-estad\u00edstico.<\/p>\n<p><b>Una de las problem\u00e1ticas a nivel local es c\u00f3mo poder acercar m\u00e1s mujeres a carreras de ciencia y tecnolog\u00eda y tambi\u00e9n de qu\u00e9 modo acompa\u00f1arlas en su desarrollo de carrera profesional. Como cofundadora de R-Ladies a nivel global, \u00bfqu\u00e9 desaf\u00edos consider\u00e1s que enfrentan hoy instituciones y empresas para promover una mayor diversidad e inclusi\u00f3n especialmente en ciencia de datos?<\/b><\/p>\n<p>Por un lado, los problemas en universidades son distintos a los de las empresas. Suele ser m\u00e1s f\u00e1cil que las mujeres se inserten en un ambiente acad\u00e9mico y aunque escapa de nuestro control el hecho de cu\u00e1ntas mujeres se inscriben realmente en este tipo de carreras, hay much\u00edsimos incentivos desde becas de ayuda econ\u00f3mica, campus de programaci\u00f3n o talleres que pueden ser \u00fatiles en distinto modo. Quiz\u00e1s las universidades son m\u00e1s r\u00edgidas en las pol\u00edticas econ\u00f3micas que pueden implementar, a diferencia de una empresa que suele ser m\u00e1s flexible y depende de la cultura, pero el acercamiento a organizaciones \u2013sobre todo por nuestra experiencia en Estados Unidos- como R-Ladies o WiMLDS (<i>Women in Machine Learning &amp; Data Science<\/i>) ayuda a hacer llegar un mensaje 50\/50 que de otro modo no llegar\u00eda y que si esas chicas tienen alg\u00fan inter\u00e9s en la ciencia de datos, vamos a brindarle las posibilidades y el apoyo.<\/p>\n<p>En lo que hace a las empresas, estamos viendo una cuesti\u00f3n m\u00e1s compleja. El desarrollo de tecnolog\u00eda en general est\u00e1 dominado por hombres y suele resaltar a figuras masculinas, especialmente en la cultura de las <i>startup<\/i>. Al mismo tiempo, si bien las empresas se esfuerzan por conseguir m\u00e1s mujeres programadoras o ingenieras para sus equipos de trabajo, una vez que se logra insertarlas en la organizaci\u00f3n, en general no se hace pr\u00e1cticamente nada para retenerlas o brindarles m\u00e1s oportunidades de desarrollo. Digo que es una cuesti\u00f3n compleja porque en promedio las mujeres pasan alrededor de 10 a\u00f1os en el entorno tecnol\u00f3gico y el 40% luego emigra de ese entorno, ya que termina renunciando porque no disfruta de estar all\u00ed.<\/p>\n<p>Por otro lado, esto que comento es la descripci\u00f3n del problema. \u00bfCu\u00e1l ser\u00eda una posible soluci\u00f3n? Asegurarse que las mujeres tengan un desarrollo de carrera y sean promovidas en su trabajo. Hemos visto casos donde ocupan el 30% del plantel y en su mayor\u00eda son juniors, ese sesgo no ayuda para nada a su progreso. Creo que es importante identificar esos perfiles que tienen habilidades de coordinaci\u00f3n o liderazgo, no siempre una misma va a querer convencer a otros sobre el valor de su trabajo. Invitar a esas mujeres talentosas a ser protagonistas en puestos de liderazgo y darles impulso, ser\u00eda fundamental para achicar esta brecha.<\/p>\n<h4><b>AutoML en H2O.ai<\/b><\/h4>\n<p><b>\u00bfDe qu\u00e9 modo se transforma el aprendizaje autom\u00e1tico con el proyecto de<\/b><b><i> Auto Machine Learning,<\/i><\/b><b> que has comentado en este Seminario al que asistimos en el Instituto de C\u00e1lculo?<\/b><\/p>\n<p><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/10\/20191003_104525.jpg\"><img decoding=\"async\" loading=\"lazy\" class=\"alignleft wp-image-1102\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/10\/20191003_104525.jpg\" alt=\"\" width=\"323\" height=\"252\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/10\/20191003_104525.jpg 620w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/10\/20191003_104525-300x234.jpg 300w\" sizes=\"(max-width: 323px) 100vw, 323px\" \/><\/a>La plataforma H2O AutoML proporciona una interfaz f\u00e1cil de usar que automatiza el pre-procesamiento de datos, el\u00a0 entrenamiento y el ajuste de una gran selecci\u00f3n de modelos candidatos y que puede escalar a conjuntos muy grandes. \u00bfC\u00f3mo cambia respecto a lo tradicional? Se puede trabajar con Big Data sin que sea tan caro, usando el propio cl\u00faster de la plataforma e implementaciones distribuidas con <i>Random Grid Search<\/i>, y sin l\u00edmite de tama\u00f1o en el cl\u00faster. Uno de los objetivos de la herramienta es que se pueda entrenar el mejor modelo r\u00e1pidamente y en general el ensamble de modelos es el que gana estas competencias porque tiene mejor performance que los modelos tomados individualmente. El resultado de la ejecuci\u00f3n es una \u201ctabla de clasificaci\u00f3n\u201d de modelos exportable para su uso en producci\u00f3n, adem\u00e1s es <i>Open Source<\/i>. La propia comunidad de usuarios, a partir de su experiencia de uso y de performance, nos brinda su opini\u00f3n y contribuciones para poder ir mejorando el software iterativamente (<i>benchmarking<\/i>).<\/p>\n<p><b>Por \u00faltimo, \u00bfpor qu\u00e9 una soluci\u00f3n automatizada frente a otras posibles?<\/b><\/p>\n<p>Hace 5 \u00f3 10 a\u00f1os, saber c\u00f3mo implementar estos algoritmos y c\u00f3mo distribuirlos, era un problema dif\u00edcil y la mayor parte de nuestro tiempo se ocupaba en eso. Ahora es un tipo de soluci\u00f3n sencilla y gestionarla resulta una ventaja competitiva. Aunque todav\u00eda es importante saber c\u00f3mo funcionan los algoritmos o qu\u00e9 diferencias hay en los hiper par\u00e1metros, los cient\u00edficos y cient\u00edficas de datos no necesitan escribir todo el c\u00f3digo para entrenar a los algoritmos, si eso se puede hacer en forma automatizada. Como <i>data scientists, <\/i>hoy tenemos m\u00e1s tiempo y libertad para ocuparnos de una tarea de la que siempre deber\u00edamos habernos ocupado y de la que estamos escuchando mucho m\u00e1s en los \u00faltimos 2 a\u00f1os: la \u201cinterpretabilidad\u201d de los modelos. Me refiero a entender c\u00f3mo se est\u00e1n utilizando los modelos, c\u00f3mo visualizarlos, en qu\u00e9 aplicaciones ser\u00e1n \u00fatiles y qu\u00e9 tan bien resuelven cada problema. Nos da la posibilidad de atacar varios problemas a la vez y no s\u00f3lo uno. Y aunque dejemos de enfocarnos tanto en temas de procesamiento, gesti\u00f3n de memoria o ingenier\u00eda de los datos, no por eso dejamos de hacer ciencia de datos. Simplemente me parece positivo que cada especialista se pueda enfocar en lo que m\u00e1s le interesa del trabajo en aprendizaje autom\u00e1tico y dejar de hacer todo solo. Si podemos automatizar la soluci\u00f3n, s\u00f3lo es cuesti\u00f3n de hacerlo.<\/p>\n<table>\n<tbody>\n<tr>\n<td>\n<h4><b>Alcance de R-Ladies en Latinoam\u00e9rica<\/b><\/h4>\n<div id=\"attachment_1103\" style=\"width: 180px\" class=\"wp-caption alignleft\"><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/10\/erinledell.jpg\"><img aria-describedby=\"caption-attachment-1103\" decoding=\"async\" loading=\"lazy\" class=\" wp-image-1103\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/10\/erinledell.jpg\" alt=\"\" width=\"170\" height=\"170\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/10\/erinledell.jpg 400w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/10\/erinledell-150x150.jpg 150w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/10\/erinledell-300x300.jpg 300w\" sizes=\"(max-width: 170px) 100vw, 170px\" \/><\/a><p id=\"caption-attachment-1103\" class=\"wp-caption-text\">Imagen: LatinR 2019<\/p><\/div>\n<h5>\u00abMe sorprende el alcance que ha tenido la organizaci\u00f3n, que hace unos 3 a\u00f1os se circunscrib\u00eda a grupos y meetups en San Francisco y Londres, eso era todo. Hemos encontrado una alta demanda en diferentes pa\u00edses y ciudades, incluso aqu\u00ed en Argentina y Chile, por estos objetivos de inclusi\u00f3n y diversidad con participaci\u00f3n de minor\u00edas. Miembros que nos han escuchado antes y quieren sentirse parte de la comunidad y de estas conversaciones. Alrededor del mundo llegamos a 138 cap\u00edtulos en 44 pa\u00edses, con 40 mil miembros.<\/h5>\n<h5>Destaco que R-Ladies ha ganado un gran poder de presi\u00f3n para cambiar las cosas y denunciar comportamientos discriminatorios o sexistas en ambientes tanto laborales como acad\u00e9micos. Ejemplo de esto ha sido nuestra iniciativa conjunta frente a los esc\u00e1ndalos con la empresa Data Camp o la exigencia de un c\u00f3digo de conducta en la conferencia R-Finance.\u00bb<\/h5>\n<p><div id=\"attachment_1104\" style=\"width: 657px\" class=\"wp-caption alignleft\"><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/10\/r-ladies-2019.jpg\"><img aria-describedby=\"caption-attachment-1104\" decoding=\"async\" loading=\"lazy\" class=\" wp-image-1104\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/10\/r-ladies-2019-1024x437.jpg\" alt=\"\" width=\"647\" height=\"276\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/10\/r-ladies-2019-1024x437.jpg 1024w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/10\/r-ladies-2019-300x128.jpg 300w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/10\/r-ladies-2019-768x328.jpg 768w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2019\/10\/r-ladies-2019.jpg 2048w\" sizes=\"(max-width: 647px) 100vw, 647px\" \/><\/a><p id=\"caption-attachment-1104\" class=\"wp-caption-text\">Imagen: LatinR 2019<\/p><\/div><\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>&nbsp;<\/p>\n<p>&nbsp;<\/p>\n<p>&nbsp;<\/p>\n<p>&nbsp;<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Por Ignacio Uman. Erin LeDell es Chief Machine Learning Scientist en H2O.ai, la compa\u00f1\u00eda que desarroll\u00f3 la plataforma open source de aprendizaje autom\u00e1tico H2O. Referente en aprendizaje autom\u00e1tico y estad\u00edstica computacional; realiz\u00f3 su doctorado sobre la tem\u00e1tica en UC Berkeley. Asimismo es fundadora de Women in Machine Learning &amp; Data Science y una de las co-fundadoras de R-Ladies Global. Luego de haber participando como oradora [&hellip;]<\/p>\n","protected":false},"author":4,"featured_media":1106,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_mi_skip_tracking":false},"categories":[24,26,36,25],"tags":[21,33,37,31],"_links":{"self":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1101"}],"collection":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/users\/4"}],"replies":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=1101"}],"version-history":[{"count":13,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1101\/revisions"}],"predecessor-version":[{"id":1119,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1101\/revisions\/1119"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/media\/1106"}],"wp:attachment":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=1101"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=1101"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=1101"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}