{"id":1704,"date":"2024-06-24T14:47:27","date_gmt":"2024-06-24T17:47:27","guid":{"rendered":"https:\/\/datamining.dc.uba.ar\/predictivos\/?p=1704"},"modified":"2024-06-24T14:58:22","modified_gmt":"2024-06-24T17:58:22","slug":"nuevo-profesor-de-aprendizaje-por-refuerzos","status":"publish","type":"post","link":"https:\/\/datamining.dc.uba.ar\/predictivos\/?p=1704","title":{"rendered":"Nuevo profesor de Aprendizaje por Refuerzos"},"content":{"rendered":"<p><b>C\u00e9sar Caiafa es Investigador Independiente en el Instituto Argentino de Radioastronom\u00eda (IAR) (CONICET\/UNLP\/CIC); Profesor Adjunto en la Facultad de Ingenier\u00eda, Universidad de Buenos Aires (UBA), e Investigador Visitante del <\/b><b><i>RIKEN Center for Advanced Intelligence Project (AIP)<\/i><\/b><b>, Jap\u00f3n.<\/b><\/p>\n<p><b>En cuanto a su formaci\u00f3n es Ingeniero y Doctor en Ingenier\u00eda Electr\u00f3nica de la UBA. Sus intereses de investigaci\u00f3n se centran en las aplicaciones de aprendizaje autom\u00e1tico, el procesamiento de se\u00f1ales multidimensionales y el modelado en sistemas multiagentes no lineales. Sus principales contribuciones son en las \u00e1reas de factorizaciones tensoriales, representaciones <\/b><b><i>sparse<\/i><\/b><b> y sus aplicaciones en astronom\u00eda, biomedicina y neurociencias.\u00a0<\/b><\/p>\n<p><b>Recientemente Caiafa fue designado Profesor de la materia Aprendizaje por Refuerzos. En esta entrevista con el Blog Predictivos, nos cuenta sobre las perspectivas y el enfoque que tendr\u00e1 esta asignatura.<\/b><\/p>\n<p><b>\u00bfC\u00f3mo ser\u00e1 la materia \u201cAprendizaje por Refuerzos\u201d que dictar\u00e1s en el segundo cuatrimestre 2024 de la Maestr\u00eda?<\/b><\/p>\n<p><span style=\"font-weight: 400;\">Es una materia planificada para dictar en 36 horas en total. Si tuviera que resumir de qu\u00e9 trata la materia, se centra en desarrollar algoritmos para que un agente, en la interacci\u00f3n con su ambiente, aprenda a tomar decisiones \u00f3ptimas. Esto se puede aplicar a una infinidad de problemas: desde rob\u00f3tica y veh\u00edculos aut\u00f3nomos que tienen que sensar el ambiente para tomar decisiones hasta juegos de estrategia donde el espacio de b\u00fasqueda de decisiones \u00f3ptimas es inmenso, de hecho el aprendizaje reforzado se hizo muy popular cuando Google DeepMind aplic\u00f3 estos algoritmos al juego de origen oriental GO en 2015, considerado m\u00e1s complejo a\u00fan que el ajedrez, dando origen al software AlphaGO.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">La materia buscar\u00e1, en definitiva, estudiar los principios te\u00f3ricos de estos algoritmos y mostrar c\u00f3mo se aplican a casos pr\u00e1cticos.<\/span><\/p>\n<p><b>\u00bfC\u00f3mo surge el aprendizaje por refuerzos, involucra temas que ya se estudiaban antes de esta revoluci\u00f3n de la ciencia de datos e inteligencia artificial?<\/b><\/p>\n<p><span style=\"font-weight: 400;\">Son temas que se empezaron a estudiar hace muchos a\u00f1os, porque vienen de la Ingenier\u00eda del Control Autom\u00e1tico (de mediados del siglo XX) y se basan en la teor\u00eda de probabilidades, aplicada a un ambiente que est\u00e1 compuesto por: estados + acciones + recompensas. Entonces se puede armar un modelo matem\u00e1tico-probabil\u00edstico que predice las probabilidades de pasar del estado actual a cualquier otro, dada la acci\u00f3n que el agente ejecuta. A su vez, como resultado de una acci\u00f3n, hay una recompensa, que es un valor positivo, para un buen resultado o negativo para lo contrario. Un ejemplo cl\u00e1sico es el llamado <\/span><i><span style=\"font-weight: 400;\">Cartpole<\/span><\/i><span style=\"font-weight: 400;\">, donde el problema consiste en sostener un p\u00e9ndulo invertido en equilibrio moviendo su base. Esto es lo que sucede, por ejemplo, cuando uno intenta sostener una escoba invertida en equilibrio con el dedo \u00edndice sosteniendo el extremo. Si la escoba no se cae, la recompensa es positiva y, por lo contrario, si se cae es negativa. Es un claro problema de control que se puede resolver satisfactoriamente aplicando un algoritmo de aprendizaje por refuerzos, simulando el experimento muchas veces, permitiendo que el agente aprenda a aplicar la fuerza necesaria, dependiendo de la posici\u00f3n y velocidad de ese p\u00e9ndulo para mantenerlo en equilibrio.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">En base a esa teor\u00eda se pueden encontrar cu\u00e1les son las decisiones \u00f3ptimas, llamada pol\u00edtica \u00f3ptima, dado un modelo del mundo. M\u00e1s precisamente, existe\u00a0 una ecuaci\u00f3n, denominada ecuaci\u00f3n de Bellman (desarrollada en los a\u00f1os 1950\u2019s), que establece la condici\u00f3n que tiene que cumplir la pol\u00edtica \u00f3ptima y que di\u00f3 lugar a los algoritmos de Programaci\u00f3n Din\u00e1mica. Pero en la pr\u00e1ctica uno no tiene un modelo del mundo, tiene que aprender con la experiencia. Sobre eso se avanz\u00f3 much\u00edsimo en los \u00faltimos a\u00f1os, y el gran avance se dio realmente hace unos diez a\u00f1os cuando se empezaron a usar las redes neuronales profundas para modelar estas funciones de los estados (entendiendo que son espacios muy grandes para explorar, por lo que uno debe modelarlos para poder generalizar decisiones \u00f3ptimas en situaciones no observadas durante el entrenamiento).<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Si bien estos algoritmos est\u00e1n inspirados en c\u00f3mo creemos que nuestro cerebro funciona, donde uno intenta repetir experiencias satisfactorias y evitar aquellas negativas, en el aprendizaje por refuerzos realmente no se usa la experiencia humana para transferirla al agente. En este caso el agente logra aprender por s\u00ed solo y los algoritmos logran determinar c\u00f3mo actuar dado el estado del agente y su entorno.<\/span><\/p>\n<p><b>\u00bfQu\u00e9 rol juega la \u201cautonom\u00eda\u201d de estos agentes basados en aprendizaje por refuerzos?<\/b><\/p>\n<p><span style=\"font-weight: 400;\">La idea final es que el agente pueda ser aut\u00f3nomo, ya que una vez que determin\u00f3 su pol\u00edtica \u00f3ptima (dado el estado, qu\u00e9 acci\u00f3n debe tomar), ya tiene una independencia del accionar humano o por lo menos, es lo que se persigue en general. Por ejemplo, eso es lo que sucede en gran medida hoy con los autos de Tesla en modalidad aut\u00f3noma (se manejan solos). Y tambi\u00e9n sucede con toda la rob\u00f3tica actual, sobre todo en \u00e1mbitos industriales.<\/span><\/p>\n<p><b>Por \u00faltimo, \u00bfde qu\u00e9 modo se aplicar\u00e1n estos temas en el Programa de la materia?<\/b><\/p>\n<p><span style=\"font-weight: 400;\">Durante el Programa recorro todos los contenidos, que abarcan desde el momento de tener un modelo claro del mundo, hasta la etapa donde un agente carece de un modelo del mundo y tiene que aprender por s\u00ed s\u00f3lo, interactuando con el ambiente para determinar cu\u00e1l ser\u00eda la soluci\u00f3n \u00f3ptima. Y, al final, se llega al modelado y simulaci\u00f3n de esos ambientes.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Resalto que se aprende en base a la experiencia porque uno no tiene todos los datos recopilados sino que uno va explorando mientras aprende, y al mismo tiempo se va construyendo un modelo de ese ambiente. Adem\u00e1s de la experiencia con ese ambiente real, uno puede simular ese ambiente. Entonces con los datos simulados y los datos medidos el agente va mejorando en su accionar hasta llegar a un comportamiento \u00f3ptimo<\/span><\/p>\n<p><span style=\"font-weight: 400;\">En la parte pr\u00e1ctica de la materia habr\u00e1 mucha programaci\u00f3n con Python, utilizando Google Colab y la plataforma Gym, desarrollada por OpenAI para simular ambientes en aprendizaje por refuerzos. En la mayor\u00eda de las clases habr\u00e1 implementaci\u00f3n de los algoritmos y, llegando al final de la materia trabajaremos con los algoritmos m\u00e1s modernos basados en redes neuronales, donde veremos problemas del tipo <\/span><i><span style=\"font-weight: 400;\">Cartpole,<\/span><\/i><span style=\"font-weight: 400;\"> ya mencionado, y otros. De esta manera, el alumno podr\u00e1 probar, comparar y simular distintos ambientes y aplicar distintos algoritmos. La idea es que resulte interesante y puedan aparecer aportes muy enriquecedores por parte de los alumnos.<\/span><\/p>\n<hr \/>\n<h3><b>Instituto Argentino de Radioastronom\u00eda: un proyecto para reconstruir im\u00e1genes de microondas<\/b><\/h3>\n<h5><span style=\"font-weight: 400;\">Actualmente el Dr. Ing. Caiafa se desempe\u00f1a como investigador independiente del Instituto Argentino de Radioastronom\u00eda (IAR, CONICET\/UNLP\/CIC), en diferentes proyectos aplicados a los campos de astronom\u00eda, ciencias m\u00e9dicas y neurociencia. Su trabajo se enfoca en el procesamiento de se\u00f1ales y desarrollo de algoritmos de aprendizaje autom\u00e1tico.<\/span><\/h5>\n<h5><span style=\"font-weight: 400;\">Uno de los proyectos destacados, en este \u00e1mbito, consiste en la resoluci\u00f3n de problemas inversos (que parten de los efectos y calculan las causas, a diferencia de los problemas directos) utilizando algoritmos de aprendizaje autom\u00e1tico. En particular est\u00e1 investigando sobre c\u00f3mo reconstruir im\u00e1genes para un tom\u00f3grafo de microondas, cuya ventaja es que no tiene efectos adversos en pacientes y es menos invasivo (a diferencia del tom\u00f3grafo cl\u00e1sico de rayos X).<\/span><\/h5>\n<h5><span style=\"font-weight: 400;\">El dispositivo funciona con antenas de emisi\u00f3n y recepci\u00f3n de ondas electromagn\u00e9ticas que se mueven alrededor de un objeto realizando mediciones y permitiendo construir im\u00e1genes tridimensionales de las partes del cuerpo que se necesiten estudiar (ver Figura 1). El gran desaf\u00edo en esta tecnolog\u00eda es que, debido a la baja frecuencia de la onda transmisora y el complejo proceso de rebotes (<\/span><i><span style=\"font-weight: 400;\">scattering<\/span><\/i><span style=\"font-weight: 400;\">), los m\u00e9todos de reconstrucci\u00f3n cl\u00e1sicos obtienen im\u00e1genes de baja resoluci\u00f3n. Actualmente se desarrollan, algoritmos basados en aprendizaje autom\u00e1tico que permiten reconstruir im\u00e1genes con mayor calidad ya que explotan informaci\u00f3n <\/span><i><span style=\"font-weight: 400;\">a priori<\/span><\/i><span style=\"font-weight: 400;\"> sobre las im\u00e1genes a reconstruir. Estas t\u00e9cnicas pueden aplicarse a la tomograf\u00eda de microondas, que es precisamente un \u00e1rea en la que el Dr. Caiafa trabaja actualmente.<\/span><\/h5>\n<h5><span style=\"font-weight: 400;\">Cabe destacar que en los laboratorios del IAR, y en colaboraci\u00f3n con el Instituto de F\u00edsica de L\u00edquidos y Sistemas Biol\u00f3gicos (IFLYSiB-CONICET), se est\u00e1 desarrollando un prototipo de tomograf\u00eda por microondas, teniendo en cuenta toda la experiencia acumulada de trabajo del personal t\u00e9cnico del IAR en proyectos satelitales y de astronom\u00eda involucrando radio-frecuencias. M\u00e1s all\u00e1 de que esta es la primera versi\u00f3n del prototipo, el proyecto est\u00e1 a\u00fan en una fase de experimentaci\u00f3n e investigaci\u00f3n dado que a\u00fan no est\u00e1 homologada la tomograf\u00eda de microondas para uso en el \u00e1mbito m\u00e9dico.<\/span><\/h5>\n<p><span style=\"font-weight: 400;\"><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2024\/06\/Figura1.png\"><img decoding=\"async\" loading=\"lazy\" class=\"size-full wp-image-1705 aligncenter\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2024\/06\/Figura1.png\" alt=\"\" width=\"667\" height=\"388\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2024\/06\/Figura1.png 667w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2024\/06\/Figura1-300x175.png 300w\" sizes=\"(max-width: 667px) 100vw, 667px\" \/><\/a><\/span><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Recientemente C\u00e9sar Caiafa (Investigador Independiente en el Instituto Argentino de Radioastronom\u00eda y Profesor Adjunto en la Facultad de Ingenier\u00eda UBA) fue designado como Profesor de la materia Aprendizaje por Refuerzos. En esta entrevista con el Blog Predictivos, nos cuenta sobre las perspectivas y el enfoque que tendr\u00e1 esta asignatura.<\/p>\n","protected":false},"author":4,"featured_media":1706,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_mi_skip_tracking":false},"categories":[24,22,25],"tags":[21,19,31],"_links":{"self":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1704"}],"collection":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/users\/4"}],"replies":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=1704"}],"version-history":[{"count":9,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1704\/revisions"}],"predecessor-version":[{"id":1715,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1704\/revisions\/1715"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/media\/1706"}],"wp:attachment":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=1704"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=1704"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=1704"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}