Predictores en búsqueda de desaparecidos
Con una enorme vocación por el desafío, los alumnos de la Maestría obtuvieron la mención de honor “Honorable Mention for Detailed Discovery”, representando a la única universidad latinoamericana en esa instancia final. Su destacada performance, les permitió exponer el paper “Where’s Rachel?” en el IEEE Visual Analytics Science and Technology, que se realizó en París, Francia, del 9 al 14 de noviembre de 2014.
Para conocer cómo fue esta experiencia, Predictivos conversó con Andrei Rukavina y Paulina Verasay, voceros del equipo premiado en el certamen.
¿En qué consistió su participación en el VAST Challenge 2014?
Andrei Rukavina (AR): El desafío se basaba en resolver una consigna aplicando técnicas de minería de datos y visualización de la información. Todo ocurría en un país de fantasía, Kronos, ubicado en el Mar Mediterráneo. Allí existía un conflicto ambiental entre la empresa GAStech y la agrupación Protectors of Kronos (POK). La empresa era responsable de la contaminación de la ciudad y algunos de los empleados planeaban secuestros para cobrar el rescate. Aparentemente, había empleados de la empresa desaparecidos.
Si bien la consigna inicial era muy ambigua, la idea era proveer pistas sobre estas desapariciones: nombres, personas, lugares, horarios y detalles de quién era el culpable en cada caso, si es que la persona había fallecido o había sido secuestrada, quién era la víctima y quién el victimario.
El hecho de que fuese un territorio de ficción, totalmente aleatorio, lo hizo más divertido e interesante para investigar, además de entrada uno no está familiarizado con nada.
Paulina Verasay (PV): Hubo tres mini-challenges diferentes pero nosotros participamos sólo en el tercero. El primer challenge se basaba en actuar ante la desaparición de las personas a partir de datos de los CVs de los empleados, mensajes de e-mails intercambiados y análisis de textos de periódicos.
El segundo tenía que ver con el uso de Sistemas de Información Geográfica (GIS, en inglés), situando información en un mapa y analizando la movilidad de las personas. Se trabajaba con información de los GPS de los empleados y de los camioneros de la empresa, y esos datos se relacionaban con otros datos de tarjetas de crédito.
Por último, el tercer desafío, donde participamos, residía en el análisis de un flujo de datos en tiempo real, durante cuatro horas y media: las llamadas de emergencia al 911 en el país y los mensajes o tweets de la red social que la empresa estaba usando en ese momento. Más allá del trabajo específico en minería de datos y visualización, tuvimos toda una tarea previa para depurar y ordenar el dataset.
AR: El challenge duró unos 5 meses. Pero nosotros arrancamos más tarde, sobre la marcha de la competencia, ya que nos presentamos en el mes 3. Terminamos haciendo el Submit, la entrega final, como 20 segundos antes del deadline. Recuerdo que lo enviamos un miércoles 9 de julio a las 3:59 AM.
Puede apreciarse que ese challenge tenía cierta complejidad técnica…
AR: Muchísima, ya que hubo pocos equipos que apostaron a ese desafío en particular. Durante esas horas teníamos que procesar alrededor de 4700 mensajes en tiempo real. Por un lado, trabajamos con la geolocalización de las llamadas de emergencia, a través de GIS, y por otro lado analizamos el texto de los tweets y, en algunos casos, su localización con la referencia de Latitud-Longitud.
Además tuvimos que configurar un cliente, conectarlo al servidor y a la aplicación donde llegaban cada uno de los mensajes de manera aleatoria. A la hora de haber descargado el primer segmento de datos, la consigna era enviar al Comité del VAST una captura de pantalla de nuestra visualización de los mensajes.
Luego, a través de los mensajes, había que detectar los eventos que contribuían en mayor medida a la causa, buscando las pistas sobre la desaparición de esas personas, sobre las que no teníamos ningún dato previo.
PV: También hubo otras complejidades. Se agregó “ruido” a los datos que emitían los GPS. Los Blogs, de donde extrajimos información, estaban escritos en un inglés muy pobre. Todo eso generó mensajes difíciles de decodificar. Ahí también introdujeron spammers, por lo que también aparecía publicidad falsa y publicaciones off topic en los tweets para distraernos.
Otro tema importante en el challenge, fue que descubrimos este concepto de relacionar palabras, información y eventos. De hecho, durante la competencia dijeron que habíamos sido el único equipo que se dio cuenta qué significa un Hashtag, relacionado con el tema del enfrentamiento entre los secuestradores y la policía. Era “TAG”: Trouble at Gelato Galore. Esto fue parte de un proceso de inteligencia de datos, donde empezamos a extraer valor de esa información, solamente filtrando, agrupando y descartando el spam.
¿Cuál fue el punto de inflexión en el que alcanzaron resultados concretos?
AR: Cuando hicimos la visualización donde pudimos ver mensajes a través del tiempo y agregar análisis de sentimientos, nos focalizamos en intervalos de minutos para poder empezar a reconocer qué pasaba en cada momento. Hicimos una nube de palabras, de hashtags sin autores, depurando tipos de palabras que no aportaban información como los artículos y viendo cuáles eran las palabras que más se repetían. Fuimos reduciendo la información hasta que encontramos los procesos importantes, en el sentido de que tenían buena subjetividad, eran fuertemente positivos o negativos y además hablaban de un tema específico.
PV: En este proceso detectamos una línea de tiempo de los eventos más importantes hasta llegar a la negociación entre los secuestradores de la empleada de la empresa (Rachel) con la policía. El choque de una bicicleta con una camioneta en Gelato Galore, por ejemplo, había pasado desapercibido en un principio y después empezamos a ver una conexión significativa entre todos los hechos. Cuando descubrimos esto, faltaban muy pocos días para el Deadline de la competencia.
¿Qué sintieron cuando se enteraron de que habían obtenido la mención honorífica?
PV: Cuando Andrei nos reenvió los mails oficiales con la información, nuestra primera reacción fue pensar que él había inventado todo esto. La verdad no creíamos que fuera cierto, por el nivel de exigencia que tenía la competencia y la consigna.
AR: Fueron como seis mails hasta que me creyeron (risas). Hay que tener en cuenta que a la instancia final, llegaron 45 equipos de 180. De esos equipos, sólo 3 obtuvieron menciones y hubo un ganador de ese mini-challenge. Un punto a destacar es que al Challenge general (Grand Challenge) se lo puede ganar, pero no hubo ningún ganador en esta última competencia.
¿Y cómo fue la experiencia de viajar a París para presentar el trabajo en la conferencia IEEE VIsual Analytics Science and Technology?
PV: Tener esta oportunidad de exponer nuestros resultados ante la élite de la visualización científica mundial, justo en el 25º aniversario del evento, fue espectacular. Había equipos de California, Londres, Frankfurt, Beijing, etc. Eran las universidades tecnológicas más importantes. La UBA fue la única universidad latinoamericana en esa instancia, lo que en nuestro caso fue valorado tanto por los organizadores como por otros equipos. Antes de presentar nuestro Paper, el Comité destacó que fuimos el equipo que más se concentró en proveer resultados concretos, a nivel de análisis, para descubrir quién era la persona secuestrada.
AR: No es menor el hecho de que el Comité que resuelve la entrega de estas menciones es muy prestigioso. Son referentes en el área, ya que escribieron los libros con los que nosotros estudiamos habitualmente. Como la Visualización de la Información es una disciplina joven, muchos de los referentes todavía están activos y participan de estos encuentros. Tal es así que llegamos a conocer a figuras como Ben Shneiderman, quien estaba allí en el auditorio. Fue algo realmente increíble.
¿Qué recursos tuvieron para participar en la Conferencia?
AR: Digamos que fuimos cuatro personas formadas en Sistemas, con mucho entusiasmo por avanzar en el desafío y que ya nos conocíamos de cursar la Maestría. Diseñamos visualizaciones con software libre y gratuito, sin tener un convenio con grandes empresas como era el caso de muchos otros equipos. La empresa de software Tableau nos prestó una licencia y luego nos dio el sponsoreo cuando fuimos a presentar el trabajo, costeando tres de las cuatro inscripciones.
PV: Los organizadores de VAST nos pagaron la inscripción restante, lo cual fue un valioso gesto de inclusión hacia una universidad latinoamericana. Y el Ministerio de Ciencia y Tecnología nos otorgó el financiamiento para los pasajes, el hospedaje y la estadía. Mariana se movió muchísimo para conseguir estos fondos. También publicamos nuestro proyecto en Idea.me, una conocida plataforma de crowdfunding, donde recibimos un importante apoyo monetario.
Me imagino el esfuerzo que significó para ustedes llegar a este resultado…
PV: Siempre llegamos contrarreloj a las entregas. Era volver del trabajo, dedicarnos en el muy poco tiempo que teníamos. Nos juntábamos hasta las 4 de la mañana tratando de avanzar en las diferentes instancias. Así como nosotros, Laura y Mariana también estaban muy ocupadas pero trabajaron muchísimo en las visualizaciones y en el análisis. En total debemos haber trabajado unas 60 horas por mes, durante dos meses.
Si bien después de esto cada uno sigue teniendo muchos proyectos, entre lo que es su labor profesional y académica, ahora podremos “reponernos” un poco y dedicarnos a nuestras tesis.
AR: Creo que aprendimos mucho. Nunca nos vamos a olvidar del VAST Challenge. De hecho, a mí me gustaría volver a participar este año.
PERFILESMariana Clara Landoni es Ingeniera en Sistema de Información (UTN) y Especialista en Explotación de Datos y Descubrimiento del Conocimiento (UBA). Trabaja en el Hospital Italiano de Buenos Aires desde hace 13 años. Actualmente en el área de Business Intelligence.
Andrei Rukavina es Ingeniero en Sistemas de Información (UTN) y Especialista en Explotación de Datos y Descubrimiento del Conocimiento (UBA). Se encuentra desarrollando su tesis de Magister aplicando SVM para predecir intervalos pre-ictales en pacientes epilépticos. Actualmente es Vice-President en el área de Information Management Services en AlixPartners.
María Laura Traverso es Licenciada en Sistemas (UBA) y Especialista en Explotación de Datos y Descubrimiento de Conocimiento (UBA). Co-fundadora y directora de la empresa de sistemas TCN-Consultores Traverso. Actualmente utiliza métodos de minería de datos para mejorar la toma de decisiones en sistemas de producción agrícola.
Paulina Verasay es Ingeniera en Sistema de Información (UTN) y Especialista en Explotación de Datos y Descubrimiento del Conocimiento (UBA). Actualmente trabaja en Corebi como Focal Point en el área de Integración de Datos de Business Intelligence.

