Un predictor en el ámbito electoral

Walter Lamagna¿En qué consiste tu trabajo en IBM?

Actualmente me ocupo de la distribución automatizada de software para IBM y algunos clientes externos. Este rol, que asumí desde hace un año, consiste en la programación de la instalación automática de los programas. Es un área bastante evolucionada donde estoy aprendiendo mucho, pero no implica el uso de minería de datos.

No obstante, cuando tenía el puesto de Defect Prevention cuyo objetivo era identificar defectos frecuentes en software o hardware, manejaba  un gran volumen de datos; eran alrededor de 5 mil servidores de un cliente del rubro de tarjetas de crédito y en ese caso pude utilizar técnicas visualización de la información para graficar en series temporales los errores más frecuentes. Pero lo hice más por motus propio que por una tarea asociada a mi puesto.

Hablemos un poco sobre tu Tesis de Maestría…

Mi objeto de estudio tiene que ver con redes neuronales aplicadas a imágenes. Junto a mi directora de tesis, María Elena Buemi, nos pareció que el tema de las elecciones podía ser interesante y adecuado para trabajar desde el procesamiento de imágenes. Yo había sido fiscal de mesa en las últimas elecciones legislativas, del año 2013, y me había empezado a interiorizar en el tema. Los manuscritos de los telegramas escaneados eran esencialmente imágenes, con lo cual podían ser parte de la investigación.

¿Con qué tipo de redes neuronales estás trabajando?

Con redes neuronales convolucionales. Para explicarlo de forma sencilla, serían redes donde las neuronas corresponden a campos receptivos de una manera muy similar a la corteza visual primaria de un cerebro, que suelen ser muy eficientes para tareas de visión artificial y procesamiento de imágenes. Estas redes neuronales usan la operación de convolución que es la multiplicación entre dos matrices y de eso resulta un número en particular.

Estas redes neuronales convolucionales las impulsó el destacado investigador Yann Lecun, que ahora es responsable del área de investigación y desarrollo en Facebook. Es una aplicación que ya tuvo mucho éxito en el reconocimiento de expresiones humanas e imágenes en forma masiva.

¿Cuál sería el objetivo del trabajo?

El objetivo sería ayudar a las personas en la contabilización de los votos. Al finalizar las elecciones tenemos un telegrama que los fiscales completan a mano, que contiene el dato de cada mesa con el partido político y la cantidad de votos obtenidos, por ej. 200. Ese 200 es lo que yo leo pero que también puede leer la computadora procesando la imagen de ese telegrama escaneado. Lo que buscamos, a través de esta red neuronal, es el intento de predecir qué dígito exacto es.

Cuando finalizan los comicios, cada telegrama llega a un centro de cómputos donde un equipo de personas lo recibe y tipean lo que ellos leen de ese manuscrito. Ese telegrama lo lee el Data Entry en una hilera, lo tipea y después se lo da a otro Data Entry que también lo lee y lo tipea. Entonces hay dos controles del mismo resultado. Si eso coincide se lo presenta como resultado final en el escrutinio. Pero si no coincide, el telegrama pasa a un área de incidencias donde  revisan por qué no coincidió, por ejemplo se puede haber equivocado uno de los Data Entry o el número era muy ilegible. A mí lo que me interesaría es que haya como un tercer Data Entry, un tercer agente informático que haga su lectura también sobre los dígitos y que pueda corroborar también con lo que escribieron los otros Data Entry, reduciendo aún más el margen de error.

De hecho, la idea es presentar los resultados que tipearon las personas respecto a los datos y lo que predice mi sistema e intentar encontrar dónde no hay coincidencia. Si bien es un método para contabilizar, lo veo como una herramienta intermedia que asiste a la persona, no que la reemplaza.

¿En qué etapa de la Tesis estás?

El sistema ya está implementado y estoy haciendo los ajustes finales. El tema es que es complejo implementar redes neuronales convolucionales; muchas utilizan librerías que ya están desarrolladas por otros. Yo encontré una librería en Java Script de código abierto, entonces trabajé sobre ese código, le hice ingeniería inversa e implementé mi propia red neuronal en Matlab. Mi intención es que todo el trabajo esté acompañado de esta nueva librería que le va a permitir a muchos poder conocer cómo funciona, lo cual es un paso importante.

Está claro que tenés múltiples intereses que van desde la democracia ciudadana y el gobierno abierto hasta el tema de la visualización de datos. ¿Cómo converge todo esto en tu carrera?

Creo que tenemos una enorme oportunidad para que nuestro conocimiento genere aportes concretos a la sociedad. La ciencia tiene que estar al servicio del bienestar de las personas. Ese también es un poco el camino del Open Data. Cuando se liberan los datos es muy tentador intentar descubrir qué utilidad o valor se puede encontrar en los datos y compartirlo con los demás.

Por ejemplo, cuando participé en el Hackatón Latinoamericano #DAL2012 trabajé con datos del Poder Judicial de la Nación, analizando las sentencias de la Corte Suprema en los últimos 18 años hasta el año 2012. Lo que me interesó fue que el Poder Judicial tiene un buscador donde uno ingresa texto y busca información de una manera tradicional. Una cuestión es que ellos plantean en su página web es la idea de que esta información esté pública para acceso del ciudadano, para que pueda utilizarla para desarrollar aplicaciones o descubrir cosas. Y era una muy buena idea que la información sea pública pero, justamente, ese buscador representaba un obstáculo para lograr el objetivo. Todo eso me llevó a pensar una aplicación novedosa e interesante que dinamice la información.

¿Imaginás que tu sistema se pueda implementar en las próximas elecciones?

No lo sé. Es difícil esta articulación con el Estado pero creo que de a poco los gobiernos se muestran interesados en incorporar Open Data y nuevas herramientas de gestión. Específicamente  en el tema elecciones veo cada vez mayor apertura.

EN FOCO: LA MAESTRÍA

Cambiando de tema, ¿cómo fue tu experiencia de realizar la Maestría?
Fue una experiencia muy enriquecedora. Fui a unas Jornadas de Data Mining para saber de qué se trataba y quedé completamente deslumbrado por la propuesta. Es una carrera que tiene mucho de descifrar enigmas.
Los profesores están muy bien preparados y traen casos interesantes. Creo que en definitiva este posgrado me brindó herramientas analíticas muy valiosas, de estadística, visualización y aprendizaje profundo. Pero, por sobre todas las cosas, me despertó la curiosidad para seguir investigando.
 
¿Qué materias recomendás?
Redes neuronales dictada por Laura Lanzarini fue la materia que más me gustó. Aproveché la cursada hasta el último día. Por algún motivo, las Redes Neuronales eran algo lejano para mí porque estudié ingeniería en sistemas y las había visto a nivel de divulgación. En cambio, en esta materia programamos una red neuronal y entendimos realmente el proceso de cómo funcionaba. También recomendaría Visualización de la Información y Enfoque Estadístico del Aprendizaje.
 

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *