Un predictor en finanzas y consumo masivo
Hablemos sobre tu trabajo de Consultor en SPSS.
Me ocupo de desarrollar modelos predictivos, modelos de caracterización de clientes o de la unidad de negocios que maneje el cliente de SPSS en un área específica, con el objetivo de empezar a aprovechar al máximo la explotación de datos.
En general el cliente ya tiene una estructura armada. Algunas estructuras son incipientes, otras son muy intuitivas y otras muy grandes, por lo que nosotros buscamos sistematizar el manejo de esos datos y desarrollar modelos predictivos con un objetivo específico que puede ser comercial, de riesgo o de detección de fraudes, de caracterización de una cartera de clientes o incluso ligado a la optimización de procesos que aporten a la cadena de valor.
¿Cómo es trabajar para perfiles de clientes tales como bancos y empresas de retail?
Si bien son dos escenarios y modelos de negocio distintos, a veces los escenarios no difieren tanto. Resulta fundamental fijar claramente el objetivo del modelo que estamos desarrollando. Cuando tenemos que desarrollar un modelo de riesgo que tiene que ver con la probabilidad de que una persona deje de pagar o se atrase cada vez más en los pagos, esa situación de riesgo se presenta tanto en un banco como en un retail que, además de comercializar productos, también ofrece a sus clientes una tarjeta de crédito.
En el caso de los objetivos de marketing, trabajamos para contribuir con objetivos de marketing directo. Por ejemplo, un banco o una empresa de consumo masivo llama por teléfono al cliente o le envía una carta a su casa ofreciéndole un nuevo producto o beneficio exclusivo. Nosotros lo que hacemos es decirle a la empresa en cuestión que llame primero a determinados clientes que ya tenemos identificados a través de nuestro modelo, porque son los que tienen más chances de responder afirmativamente a esa oferta. También proponemos distintas estrategias a utilizar, según si esas chances son más altas o más bajas.
Esto se resume en que nuestro trabajo no es de soporte sino más bien exploratorio, nos ocupamos de buscar relaciones interesantes y útiles entre los datos. Aunque una vez que los modelos están instalados proveemos soporte para dar continuidad de funcionamiento.
¿Qué relación habría entre el volumen de los datos y su complejidad de análisis en estos proyectos?
El problema del gran volumen de datos se maneja utilizando técnicas para reducir ese volumen: técnicas de muestreo, técnicas de segmentación y técnicas de eliminación de variables. También existe la situación inversa de contar con muy pocos datos, lo cual involucra grandes desafíos sobre qué podemos hacer con tan poca información.
Hay bancos que poseen aproximadamente 1 ó 2 millones de clientes activos, que es un número significativo. Pero además hay que preguntarnos cuántos atributos tiene cada cliente, si son decenas o centenas de atributos, etc. Porque esta variedad, en definitiva, va a cambiar la composición final de nuestra matriz.
El gran volumen de datos afecta a la complejidad del problema, pero el tratamiento de variables también es complejo y tiene lugar aunque el volumen de datos no sea relevante.
¿Cómo hace un consultor en Data Mining para ayudar a la protección de los datos sensibles que se utilizan en grandes bases de datos?
Cada proyecto tiene un contrato específico. En todos los casos se firman acuerdos de confidencialidad.
El cliente para el que trabajamos sabe que nosotros vamos a necesitar los datos, por lo tanto nos tiene que proveer y facilitar su acceso. Básicamente a la hora de enviar y recibir información, lo que se hace es no enviar datos de identificación como apellido y nombre ni documento. Nosotros necesitamos tener los datos vinculados y, al mismo tiempo, diferenciados.
Es importante saber qué dato es de cada cliente pero no necesitamos saber quién es ese cliente. Por eso se usan identificadores, lo suficientemente específicos como para agrupar bajo un mismo código o número todos los datos de una persona, y lo suficientemente difusos como para no saber a qué persona nos estamos refiriendo. Además existen esquemas de seguridad internos con el fin de proteger toda la información, desde claves de encriptación hasta medios de transmisión seguros.
Cambiando de tema, ¿cuál fue tu mayor desafío como Consultor en Data Mining?
El año pasado me tocó ir a un banco de Paraguay porque la empresa empieza a expandirse a nivel regional. Este viaje fue muy importante porque fui la cara visible de la empresa en otro país y era un gran desafío profesional no tanto desde el punto de vista técnico sino desde lo que significaba ese proyecto para mí en relación con la empresa.
Por otro lado, resultó muy desafiante el primer proyecto en el que participé para un sistema de detección de fraudes en transacciones bancarias. El problema es que teníamos un gran volumen de transacciones que había que caracterizar para detectar cuál de ellas era un potencial fraude pero muy pocos casos de fraude: muchísimo menos del 1% del total de transacciones.
Combinamos varias técnicas y, finalmente, encontramos un modelo y un proceso para trabajar con los datos. Con el transcurrir de las transacciones, cada diez minutos el sistema asignaba un puntaje a cada transacción y si había alguna de ellas que alcanzaba mayor puntaje, esa transacción iba al sector de análisis del banco y se frenaba hasta comprobar si era fraudulenta o no. De ese modo, desarrollamos una infraestructura técnica y de soporte completamente nueva que involucró a diferentes áreas del banco: seguridad informática, sistemas, comercial, data warehouse, entre otras.
En los proyectos de inteligencia comercial los modelos desarrollados pasan a formar parte de los procesos internos del cliente. Justamente la capacidad de un consultor en Data Mining no es solamente desarrollar un modelo para el usuario final, el desafío no termina allí: debemos lograr que ese modelo funcione dentro de una estructura más grande.
A partir del conocimiento adquirido en la Maestría, ¿qué herramientas crees que te sirvieron más dentro de tu trabajo actual? Creo que todo. La verdad es que la Maestría amplió mi visión previa. En general uso más mi formación de Sistemas pero a la hora de comprender los datos, todos los conceptos que vimos en las primeras materias fueron claves. En Análisis Inteligente de Datos, por ejemplo, vimos cómo manejar grandes volúmenes de datos y entender los puntos fundamentales de las distintas herramientas. Para realizar el trabajo práctico, el profesor de la materia Data Mining en Economía y Finanzas nos trajo datos reales de bancos con múltiples data sets, utilizando este sistema de no identificación de las personas a las que pertenecían los datos. Recuerdo que cuando trabajé en mi primer proyecto en un banco me encontré con la misma estructura que había visto en esa materia de la Maestría. También el proyecto de detección de fraudes lo hicimos con Redes Neuronales, que es el título de otra materia específica. ¿Notás un punto de inflexión después de haberte graduado? Absolutamente. Si no hubiese cursado la Maestría, sinceramente no hubiera podido enfrentar este gran cambio de salirme de un rol netamente orientado al desarrollo de sistemas y a la gestión. Creo que mi grupo de compañeros de la Maestría comparten de alguna forma esta visión. Y además no fue sólo un cambio profesional sino también personal porque pude armar un nuevo círculo de amistad. Por último, ¿tenés alguna sugerencia de mejora para la Maestría? Percibí que algunas materias presentan una visión acotada y creo que pueden faltar ajustes para ver si los conceptos se aplican a problemas más reales y si abordan la complejidad y multiplicidad de los datos. Esto me lleva a pensar si algunas de las técnicas que aprendimos se podrian usar con muchas más variables que las que efectivamente vimos. Pero sé que estos aspectos se fueron mejorando a lo largo de los últimos años, considerando que yo egresé en el 2006.
El hecho de que hayan incluido Big Data dentro de las materias optativas me parece sumamente útil. Incluso el Taller de Tesis me parece muy importante para ir uniendo los intereses y expectativas de los cursantes con su trabajo final. Lo fundamental es que me fui de la Maestría con la capacidad de poder entender qué hay debajo de cada software y herramienta práctica que utilizo, cómo funciona cada modelo de predicción, y a entender los datos con el objetivo de sacarle el mayor provecho posible.

