Evaluación de la capacidad de predicción de granizo de índices atmosféricos
Por Santiago Banchero (Magíster en Explotación de Datos-UBA).
En la actividad agrícola existen muchos factores de riesgo que condicionan la producción, algunos pueden ser tratados por el hombre, como por ejemplo enfermedades o plagas pero también existen otros que no pueden ser controlados y que de suceder ponen en peligro la seguridad de las personas y producen grandes trastornos económicos. Este conjunto de factores de riesgo tienen que ver con el comportamiento de la atmósfera y los eventos extremos que surgen de ella. La ocurrencia de granizo constituye uno de los fenómenos meteorológicos capaces de infligir daños cuantiosos al deteriorar seriamente cultivos, construcciones y medios de transporte.
El objetivo de este trabajo ha sido evaluar cuál es la capacidad de predicción de ocurrencia de granizo de un conjunto de índices de inestabilidad utilizando algoritmos de machine learning para el área comprendida por la red de radares de INTA (Figura 1).
Figura 1: Área de trabajo definida por la red de radares de INTA.
Se utilizaron tres orígenes de datos diferentes, por un lado se trabajó con los radares de INTA para la determinación de las áreas con desarrollo convectivo y esta información fue utilizada como target para la construcción de modelos de pronóstico. También se utilizaron datos del pronóstico operativo Global Forecast System (GFS) de donde se extrajeron unas 60 variables de diferentes horarios a partir de las cuales se calcularon índices atmosféricos como Total Totals, K-Index, Showalter, SWEAT Index, entre otros. Por último, para la validación de los modelos se utilizaron puntos donde se comprobó la caída de granizo. Estos puntos fueron obtenidos de dos fuentes: empresas aseguradoras de granizo y de la red social Twitter.
La utilización de redes sociales como insumo de aplicaciones colaborativas relacionadas con el clima, el control del tránsito o en tareas de concientización combinada con diferentes redes de sensores es cada vez más común. Para este trabajo se relevó de Twitter a través de su API REST una cantidad importantes de tweets que contenían términos relacionados con la temática granizo. Los aportes en este sentido fueron dos, por un lado, la validación de los tweets utilizando el producto de radar Composite Reflectivity (o CMAX) de la variable dBZ (Figura 2) calculado a partir de los datos diarios de radar. Y por otro, el geoposicionamiento de los tweets a partir de la información provista en el cuerpo del mensaje. Para esto utilizaron técnicas de extracción de información – Named Entity Recognition (NER) – que permite etiquetar entidades presentes en un texto como nombres propios, ubicaciones, etc.
Figura 2: Validación de tweets utilizando reflectividad
A partir de los índices de inestabilidad calculados utilizando los pronósticos de GFS se realizó un análisis de clustering con Mezclas Gaussianas (GMM) que ha permitido analizar regiones homogéneas y etiquetarlas como positivas o negativas según lo observado en los acumulados diarios de CMAX. Con esto se verificó la capacidad de separar de los índices cuando se observan eventos convectivos a través de RADAR.
Otro experimento realizado ha sido la construcción de clasificadores con Random Forest (RF) a partir de los datos etiquetados en la etapa de clustering. Se realizó un muestreo de celdas marcadas como positivas y negativas desde los agrupamientos y se ajustaron clasificadores con RF. Estos resultados fueron muy buenos, logrando un ajuste en testing de AUC ≈ 98%. Con los modelos obtenidos se pronosticaron varias fechas y se mapearon las probabilidades (Figura 3) con que las celdas fueron clasificadas como positivas. Estos pronósticos se validaron con puntos de campo y los resultados mostraron una buena correlación espacial entre los puntos y las celdas con probabilidades mayor a 0.5 de ser positivas.
Los mapas construidos con las probabilidades de pronosticar una celda como positiva tienen coherencia con los puntos de validación, es decir, que existe una buena correlación espacial entre estos en varias de las fechas estudiadas.
Figura 3: Mapas de probabilidad de pronosticar como positiva a una celda GFS. Se tomó el pronóstico de referencia de las 12z (9 AM). Los mapas se corresponden con (a) 24 hs, (b) 18 hs y (c) 12 hs previas al pronóstico de referencia.
En este trabajo se ha mostrado cómo a partir de la construcción de índices atmosféricos implementados con pronósticos operacionales como GFS y combinado con herramientas de descubrimiento de conocimiento y machine learning es posible mejorar la determinación de las áreas donde hay alta probabilidad de precipitación de granizo. El enfoque muestra la precisión en la predicción de la ubicación del granizo con hasta un día de anticipación. Además, deja abiertas varias líneas para quienes quieran continuar trabajando en la temática.

