El Martes 09/09 se realizó la Defensa de Tesis de Tomás Marcos titulada “Sistemas de transcripción automática de batería: diseño y evaluación de enfoques basados en aprendizaje profundo moderno y aprendizaje automático tradicional”. Contó con la dirección del Dr. Pablo Riera. Los jurados fueron el Dr. Hernán Bocaccio, la Dra. Laura de la Fuente de la Torre y la Dr. Facundo Quiroga. La defensa puede verse a través del siguiente link: https://www.youtube.com/live/4g–cMl0mzw
Resumen:
Los sistemas de transcripción automática de batería (TAB) intentan generar una transcripción de los eventos ocurridos en un sistema de batería a partir de una pista o canción, lo cual resulta una tarea desafiante. En este trabajo exploraremos diferentes enfoques para integrar un sistema de TAB: modelos o algoritmos de reconocimiento del instrumento, de detección de eventos y de separación de fuentes. Se hará énfasis en los modelos de reconocimiento, probando así diferentes técnicas. Algunas de estas tradicionales como máquinas de soporte vectorial; otras en cambio, basadas en aprendizaje profundo como son las redes convolucionales (CNN) tanto con características basadas en espectrogramas como con caracter ́ısticas basadas en otros modelos como Music undERstanding model with large-scale self-supervised Training (MERT). Por último, se hace prueba de enfoques basados en prompts de lenguaje natural tales como Contrastive Language-Audio Pretraining (CLAP.)
En principio, se utilizan las anotaciones de verdad de campo (groundtruth) para los modelos de reconocimiento y posteriormente se incorporan m ́etodos de detección de eventos para prescindir de estas, logrando así un sistema de TAB utilizando pistas de batería aisladas. Como prueba final, se incorporan las pistas con todos los instrumentos y se prueba entrenar modelos con estas pistas completas por un lado. Por otro, se entrenan estos modelos de detección de eventos y reconocimiento del instrumento pero utilizando un modelo de separación de fuentes como parte del preprocesamiento (Hybrid-Demucs). Este último enfoque resulta tener mayor éxito que el primero, principalmente debido a una mejora en el modelo de detección de eventos. Realizamos las evaluaciones de dichos métodos utilizando el conjunto de datos llamado “MDB Drums”. Este mismo, tiene la ventaja de poseer tanto pistas completas como aisladas por tipo de instrumento, lo cual nos permitió evaluar la utilidad de un algoritmo de separación de fuentes para la tarea de TAB. En la comparativa, notamos que los métodos basados en CNN resultan mejores para el reconocimiento del instrumento a lo largo de los instrumentos que integran la batería.
En el agregado, se encuentra un alto rendimiento (medido por F1-score) para los instrumentos de bombo, HiHat y redoblante; mientras que por otro lado se encuentra uno bajo para los instrumentos de pandereta/side stick, toms y platillos, siendo una de las causas de esto, el tamaño muestral del conjunto de entrenamiento. Se encuentra que los resultados no varían significativamente al incorporar un método de detección de eventos. Por éltimo, se proponen alternativas a futuro para incrementar la calidad del reconocimiento en los instrumentos donde esta no resultó favorable, tales como incorporar técnicas de data augmentation.