{"id":1738,"date":"2025-06-17T10:23:59","date_gmt":"2025-06-17T13:23:59","guid":{"rendered":"https:\/\/datamining.dc.uba.ar\/predictivos\/?p=1738"},"modified":"2025-06-17T10:28:15","modified_gmt":"2025-06-17T13:28:15","slug":"oportunidades-de-la-ia-para-la-representacion-de-audio","status":"publish","type":"post","link":"https:\/\/datamining.dc.uba.ar\/predictivos\/?p=1738","title":{"rendered":"Oportunidades de la IA para la representaci\u00f3n de audio"},"content":{"rendered":"<p><b>La inteligencia artificial est\u00e1 revolucionando el trabajo de representaci\u00f3n de audio. Y los modelos preentrenados facilitan de alg\u00fan modo el an\u00e1lisis y procesamiento autom\u00e1tico de sonidos. En esta nota Leonardo Pepino, investigador en formaci\u00f3n del Laboratorio de Inteligencia Artificial Aplicada (LIAA ICC-UBA), nos cuenta cu\u00e1les son los desaf\u00edos y oportunidades actuales que presenta el an\u00e1lisis y desarrollo de representaciones de audio, un \u00e1rea en permanente evoluci\u00f3n.<\/b><\/p>\n<p><span style=\"font-weight: 400;\">Actualmente la mejora en la naturalidad de los sistemas de di\u00e1logo hablado, en los cuales una persona interact\u00faa con una computadora mediante la voz, pas\u00f3 a ser una de las funciones m\u00e1s comunes y exitosas de los asistentes virtuales.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Detr\u00e1s de estas mejoras en la interacci\u00f3n con las computadoras mediante di\u00e1logo, el aprendizaje de representaciones o <\/span><i><span style=\"font-weight: 400;\">embeddings<\/span><\/i><span style=\"font-weight: 400;\"> que convierten el sonido en vectores matem\u00e1ticos jug\u00f3 un papel fundamental.\u00a0<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Estos vectores son una representaci\u00f3n del significado subyacente de los sonidos, permitiendo que las computadoras procesen los mismos de manera m\u00e1s efectiva, y facilitando la resoluci\u00f3n de tareas como el reconocimiento de habla, identificaci\u00f3n del hablante y transcripci\u00f3n de m\u00fasica<\/span><span style=\"font-weight: 400;\">.<\/span><\/p>\n<p><b>Evoluci\u00f3n del an\u00e1lisis de habla: un campo en transformaci\u00f3n<\/b><\/p>\n<p><span style=\"font-weight: 400;\">En este contexto de fuerte evoluci\u00f3n de las t\u00e9cnicas y herramientas de an\u00e1lisis del habla, la Maestr\u00eda en Ciencia de Datos convers\u00f3 con <\/span><b>Leonardo Pepino<\/b><span style=\"font-weight: 400;\"> -ingeniero en sonido (UNTREF), investigador en formaci\u00f3n del LIAA y ex docente de la Maestr\u00eda- quien est\u00e1 finalizando su tesis de doctorado sobre An\u00e1lisis y desarrollo de representaciones generales de audio, bajo la direcci\u00f3n de Luciana Ferrer y Pablo Riera.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Los principales desaf\u00edos de esta \u00e1rea de investigaci\u00f3n incluyen reconocimiento de voz (transformaci\u00f3n de palabras habladas en texto), s\u00edntesis de voz (transformaci\u00f3n de texto en palabras habladas), gesti\u00f3n de di\u00e1logo (interpretaci\u00f3n de la entrada y decisi\u00f3n de c\u00f3mo responder) y modelado de prosodia (comprensi\u00f3n de la relaci\u00f3n entre \u2018qu\u00e9\u2019 se dice y \u2018c\u00f3mo\u2019 se dice) en los idiomas ingl\u00e9s y espa\u00f1ol.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">El investigador en formaci\u00f3n comenz\u00f3 su doctorado en un momento en el que el procesamiento del lenguaje natural (NLP) comenz\u00f3 a cobrar un fuerte impulso con el surgimiento de modelos de embeddings de texto como BERT. Este tipo de innovaciones en el campo del NLP se comenzaron a replicar en el campo del habla, dando a lugar a modelos como Wav2Vec 2.0, que aprende representaciones de habla mejorando el desempe\u00f1o de sistemas de reconocimiento de voz.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">\u201c<\/span><i><span style=\"font-weight: 400;\">Supongamos que nuestra representaci\u00f3n usual de las cantidades son n\u00fameros romanos. Y quiz\u00e1s sumar dos n\u00fameros romanos as\u00ed como est\u00e1n es muy dif\u00edcil, y hay que pensar\u00a0 algoritmos y t\u00e9cnicas complejas para hacer cuentas directamente con n\u00fameros romanos. Entonces, lo que uno puede hacer es cambiar la representaci\u00f3n, usando n\u00fameros ar\u00e1bigos como los d\u00edgitos que usamos en la mayor\u00eda de los pa\u00edses, donde para nosotros se vuelve m\u00e1s f\u00e1cil la tarea<\/span><\/i><span style=\"font-weight: 400;\">\u201d, ejemplifica Pepino. Y complementa, \u201c<\/span><i><span style=\"font-weight: 400;\">en el mundo del aprendizaje autom\u00e1tico y del habla y en general tambi\u00e9n del texto, im\u00e1genes y otras se\u00f1ales, es importante\u00a0 encontrar representaciones de las cosas que luego faciliten resolver otras tareas y en este punto es donde hubo un mont\u00f3n de avances<\/span><\/i><span style=\"font-weight: 400;\">\u201d.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">De este modo el investigador se\u00f1ala que al comienzo de su investigaci\u00f3n trabajaba con procesamiento de se\u00f1ales y redes neuronales convolucionales hasta que lleg\u00f3 la IA Generativa y los conocidos \u201ctransformers\u201d, un tipo de arquitectura de red neuronal que se enfoca en procesar secuencias de datos, como texto, de manera eficiente. Es all\u00ed donde se introdujeron varios modelos nuevos y t\u00e9cnicas para aprender estas representaciones o <\/span><i><span style=\"font-weight: 400;\">embeddings <\/span><\/i><span style=\"font-weight: 400;\">provenientes no s\u00f3lo del texto sino del audio y las im\u00e1genes.<\/span><\/p>\n<p><b>Ventajas y desventajas de los modelos preentrenados para el habla<\/b><\/p>\n<p><span style=\"font-weight: 400;\">En un principio, el investigador Pepino explica que previamente a la revoluci\u00f3n del aprendizaje de representaciones y el uso de t\u00e9cnicas de transferencia de aprendizaje, se deb\u00eda realizar un gran trabajo de recolecci\u00f3n de datos y preprocesamiento de los mismos, y se requer\u00eda de un gran conocimiento experto del dominio para poder resolver una tarea espec\u00edfica. No obstante, a partir de esta revoluci\u00f3n del aprendizaje de representaciones, el investigador puede tomar un modelo preentrenado de representaciones y hacer un ajuste fino <\/span><i><span style=\"font-weight: 400;\">(fine-tuning<\/span><\/i><span style=\"font-weight: 400;\">) adaptando el modelo a la tarea que se quiere resolver. \u201c<\/span><i><span style=\"font-weight: 400;\">Evidentemente cada vez se requiere menos conocimiento experto espec\u00edfico de la tarea que uno quiere resolver. Y, en este sentido, los modelos se vuelven m\u00e1s generalistas<\/span><\/i><span style=\"font-weight: 400;\">\u201d, describe el integrante del Laboratorio de IA Aplicada.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Ahora bien, <\/span><b>\u00bfcu\u00e1les ser\u00edan los pros y los contras de utilizar estos modelos preentrenados para el an\u00e1lisis y desarrollo de representaciones generales de audio?<\/b><span style=\"font-weight: 400;\"> En cuanto a las ventajas, \u201c<\/span><i><span style=\"font-weight: 400;\">es mucho m\u00e1s f\u00e1cil trabajar con un modelo preentrenado que desarrollarlo de cero. Si uno quiere resolver un problema usual como transcripci\u00f3n de habla (alguien habla y tienen que aparecer los subt\u00edtulos autom\u00e1ticos de lo que dice), suele ser una tarea muy compleja y estos modelos la facilitan ya que internamente entienden el lenguaje, conocen la estructura del mismo, como palabras y fonemas y saben en cierta manera escuchar. Uno parte de algo ya desarrollado, y con menos esfuerzo, menos datos, menos c\u00f3mputo y, por ende, m\u00e1s velocidad y menos necesidad de ser un experto en el dominio<\/span><\/i><span style=\"font-weight: 400;\">\u201d, plantea Pepino.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Al mismo tiempo, para resolver tareas de reconocimiento del habla o similares como reconocer al hablante, la tendencia actual es integrar un modelo \u00fanico que resuelva todo junto. \u201c<\/span><i><span style=\"font-weight: 400;\">A veces alcanza con tomar el modelo que ya est\u00e1 preentrenado y utilizarlo como viene, haciendo algo como prompt engineering o dem\u00e1s t\u00e9cnicas y en el audio est\u00e1 empezando a pasar eso tambi\u00e9n: empiezan a salir modelos, como ChatGPT, que no solamente trabajan con texto sino que uno puede hablarles o enviarles un audio y te devuelven una descripci\u00f3n del audio o le pod\u00e9s hacer preguntas sobre lo que est\u00e1 sonando en el audio. En ese sentido cada vez es menor la barrera de entrada y el esfuerzo para encarar estos problemas<\/span><\/i><span style=\"font-weight: 400;\">\u201d, advierte el especialista.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">En relaci\u00f3n a las desventajas, una contra puntual de estos modelos generalistas ser\u00eda que es dif\u00edcil entender claramente cu\u00e1les son sus limitaciones y capacidades, ya que al usarlos para pr\u00e1cticamente cualquiera de las tareas, no se puede reconocer fielmente su desempe\u00f1o en todas ellas.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">\u201c<\/span><i><span style=\"font-weight: 400;\">Antes uno se enfocaba en una sola tarea espec\u00edfica donde pod\u00eda tener mucho feedback y entendimiento de cu\u00e1n bueno era el modelo en esa tarea. Era un modelo que lo entrenabas s\u00f3lo para reconocer habla y lo evaluabas para ese fin y lo testeabas de muchas maneras posibles, sab\u00edas d\u00f3nde se equivocaba, d\u00f3nde no y qu\u00e9 tipo de errores comet\u00eda<\/span><\/i><span style=\"font-weight: 400;\">\u201d, puntualiza.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">El investigador aclara que hoy en d\u00eda se pierde interpretabilidad en estos modelos preentrenados, porque como pueden hacer tantas tareas distintas y son tan grandes y complejos, es dif\u00edcil saber c\u00f3mo ChatGPT (o cualquier otro modelo) llega a la respuesta que llega. \u201c<\/span><i><span style=\"font-weight: 400;\">Y el tema de las alucinaciones en las respuestas, m\u00e1s all\u00e1 de que se est\u00e1 empezando a resolver, sigue siendo un problema cuando el modelo de lenguaje da respuestas err\u00f3neas totalmente convencido<\/span><\/i><span style=\"font-weight: 400;\">\u201d, afirma Pepino.<\/span><\/p>\n<p><b>Posibles aplicaciones durante el doctorado en representaci\u00f3n de audio\u00a0<\/b><\/p>\n<p><span style=\"font-weight: 400;\">El trabajo doctoral de Leonardo Pepino, en su fase final, consiste en la <\/span><b>representaci\u00f3n efectiva del audio para resolver distintos problemas a trav\u00e9s de un modelo generalista<\/b><span style=\"font-weight: 400;\">; representaci\u00f3n que no s\u00f3lo incluye al habla sino tambi\u00e9n a la m\u00fasica y los sonidos ambiente.<\/span><\/p>\n<p><span style=\"font-weight: 400;\"><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2025\/06\/Nota-interior-Audio.png\"><img decoding=\"async\" loading=\"lazy\" class=\"alignleft size-full wp-image-1739\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2025\/06\/Nota-interior-Audio.png\" alt=\"\" width=\"397\" height=\"425\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2025\/06\/Nota-interior-Audio.png 397w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2025\/06\/Nota-interior-Audio-280x300.png 280w\" sizes=\"(max-width: 397px) 100vw, 397px\" \/><\/a>Para ello, el investigador desarroll\u00f3 un modelo que fue entrenado con 12 mil horas de audio (que a una persona le llevar\u00eda m\u00e1s de un a\u00f1o escuchar), y que luego puede ser utilizado para resolver una gran cantidad de tareas de audio. Este modelo aprende una representaci\u00f3n general de los sonidos, la cual luego puede ser utilizada por otros modelos mucho m\u00e1s peque\u00f1os y sencillos para resolver distintas tareas de audio con pocos datos y en poco tiempo. Esto lleva a que un mismo modelo pueda reutilizarse, extrayendo activaciones de las capas intermedias para representar a los sonidos, y entrenando a los modelos m\u00e1s peque\u00f1os para que utilicen estas representaciones del modelo grande como entrada. Esto lleva a una simplificaci\u00f3n del proceso de entrenamiento, y ahorra tiempo, datos y recursos, ayudando a los ingenieros y cient\u00edficos que trabajan con audio.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">\u201c<\/span><i><span style=\"font-weight: 400;\">A partir de este trabajo presentaremos un paper en la reconocida conferencia InterSpeech (<\/span><\/i><a href=\"https:\/\/www.semanticscholar.org\/paper\/EnCodecMAE%3A-Leveraging-neural-codecs-for-universal-Pepino-Riera\/9be834da99ee03d7bb833107c91198ad532f839e\" target=\"_blank\" rel=\"noopener\"><i><span style=\"font-weight: 400;\">EnCodecMAE: Leveraging Neural Codecs for Universal Audio Representation Learning<\/span><\/i><\/a><i><span style=\"font-weight: 400;\">) y teniendo en cuenta que es un modelo que devuelve representaciones de todo tipo de audio lo evaluamos de forma eficiente en seis tareas distintas<\/span><\/i><span style=\"font-weight: 400;\">\u201d, expresa entusiasmado el tesista de doctorado.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Estas tareas son diversas y abarcan los dominios del habla, la m\u00fasica y los sonidos ambientales:<\/span><\/p>\n<p><span style=\"font-weight: 400;\">1) <\/span><b>Clasificaci\u00f3n de notas musicales<\/b><span style=\"font-weight: 400;\">: suena un instrumento y el modelo debe indicar qu\u00e9 nota se est\u00e1 tocando.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">2) <\/span><b>Clasificaci\u00f3n de g\u00e9nero musical: <\/b><span style=\"font-weight: 400;\">\u00a0dada una canci\u00f3n, el modelo debe clasificar a qu\u00e9 g\u00e9nero musical pertenece, por ejemplo, rock, m\u00fasica cl\u00e1sica, metal y jazz.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">3) <\/span><b>Reconocimiento de comandos de voz:<\/b><span style=\"font-weight: 400;\"> dada una grabaci\u00f3n de un usuario diciendo un comando, el modelo debe identificar cu\u00e1l es. Una aplicaci\u00f3n es controlar dispositivos, como una c\u00e1mara, si esta puede reconocer los comandos \u2018arriba\u2019, \u2018abajo\u2019, \u2018derecha\u2019, \u2018izquierda\u2019, \u2018grabar\u2019.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">4) <\/span><b>Reconocimiento de emociones en la voz<\/b><span style=\"font-weight: 400;\">: dada una grabaci\u00f3n de una persona hablando, busca determinar si se encuentra feliz, triste, enojada o neutra. Identificar estos estados mentales puede ayudar a mejorar la comunicaci\u00f3n con asistentes virtuales, los cuales pueden responder de una forma m\u00e1s emp\u00e1tica.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">5) <\/span><b>Clasificaci\u00f3n de eventos ac\u00fasticos generales: <\/b><span style=\"font-weight: 400;\">dada una grabaci\u00f3n, el modelo identifica qu\u00e9 sonidos est\u00e1n sonando y los asigna a una de 200 categor\u00edas posibles. Por ejemplo, el modelo puede indicar si hay una persona hablando, o si ladra un perro de fondo, si suena una alarma o si se cierra una puerta, entre muchas otras clases de sonidos.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">6) <\/span><b>Reconocimiento de habla: <\/b><span style=\"font-weight: 400;\">dada una grabaci\u00f3n de una persona hablando, el modelo realiza una transcripci\u00f3n de la misma transform\u00e1ndola a texto.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Por \u00faltimo, Pepino aclara que estas aplicaciones tuvieron un alto desempe\u00f1o en las pruebas que realizaron, y que el modelo se podr\u00eda integrar con los LLM actuales ofreciendo muchas oportunidades de proyecci\u00f3n en la industria y en dominios variados como educaci\u00f3n, salud y entretenimiento.<\/span><\/p>\n<hr \/>\n<h5><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2025\/06\/Leonardo-Pepino-OK.jpg\"><img decoding=\"async\" loading=\"lazy\" class=\"alignleft wp-image-1740\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2025\/06\/Leonardo-Pepino-OK-150x150.jpg\" alt=\"\" width=\"143\" height=\"143\" \/><\/a>Leonardo Pepino<span style=\"font-weight: 400;\"> es ingeniero de sonido de la Universidad Nacional de Tres de Febrero (UNTREF). Es becario doctoral bajo la supervisi\u00f3n de los investigadores Luciana Ferrer y Pablo Riera, y fue docente auxiliar de la materia \u201cAprendizaje Autom\u00e1tico\u201d de la Maestr\u00eda en Ciencia de Datos (UBA). Actualmente trabaja en el aprendizaje de representaciones de audio mediante redes neuronales profundas. En sus tiempos libres toca la guitarra y confiesa que su gran afici\u00f3n por la m\u00fasica, desde una edad temprana, fue fundamentalmente lo que le llev\u00f3 a especializarse en sonido y representaci\u00f3n de audio.<\/span><\/h5>\n<p>&nbsp;<\/p>\n<hr \/>\n<p>&nbsp;<\/p>\n","protected":false},"excerpt":{"rendered":"<p>La inteligencia artificial est\u00e1 revolucionando el trabajo de representaci\u00f3n de audio. En esta nota, Leonardo Pepino, investigador en formaci\u00f3n del Laboratorio de Inteligencia Artificial Aplicada, nos cuenta cu\u00e1les son los desaf\u00edos y oportunidades actuales que presenta el an\u00e1lisis y desarrollo de representaciones de audio, un \u00e1rea en permanente evoluci\u00f3n.<\/p>\n","protected":false},"author":4,"featured_media":1741,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_mi_skip_tracking":false},"categories":[24,36,25],"tags":[21,31],"_links":{"self":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1738"}],"collection":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/users\/4"}],"replies":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=1738"}],"version-history":[{"count":8,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1738\/revisions"}],"predecessor-version":[{"id":1749,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1738\/revisions\/1749"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/media\/1741"}],"wp:attachment":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=1738"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=1738"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=1738"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}