{"id":1171,"date":"2020-05-22T13:20:32","date_gmt":"2020-05-22T16:20:32","guid":{"rendered":"http:\/\/datamining.dc.uba.ar\/predictivos\/?p=1171"},"modified":"2020-05-24T18:00:22","modified_gmt":"2020-05-24T21:00:22","slug":"patrones-de-uso-del-servicio-de-datos-en-una-red-de-telefonia-movil-parte-2","status":"publish","type":"post","link":"https:\/\/datamining.dc.uba.ar\/predictivos\/?p=1171","title":{"rendered":"Patrones de uso del servicio de datos en una red de telefon\u00eda m\u00f3vil &#8211; Parte 2"},"content":{"rendered":"<p><strong>Por Ing. Horacio Gast\u00f3n Arrigo (Especialista en Explotaci\u00f3n de Datos y Descubrimiento del Conocimiento-UBA).\u00a0\u00a0<\/strong><\/p>\n<p><span style=\"font-weight: 400;\">En la primera parte de esta publicaci\u00f3n se introdujeron los conceptos b\u00e1sicos de una red de telefon\u00eda celular y, utilizando los datos reales de la red de Telecom Italia, obtuvimos un <\/span><i><span style=\"font-weight: 400;\">clustering<\/span><\/i><span style=\"font-weight: 400;\"> de los distritos de la ciudad de Mil\u00e1n. Esto fue en base al comportamiento temporal del uso del servicio de internet.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">En esta segunda parte se muestran los resultados obtenidos con los m\u00e9todos de agrupaci\u00f3n por componentes espectrales y agrupaci\u00f3n por acumulaci\u00f3n de evidencia. Por \u00faltimo se presentan las conclusiones finales.<\/span><\/p>\n<h4><b>Agrupaci\u00f3n <\/b><b>por componentes espectrales\u00a0<\/b><\/h4>\n<p><span style=\"font-weight: 400;\">Aplicando la transformada discreta de Fourier[6] a las series de tiempo, mediante el algoritmo FFT[9], obtenemos un modelo equivalente en el dominio de la frecuencia.\u00a0<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Si se aplica a la serie de la figura 11, se obtiene el resultado en m\u00f3dulo y fase de la figura 12. El eje horizontal en escala de ????Hz y los valores de densidad espectral de potencia (PSD por sus siglas en ingl\u00e9s), y de fase junto a los marcadores.\u00a0<\/span><\/p>\n<div id=\"attachment_1172\" style=\"width: 402px\" class=\"wp-caption aligncenter\"><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura_11.png\"><img aria-describedby=\"caption-attachment-1172\" decoding=\"async\" loading=\"lazy\" class=\"size-full wp-image-1172\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura_11.png\" alt=\"\" width=\"392\" height=\"285\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura_11.png 392w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura_11-300x218.png 300w\" sizes=\"(max-width: 392px) 100vw, 392px\" \/><\/a><p id=\"caption-attachment-1172\" class=\"wp-caption-text\">Figura 11: CDR de internet para la celda #5060<\/p><\/div>\n<div id=\"attachment_1173\" style=\"width: 785px\" class=\"wp-caption aligncenter\"><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura_12.jpeg\"><img aria-describedby=\"caption-attachment-1173\" decoding=\"async\" loading=\"lazy\" class=\" wp-image-1173\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura_12-1024x528.jpeg\" alt=\"\" width=\"775\" height=\"399\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura_12-1024x528.jpeg 1024w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura_12-300x155.jpeg 300w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura_12-768x396.jpeg 768w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura_12.jpeg 1366w\" sizes=\"(max-width: 775px) 100vw, 775px\" \/><\/a><p id=\"caption-attachment-1173\" class=\"wp-caption-text\">Figura 12: PSD y fase obtenido mediante la FFT de la serie de tiempo de la celda 5060.<\/p><\/div>\n<p><span style=\"font-weight: 400;\">Es posible utilizar la transformaci\u00f3n para obtener un modelo equivalente, seleccionando algunas componentes en frecuencia, y as\u00ed reducir la dimensionalidad. En este caso, se utilizan los valores de frecuencia, magnitud y fase como atributos. Para la selecci\u00f3n de componentes, es posible adoptar diversos criterios, tales como:\u00a0<\/span><\/p>\n<ol>\n<li style=\"font-weight: 400;\"><span style=\"font-weight: 400;\">Selecci\u00f3n por Umbral: Elegir solo las componentes cuyo valor de PSD supera un determinado umbral.<\/span><\/li>\n<li style=\"font-weight: 400;\"><span style=\"font-weight: 400;\">Selecci\u00f3n por Muestras: Elegir las primeras N componentes.<\/span><\/li>\n<\/ol>\n<p><span style=\"font-weight: 400;\">Aqu\u00ed solo se muestran los resultados obtenidos mediante la selecci\u00f3n por muestras. En el trabajo original se puede ver una comparativa entre estos dos m\u00e9todos.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">A modo de ejemplo, se aplica la selecci\u00f3n por componentes a la serie temporal de la celda #5060 (Figura 11). En la figura 13 se muestra la serie de tiempo original (rojo) y la series de tiempo equivalentes utilizando las 5, 10 y 20 primeras componentes.\u00a0<\/span><\/p>\n<div id=\"attachment_1174\" style=\"width: 482px\" class=\"wp-caption aligncenter\"><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura-13-integrada.png\"><img aria-describedby=\"caption-attachment-1174\" decoding=\"async\" loading=\"lazy\" class=\"size-full wp-image-1174\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura-13-integrada.png\" alt=\"\" width=\"472\" height=\"720\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura-13-integrada.png 472w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura-13-integrada-197x300.png 197w\" sizes=\"(max-width: 472px) 100vw, 472px\" \/><\/a><p id=\"caption-attachment-1174\" class=\"wp-caption-text\">Figura 13: Resultados obtenidos a partir de los modelos de selecci\u00f3n de componentes por Umbral y por cantidad de muestras N. En rojo se muestra la serie de tiempo original de la celda #5060 y en verde la serie obtenida a partir del modelo. a) N = 5, Umbral = 0; b) N=10, Umbral = 0; c) N=20, Umbral=0.<\/p><\/div>\n<p><span style=\"font-weight: 400;\">Al buscar el k \u00f3ptimo se obtiene nuevamente un rango, aunque algo menor que el obtenido para series de tiempo. En la figura 14 se muestran los resultados del <\/span><i><span style=\"font-weight: 400;\">clustering<\/span><\/i><span style=\"font-weight: 400;\"> por K-means.<\/span><\/p>\n<div id=\"attachment_1187\" style=\"width: 1034px\" class=\"wp-caption alignleft\"><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura_14nueva.png\"><img aria-describedby=\"caption-attachment-1187\" decoding=\"async\" loading=\"lazy\" class=\"size-large wp-image-1187\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura_14nueva-1024x271.png\" alt=\"\" width=\"1024\" height=\"271\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura_14nueva-1024x271.png 1024w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura_14nueva-300x79.png 300w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura_14nueva-768x203.png 768w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura_14nueva.png 1256w\" sizes=\"(max-width: 1024px) 100vw, 1024px\" \/><\/a><p id=\"caption-attachment-1187\" class=\"wp-caption-text\">Figura 14: Mapa de distritos agrupados mediante K-means, con componentes espectrals y k=3, 4 y 5.<\/p><\/div>\n<p><span style=\"font-weight: 400;\">Al igual que en los resultados obtenidos con el <\/span><i><span style=\"font-weight: 400;\">clustering<\/span><\/i><span style=\"font-weight: 400;\"> de las series de tiempo, aqu\u00ed tampoco es posible deducir una relaci\u00f3n entre consumo medio y agrupaci\u00f3n de distritos. Nuevamente se observa que al aumentar k, las nuevas agrupaciones se crean a partir del cluster con m\u00e1s distritos. Es importante notar que si bien los modelos son f\u00edsicamente equivalentes, las agrupaciones obtenidas son diferentes. (Se recomienda ver la figura 9 de la parte 1).<\/span><\/p>\n<h4><b>Agrupaci\u00f3n por acumulaci\u00f3n de evidencia<\/b><\/h4>\n<p><span style=\"font-weight: 400;\">La agrupaci\u00f3n por acumulaci\u00f3n de evidencia es, en forma resumida, un m\u00e9todo de ensamble de resultados[7]. Es de utilidad cuando no se dispone de un set de datos de control y validaci\u00f3n. Consecuentemente, el resultado obtenido con una \u00fanica ejecuci\u00f3n de K-means podr\u00eda no ser suficiente para encontrar la agrupaci\u00f3n m\u00e1s adecuada.\u00a0<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Se aplica la t\u00e9cnica de Single-Linkage (clustering jer\u00e1rquico) con medida Eucl\u00eddea, pero se han propuestos algoritmos m\u00e1s complejos [8].<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Existen diversas maneras de acumular evidencia en aprendizaje no supervisado, pero aqu\u00ed solo se utiliza la t\u00e9cnica de ejecutar un algoritmo muchas veces con diferentes par\u00e1metros [8]. En este caso, combinando resultados del algoritmo K-means con k entre 2 y 15.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">En la figura 15 se muestran los dendogramas obtenidos con las series de tiempo (a), y con las componentes espectrales (b), de los perfiles de los distritos<\/span><span style=\"font-weight: 400;\">.\u00a0<\/span><\/p>\n<div id=\"attachment_1176\" style=\"width: 819px\" class=\"wp-caption alignleft\"><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura-15-juntas.png\"><img aria-describedby=\"caption-attachment-1176\" decoding=\"async\" loading=\"lazy\" class=\" wp-image-1176\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura-15-juntas.png\" alt=\"\" width=\"809\" height=\"290\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura-15-juntas.png 881w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura-15-juntas-300x108.png 300w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura-15-juntas-768x275.png 768w\" sizes=\"(max-width: 809px) 100vw, 809px\" \/><\/a><p id=\"caption-attachment-1176\" class=\"wp-caption-text\">Figura 15: Dendogramas obtenidos por acumulaci\u00f3n de evidencia para los 88 distritos de Mil\u00e1n utilizando: a) Series de tiempo b) Componentes espectrales.<\/p><\/div>\n<p><span style=\"font-weight: 400;\">La cantidad de clusters queda definida eligiendo un valor de altura igual a 3 para ambos dendogramas. En las figuras 16 y 17, se muestran los resultados comparando adem\u00e1s con el equivalente de aplicar una \u00fanica ejecuci\u00f3n de K-means.\u00a0<\/span><\/p>\n<div id=\"attachment_1177\" style=\"width: 805px\" class=\"wp-caption alignleft\"><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura-16-juntas.png\"><img aria-describedby=\"caption-attachment-1177\" decoding=\"async\" loading=\"lazy\" class=\" wp-image-1177\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura-16-juntas.png\" alt=\"\" width=\"795\" height=\"342\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura-16-juntas.png 816w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura-16-juntas-300x129.png 300w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura-16-juntas-768x330.png 768w\" sizes=\"(max-width: 795px) 100vw, 795px\" \/><\/a><p id=\"caption-attachment-1177\" class=\"wp-caption-text\">Figura 16: Clustering obtenidos a partir de las series de tiempo de los distritos con a) K-means con k= 6 b) Acumulaci\u00f3n de Evidencia y Clustering Jer\u00e1rquico.<\/p><\/div>\n<div id=\"attachment_1178\" style=\"width: 805px\" class=\"wp-caption alignleft\"><a href=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura-17-juntas.png\"><img aria-describedby=\"caption-attachment-1178\" decoding=\"async\" loading=\"lazy\" class=\" wp-image-1178\" src=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura-17-juntas.png\" alt=\"\" width=\"795\" height=\"348\" srcset=\"https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura-17-juntas.png 846w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura-17-juntas-300x131.png 300w, https:\/\/datamining.dc.uba.ar\/predictivos\/wp-content\/uploads\/2020\/05\/Figura-17-juntas-768x336.png 768w\" sizes=\"(max-width: 795px) 100vw, 795px\" \/><\/a><p id=\"caption-attachment-1178\" class=\"wp-caption-text\">Figura 17: Clustering obtenidos a partir de las componentes espectrales (FFT) de los distritos con a) K-means con k= 5 b) Acumulaci\u00f3n de Evidencia y Clustering Jer\u00e1rquico.<\/p><\/div>\n<p><span style=\"font-weight: 400;\">De las figuras se observa que las agrupaciones obtenidas mediante ambos m\u00e9todos, coinciden en la mayor\u00eda de los distritos pero, al parecer la agrupaci\u00f3n por acumulaci\u00f3n de evidencia, encuentra estructuras subyacente que no son detectada por una \u00fanica ejecuci\u00f3n de k-means.\u00a0<\/span><\/p>\n<h4><b>Conclusiones<\/b><\/h4>\n<p><span style=\"font-weight: 400;\">De los resultados, podemos decir:\u00a0<\/span><\/p>\n<ul>\n<li style=\"font-weight: 400;\"><span style=\"font-weight: 400;\">Los valores promedio no son representativos del comportamiento temporal. Un valor estad\u00edstico no puede representar la din\u00e1mica del uso del servicio.\u00a0<\/span><\/li>\n<li style=\"font-weight: 400;\"><span style=\"font-weight: 400;\">Las agrupaciones obtenidas por serie de tiempo y su equivalente en frecuencia, son diferentes. Esto indicar\u00eda que las agrupaciones captaron diferentes aspectos del comportamiento en los distritos. Ser\u00eda interesante estudiarlo con m\u00e1s detalle.\u00a0<\/span><\/li>\n<li style=\"font-weight: 400;\"><span style=\"font-weight: 400;\">Los resultados del m\u00e9todo por acumulaci\u00f3n de evidencias son consistentes con los obtenidos de una \u00fanica ejecuci\u00f3n de K-means.\u00a0<\/span><\/li>\n<li style=\"font-weight: 400;\"><span style=\"font-weight: 400;\">La agrupaci\u00f3n por acumulaci\u00f3n de evidencia parece detectar mayor detalle.<\/span><\/li>\n<\/ul>\n<p><span style=\"font-weight: 400;\">El an\u00e1lisis realizado por distrito se puede hacer f\u00e1cilmente a nivel de celda. Estos permitir\u00eda encontrar patrones que sean de utilidad para tomar acciones sobre radiobases que se encuentran sobrecargadas o bien encontrar tendencias que permitan realizar acciones preventivas antes que esto ocurra. Al mismo tiempo, podr\u00eda resultar de inter\u00e9s relacionar cada una de las celdas con el distrito al cual pertenece para que, agregando datos externos, poder hacer otros an\u00e1lisis tales como: an\u00e1lisis socioecon\u00f3mico, demogr\u00e1ficos, rendimiento de la infraestructura, cobertura, capacidad de servicio, etc.\u00a0<\/span><\/p>\n<p><span style=\"font-weight: 400;\">La validaci\u00f3n de resultados, resulta dif\u00edcil sin datos externos o alg\u00fan etiquetado. Sin embargo, analizando algunas caracter\u00edsticas de la ciudad, se ve que las agrupaciones tienen sentido cuando se analiza la ubicaci\u00f3n de puntos tur\u00edsticos,\u00a0 zonas c\u00e9ntricas y residenciales.\u00a0<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Ser\u00eda provechoso estudiar otros algoritmos de agrupamiento, como as\u00ed tambi\u00e9n otras medida de distancia m\u00e1s adecuadas para series de tiempo.<\/span><\/p>\n<h4><b>Referencias<\/b><\/h4>\n<p><span style=\"font-weight: 400;\">\u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a06. Proakis, J. G.,\u00a0 Manolakis, D. K., Digital Signal Processing, Pearson new international edition, fourth edition, 2014<\/span><\/p>\n<p><span style=\"font-weight: 400;\">\u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a07.\u00a0<\/span><span style=\"font-weight: 400;\">Fred A., Jain A.K. (2002) Evidence Accumulation Clustering Based on the K-Means Algorithm. In: Caelli T., Amin A., Duin R.P.W., de Ridder D., Kamel M. (eds) Structural, Syntactic, and Statistical Pattern Recognition. SSPR \/SPR 2002. Lecture Notes in Computer Science, vol 2396. Springer, Berlin, Heidelberg<\/span><\/p>\n<p><span style=\"font-weight: 400;\">\u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 8. Fred, A. L. N., &amp; Jain, A. K. (n.d.). Data clustering using evidence accumulation. Object Recognition Supported by User Interaction for Service Robots. doi:10.1109\/icpr.2002.1047450\u00a0<\/span><\/p>\n<p><span style=\"font-weight: 400;\">\u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 \u00a0 9. Cooley, James W., Tukey, John W. (1965). An algorithm for the machine calculation of complex Fourier series, <\/span><i><span style=\"font-weight: 400;\">Mathematics of Computation<\/span><\/i><span style=\"font-weight: 400;\">, 19(90), 297-301. doi: 10.2307\/2003354.<\/span><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Por Ing. Horacio Gast\u00f3n Arrigo (Especialista en Explotaci\u00f3n de Datos y Descubrimiento del Conocimiento-UBA).  En esta segunda parte de la publicaci\u00f3n se muestran los resultados obtenidos con los m\u00e9todos de agrupaci\u00f3n por componentes espectrales y agrupaci\u00f3n por acumulaci\u00f3n de evidencia. Por \u00faltimo se presentan las conclusiones finales.<\/p>\n","protected":false},"author":4,"featured_media":1179,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_mi_skip_tracking":false},"categories":[24,22,25],"tags":[21,19,31],"_links":{"self":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1171"}],"collection":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/users\/4"}],"replies":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=1171"}],"version-history":[{"count":11,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1171\/revisions"}],"predecessor-version":[{"id":1195,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/posts\/1171\/revisions\/1195"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=\/wp\/v2\/media\/1179"}],"wp:attachment":[{"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=1171"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=1171"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/datamining.dc.uba.ar\/predictivos\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=1171"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}