<?xml version="1.0" encoding="ISO-8859-1"?><article xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance">
<front>
<journal-meta>
<journal-id>1646-9895</journal-id>
<journal-title><![CDATA[RISTI - Revista Ibérica de Sistemas e Tecnologias de Informação]]></journal-title>
<abbrev-journal-title><![CDATA[RISTI]]></abbrev-journal-title>
<issn>1646-9895</issn>
<publisher>
<publisher-name><![CDATA[AISTI - Associação Ibérica de Sistemas e Tecnologias de Informação]]></publisher-name>
</publisher>
</journal-meta>
<article-meta>
<article-id>S1646-98952017000100006</article-id>
<article-id pub-id-type="doi">10.17013/risti.21.67-84</article-id>
<title-group>
<article-title xml:lang="es"><![CDATA[Esquema de Visualización para Modelos de Clústeres en Minería de Datos]]></article-title>
<article-title xml:lang="en"><![CDATA[New Visualization Scheme for Cluster Models in Data Mining]]></article-title>
</title-group>
<contrib-group>
<contrib contrib-type="author">
<name>
<surname><![CDATA[Castillo-Rojas]]></surname>
<given-names><![CDATA[Wilson]]></given-names>
</name>
<xref ref-type="aff" rid="A01"/>
</contrib>
<contrib contrib-type="author">
<name>
<surname><![CDATA[Medina-Quispe]]></surname>
<given-names><![CDATA[Fernando]]></given-names>
</name>
<xref ref-type="aff" rid="A02"/>
</contrib>
<contrib contrib-type="author">
<name>
<surname><![CDATA[Vega-Damke]]></surname>
<given-names><![CDATA[Juan]]></given-names>
</name>
<xref ref-type="aff" rid="A02"/>
</contrib>
</contrib-group>
<aff id="A01">
<institution><![CDATA[,Universidad de Atacama Facultad de Ingeniería ]]></institution>
<addr-line><![CDATA[Copiapó ]]></addr-line>
<country>Chile</country>
</aff>
<aff id="A02">
<institution><![CDATA[,Universidad Arturo Prat Facultad de Ingeniería y Arquitectura ]]></institution>
<addr-line><![CDATA[Iquique ]]></addr-line>
<country>Chile</country>
</aff>
<pub-date pub-type="pub">
<day>00</day>
<month>03</month>
<year>2017</year>
</pub-date>
<pub-date pub-type="epub">
<day>00</day>
<month>03</month>
<year>2017</year>
</pub-date>
<numero>21</numero>
<fpage>67</fpage>
<lpage>80</lpage>
<copyright-statement/>
<copyright-year/>
<self-uri xlink:href="http://scielo.pt/scielo.php?script=sci_arttext&amp;pid=S1646-98952017000100006&amp;lng=en&amp;nrm=iso"></self-uri><self-uri xlink:href="http://scielo.pt/scielo.php?script=sci_abstract&amp;pid=S1646-98952017000100006&amp;lng=en&amp;nrm=iso"></self-uri><self-uri xlink:href="http://scielo.pt/scielo.php?script=sci_pdf&amp;pid=S1646-98952017000100006&amp;lng=en&amp;nrm=iso"></self-uri><abstract abstract-type="short" xml:lang="es"><p><![CDATA[El artículo propone el diseño e implementación de un esquema de visualización para modelos de clústeres, en el contexto de un proceso de minería de datos. En general, un buen modelo de clústeres no es difícil de interpretar, pero se torna compleja su representación visual cuando el conjunto de datos es de alto volumen, densidad y dimensionalidad. En este tipo de caso, es necesario contar con un apropiado esquema de visualización. El esquema visual que se propone en este trabajo se denomina VIMC, y se basa en cuatro características: visualización interactiva, combinación de técnicas de minería de datos, artefactos gráficos ad-hoc, y uso de métricas. Las métricas consideradas permiten comparar componentes de distintos clústeres, lo que a su vez ayuda a entender la composición de los grupos. A través de la implementación de un entorno visual web, y una evaluación de 23 usuarios, se logran resultados positivos sobre la utilidad de este esquema de visualización.]]></p></abstract>
<abstract abstract-type="short" xml:lang="en"><p><![CDATA[The article proposes the design and implementation of a visualization scheme for cluster models, in the context of a data-mining process. In general, a good cluster model is not difficult to interpret, but its visual representation becomes complex when the data set is of high volume, density and dimensionality. In this type of case, it's necessary to have an appropriate visualization scheme. The visual schema proposed in this work is called VIMC, and is based on four characteristics: interactive visualization, data-mining techniques combination, ad-hoc graphic artifacts, and use of metrics. The considered metrics allow to compare components of different clusters, which in turn helps to understand the composition of the groups. Through the implementation of a visual web environment, and an evaluation of 23 users, positive results are achieved on the utility of this visualization scheme.]]></p></abstract>
<kwd-group>
<kwd lng="es"><![CDATA[Visualización de clústeres]]></kwd>
<kwd lng="es"><![CDATA[visualización de modelos para minería de datos]]></kwd>
<kwd lng="es"><![CDATA[visualización de minería de datos]]></kwd>
<kwd lng="es"><![CDATA[visualización interactiva de modelos]]></kwd>
<kwd lng="es"><![CDATA[esquemas de visualización de datos]]></kwd>
<kwd lng="en"><![CDATA[Cluster Visualization]]></kwd>
<kwd lng="en"><![CDATA[model visualization for data mining]]></kwd>
<kwd lng="en"><![CDATA[data mining visualization]]></kwd>
<kwd lng="en"><![CDATA[interactive visualization of models]]></kwd>
<kwd lng="en"><![CDATA[data visualization schemes]]></kwd>
</kwd-group>
</article-meta>
</front><body><![CDATA[ <p align="right"><font size="2"><b>ART&#205;CULOS</b></font></p>     <p><font size="4"><b>Esquema de Visualizaci&#243;n para Modelos de Cl&#250;steres en Miner&#237;a de Datos</b></font></p>     <p><font size="3"><b>New Visualization Scheme for Cluster Models in Data Mining</b></font></p>     <p><b>Wilson Castillo-Rojas <sup>1</sup>, Fernando Medina-Quispe <sup>2</sup>, Juan Vega-Damke <sup>2</sup></b></p>     <p><sup>1</sup> Universidad de Atacama, Facultad de Ingenier&#237;a / DIICC, 1530000, Copiap&#243;, Chile. <a href="mailto:wilson.castillo@uda.cl">wilson.castillo@uda.cl</a></p>     <p><sup>2</sup> Universidad Arturo Prat, Facultad de Ingenier&#237;a y Arquitectura, 1100000, Iquique, Chile. <a href="mailto:femedina@gmail.com">femedina@gmail.com</a></p> <hr/>     <p>&nbsp;</p>     <p><b>RESUMEN</B>: El art&#237;culo propone el dise&#241;o e implementaci&#243;n de un esquema de visualizaci&#243;n para modelos de cl&#250;steres, en el contexto de un proceso de miner&#237;a de datos. En general, un buen modelo de cl&#250;steres no es dif&#237;cil de interpretar, pero se torna compleja su representaci&#243;n visual cuando el conjunto de datos es de alto volumen, densidad y dimensionalidad. En este tipo de caso, es necesario contar con un apropiado esquema de visualizaci&#243;n.&#160; El esquema visual que se propone en este trabajo se denomina VIMC, y se basa en cuatro caracter&#237;sticas: visualizaci&#243;n interactiva, combinaci&#243;n de t&#233;cnicas de miner&#237;a de datos, artefactos gr&#225;ficos ad-hoc, y uso de m&#233;tricas. Las m&#233;tricas consideradas permiten comparar componentes de distintos cl&#250;steres, lo que a su vez ayuda a entender la composici&#243;n de los grupos. A trav&#233;s de la implementaci&#243;n de un entorno visual web, y una evaluaci&#243;n de 23 usuarios, se logran resultados positivos sobre la utilidad de este esquema de visualizaci&#243;n.</p>     <p><b>Palabras-clave</b>: Visualizaci&#243;n de cl&#250;steres, visualizaci&#243;n de modelos para miner&#237;a de datos, visualizaci&#243;n de miner&#237;a de datos, visualizaci&#243;n interactiva de modelos, esquemas de visualizaci&#243;n de datos.</p>     <p>&nbsp;</p> <hr/>     ]]></body>
<body><![CDATA[<p>&nbsp;</p>     <p><b>ABSTRACT:</b> The article proposes the design and implementation of a visualization scheme for cluster models, in the context of a data-mining process. In general, a good cluster model is not difficult to interpret, but its visual representation becomes complex when the data set is of high volume, density and dimensionality. In this type of case, it&#8217;s necessary to have an appropriate visualization scheme. The visual schema proposed in this work is called VIMC, and is based on four characteristics: interactive visualization, data-mining techniques combination, ad-hoc graphic artifacts, and use of metrics. The considered metrics allow to compare components of different clusters, which in turn helps to understand the composition of the groups. Through the implementation of a visual web environment, and an evaluation of 23 users, positive results are achieved on the utility of this visualization scheme.</p>     <p><b>Keywords</b>: Cluster Visualization, model visualization for data mining, data mining visualization, interactive visualization of models, data visualization schemes.</p> <hr/>     <p>&nbsp;</p>     <p>1. Introducci&#243;n</p>     <p>La comprensi&#243;n e interpretaci&#243;n apropiada de los resultados de un modelo es el mayor problema o desaf&#237;o en un proceso de Miner&#237;a de Datos (MD). Algunas investigaciones sostienen que una de las formas de apoyar esta problem&#225;tica es utilizando visualizaci&#243;n en la etapa de construcci&#243;n del modelo, y no solamente en el an&#225;lisis exploratorio de los datos (entrada), y los patrones o reglas obtenidas en un proceso de MD (salida) (Meneses &amp; Grinstein, 2001; Faria et al., 2015). </p>     <p>Lo anterior, afirma que al conocer el funcionamiento interno de un modelo permite, por un lado, comprender como funciona, y por otro lado interpretar mejor sus resultados. En particular, visualizaci&#243;n de modelos de cl&#250;steres no es dif&#237;cil de interpretar si el n&#250;mero de cl&#250;steres es relativamente manejable y son muy compactos. Sin embargo, cuando el conjunto de datos es de gran volumen, y el n&#250;mero de dimensiones es alto, su representaci&#243;n visual e interpretaci&#243;n se tornan complejos. Por ejemplo, con 3 dimensiones no se pueden observar todos los atributos simult&#225;neamente, m&#225;s en el caso de cl&#250;steres con alta densidad.</p>     <p>Como resultado del an&#225;lisis comparativo de trabajos relacionados, y la evaluaci&#243;n de herramientas de MD existentes, se pudo constatar la dificultad que presenta la visualizaci&#243;n de modelos de cl&#250;steres. Tambi&#233;n se confirma en esta revisi&#243;n, que existen diversas m&#233;tricas para comparar cl&#250;steres, y que la mayor&#237;a de las herramientas utilizan solamente el c&#225;lculo de distancia, y muy pocas, implementan comparaci&#243;n de componentes. Adem&#225;s, en ninguno de los trabajos y herramientas analizados utilizan combinaci&#243;n de t&#233;cnicas de MD, y que proporcionan un bajo nivel de interacci&#243;n, lo cual no permite explorar en profundidad un modelo.</p>     <p>En este contexto, este trabajo de investigaci&#243;n aborda el problema de la complejidad para visualizar modelos de cl&#250;steres con conjuntos de datos que re&#250;nen las caracter&#237;sticas antes mencionadas. Para esto, considera elementos en el dise&#241;o y desarrollo de un esquema de visualizaci&#243;n, que permitan recorrer y explorar un modelo de cl&#250;steres, y mecanismos de interacci&#243;n apropiados para lograr adentrarse en las componentes o instancias de cada cl&#250;ster.</p>     <p>Una caracter&#237;stica importante que se considera en este esquema visual, es la combinaci&#243;n de la t&#233;cnica de cl&#250;steres con una t&#233;cnica de MD del tipo descriptiva, que provea una vista complementaria de cada cl&#250;ster, y de modo que permita establecer relaciones entre los atributos del conjunto de instancias agrupadas en cada uno. Tambi&#233;n, plantea necesario disponer de gr&#225;ficos ad-hoc para representar visualmente cl&#250;steres, particularmente en conjuntos de datos con alto volumen, densidad y dimensionalidad. Otra caracter&#237;stica fundamental es disponer de m&#233;tricas que permitan comparar cuantitativamente instancias o componentes de un mismo cl&#250;ster y entre distintos cl&#250;steres, y tambi&#233;n medir el nivel de compacidad o dispersi&#243;n de cada conglomerado.</p>     ]]></body>
<body><![CDATA[<p>El art&#237;culo describe la propuesta de un esquema de visualizaci&#243;n para modelos de cl&#250;steres denominado VIMC. Se presenta su dise&#241;o conceptual y aspectos t&#233;cnicos, adem&#225;s de la implementaci&#243;n de un entorno visual web, que proporciona las caracter&#237;sticas principales de este esquema VIMC, estos son: visualizaci&#243;n interactiva, combinaci&#243;n de t&#233;cnicas de MD, gr&#225;ficas vinculadas, m&#233;tricas para comparar cl&#250;steres e instancias de los cl&#250;steres. Finalmente, se discute el resultado de una evaluaci&#243;n subjetiva obtenida a trav&#233;s de una encuesta en l&#237;nea con 23 usuarios, todos con experiencia en procesos de MD. </p>     <p>2.&#160;Visualizaci&#243;n en MD</p>     <p>El proceso de MD busca obtener a partir de un conjunto de datos, modelos de datos para describirlos o predecir nuevas instancias. Este proceso involucra etapas de: preparaci&#243;n de datos (entrada), generaci&#243;n del modelo (proceso), y la interpretaci&#243;n de patrones resultantes (salida). Esta salida debe significar un nuevo conocimiento en la organizaci&#243;n, &#250;til y comprensible para los usuarios finales, y que se puede integrar a los procesos para apoyar la toma de decisiones (Witten &amp; Frank, 2005). Sin embargo, la dificultad est&#225; en identificar modelos en los datos, lo cual es una tarea compleja y, a menudo requiere experiencia, no s&#243;lo del analista de datos, sino tambi&#233;n del experto en el dominio del problema.</p>     <p>El uso de capacidades de percepci&#243;n visual humana, que puede detectar patrones f&#225;cilmente, puede ser &#250;til para apoyar el an&#225;lisis de modelos de MD. Bajo este enfoque, visualizaci&#243;n en MD ha sido utilizada mayormente en el an&#225;lisis exploratorio de datos (entrada), y presentaci&#243;n de los patrones (salida), dejando limitado este paradigma para el an&#225;lisis de modelos (Meneses &amp; Grinstein, 2001).</p>     <p>Un factor clave en MD, para mejorar la capacidad predictiva o descriptiva de un modelo, es entender c&#243;mo el modelo inducido est&#225; trabajando. Entre otros aspectos, por ejemplo; es importante entender c&#243;mo el modelo realiza una distribuci&#243;n del conjunto de datos de acuerdo a diferentes atributos, c&#243;mo las componentes del modelo est&#225;n correlacionadas con un subconjunto de observaciones, y c&#243;mo el valor de los atributos es particionado por el modelo. </p>     <p>Algunas t&#233;cnicas de aprendizaje autom&#225;tico funcionan como sistemas cerrados, y es dif&#237;cil lograr una interpretaci&#243;n de los patrones obtenidos, y responder preguntas del usuario acerca de la transformaci&#243;n que realiza el modelo.&#160; Un ejemplo son las redes neuronales artificiales, que convergen a un conjunto de pesos num&#233;ricos que no tienen una interpretaci&#243;n directa en el dominio del problema.</p>     <p>Las t&#233;cnicas como &#225;rboles de decisi&#243;n son f&#225;cilmente comprensibles cuando el modelo es peque&#241;o, &#225;rboles de mayor tama&#241;o (m&#225;s de 3 niveles) su interpretaci&#243;n es compleja. Lo mismo ocurre para un modelo de cl&#250;steres, ya que con datos de gran volumen y alta dimensionalidad, no es simple visualizar todos los atributos. Otras t&#233;cnicas de aprendizaje como reglas de asociaci&#243;n, tambi&#233;n el tama&#241;o del modelo presenta problemas (largas listas de reglas), y requiere el desarrollo de nuevas representaciones gr&#225;ficas, que proporcionen una mejor visualizaci&#243;n e interacci&#243;n con el modelo, para facilitar su interpretaci&#243;n. Se considera que la integraci&#243;n de visualizaci&#243;n en el proceso de MD puede ser de importancia significativa, ya que puede ayudar de dos maneras:</p>     <p>&#160;i. Proporcionar comprensi&#243;n visual de complejas aproximaciones computacionales y;</p>     <p>ii. Descubrir relaciones complejas entre los datos que no son detectables por los m&#233;todos autom&#225;ticos de an&#225;lisis, pero que si pueden ser captados por el sistema visual humano. </p>     <p>De lo anterior, se deduce que la iteraci&#243;n alternada entre visualizaci&#243;n y MD autom&#225;tica provee al analista de datos, soporte en la tarea de reconocimiento de patrones. Incluyendo al ser humano en este proceso, se logra una buena combinaci&#243;n de su percepci&#243;n visual, con el poder de c&#225;lculo y almacenamiento del computador (Meneses &amp; Grinstein, 2001). Hoy en d&#237;a, existen pocas herramientas que incorporan visualizaci&#243;n de modelos. Y las que existen son muy limitadas en su capacidad de exploraci&#243;n, y en responder preguntas acerca de las transformaciones, que realiza el modelo en los datos, para generar patrones (Keim &amp; otros, 2010), (Castillo &amp; Meneses, 2012).</p>     ]]></body>
<body><![CDATA[<p>3.&#160;Visualizaci&#243;n para Modelos Cl&#250;steres</p>     <p>El an&#225;lisis de cl&#250;ster o clustering, es una tarea de MD que tiene por objeto identificar y describir grupos en un conjunto de datos, de tal manera que elementos asignados a un mismo grupo sean similares entre s&#237;, mientras que elementos pertenecientes a grupos distintos sean dis&#237;miles (Yue, 2016). La medida de distancia es la m&#225;s utilizada para realizar comparaciones entre atributos de las instancias. El proceso de clustering es utilizado para generar levantamiento de perfiles, y seg&#250;n el contexto de aplicaci&#243;n permite identificar grupos de: clientes, trabajadores, pacientes de hospitales, etc. (Maimon &amp; Rokach, 2010).</p>     <p>Existen varios m&#233;todos para generar los agrupamientos, y cada uno utiliza un principio de inducci&#243;n diferente. Por ejemplo, Fraley y Raftery proponen 2 tipos de m&#233;todos de clustering: jer&#225;rquicos y de particiones (Fraley &amp; Raftery, 2007). Han y Kamber proponen, 3 tipos de clustering basados en: densidad, modelos y rejillas (Han &amp; Kamber, 2006).</p>     <p>Se pueden encontrar diversos tipos de visualizaciones para modelos de cl&#250;steres:</p>     <p>&#183; Coordenadas Paralelas: este diagrama se compone de un eje horizontal y varios ejes verticales. Cada eje vertical representa a una variable, cuyos valores son representados a lo largo de su eje horizontal. Para variables num&#233;ricas, los valores se ordenan de menor a mayor. Cada l&#237;nea poligonal de este diagrama corresponde a una instancia o fila del conjunto de datos, y se mueve entre los ejes verticales dependiendo de los valores que le corresponde en cada variable. Este gr&#225;fico acompa&#241;ado con elementos de interacci&#243;n como transparencia y filtros, provee una visualizaci&#243;n potente para objetos con muchas dimensiones.</p>     <p>&#183; Gr&#225;fico de Dispersi&#243;n: permite observar la relaci&#243;n que existe entre dos variables num&#233;ricas, y corresponde al tipo de gr&#225;fica m&#225;s utilizada para modelos de clustering. Cada punto corresponde a los valores en las coordenadas <i>(x, y)</i>. A cada grupo se le asigna un color y sus instancias tambi&#233;n toman ese color, de esta forma es f&#225;cil identificar a que grupo pertenecen. Las instancias del conjunto de datos son graficadas con un m&#225;ximo de 3 dimensiones.</p>     <p>&#183; Matriz de Diagramas de Dispersi&#243;n: es una generalizaci&#243;n de un diagrama de dispersi&#243;n que permite observar de manera simult&#225;nea, el comportamiento de variables num&#233;ricas en varias dimensiones. Es una herramienta de exploraci&#243;n de datos, que permite comparar un conjunto de instancias con respecto a todos sus atributos. Este gr&#225;fico muestra todas las combinaciones de gr&#225;ficos de dispersi&#243;n entre dos variables, en una sola vista bajo una estructura matricial. Para <i>n</i> dimensiones se muestran <i>n</i> filas y columnas.</p>     <p>&#183; Dendrograma: es la forma m&#225;s simple en la cual una estructura jer&#225;rquica de datos puede ser representada, y corresponde a un gr&#225;fico con forma de &#225;rbol (dendro; significa &#225;rbol). Los &#237;tems de datos son representados por las hojas en el nivel final de la estructura del &#225;rbol, mientras que los nodos en el nivel m&#225;s alto, son los que representan a los grupos o cl&#250;steres de los &#237;tems de datos, con diversos niveles de semejanza (Jain &amp; otros, 1999). La manera cl&#225;sica de representar el dendrograma es dibujarlo como &#225;rbol enraizado, con la ra&#237;z anclada centralmente en el tope de la imagen, y las ramas de los nodos-hijos hacia abajo utilizando l&#237;neas derechas o diagonales.</p>     <p>&#183; RadViz: es una t&#233;cnica de visualizaci&#243;n de coordenadas radiales. Muestra todos los atributos como puntos anclados al per&#237;metro de una circunferencia, y separados en forma equidistante dependiendo de la cantidad de atributos. Dentro del c&#237;rculo, se muestran las instancias en forma de puntos, los cuales est&#225;n dispuestos en el gr&#225;fico. Toma como base al paradigma del tensor proveniente de la f&#237;sica de part&#237;culas, puntos de la misma clase se atraen entre s&#237;, los de diferente clase se repelen, y las fuerzas resultantes se ejercen sobre los puntos de anclaje. Una ventaja de RadViz es que conserva simetr&#237;as de los datos, y su desventaja es la superposici&#243;n de puntos (Hoffman &amp; Grinstein, 2002).</p>     <p>&#183; Diagrama de Voron&#243;i: aplicable a t&#233;cnicas que generan centroides, y consiste en una partici&#243;n del espacio euclidiano. Para cada par de centroides, se crean bisectrices perpendiculares, las cuales generan segmentos paralelos entre ellos. Este tipo de visualizaci&#243;n para cl&#250;ster genera pol&#237;gonos para cada grupo, donde las instancias se distribuyen en su interior.</p>     ]]></body>
<body><![CDATA[<p>&#183; Densidad de Grupos: corresponde a una visualizaci&#243;n donde se pueden observar las densidades de cada grupo. Se muestra la regi&#243;n que cubre cada cl&#250;ster, y se puede realizar an&#225;lisis de las instancias.</p>     <p>&#183; Gr&#225;fico de Radar: en este gr&#225;fico cada instancia es graficada como un pol&#237;gono en un espacio radial, y sus aristas son generadas en relaci&#243;n a la magnitud de sus dimensiones, las instancias pertenecientes a mismos grupos presentan los mismos colores. Las figuras geom&#233;tricas que presenten similitudes en su estructura corresponden a objetos similares.</p>     <p>4.&#160;Revisi&#243;n de Trabajos Relacionados</p>     <p>El primer trabajo analizado corresponde a una soluci&#243;n de visualizaci&#243;n para modelos de cl&#250;steres jer&#225;rquicos, propuesta por Long, cuya hip&#243;tesis principal es que existen dos grandes problemas para visualizarlos (Long, 2011): </p>     <p>La gran cantidad de datos limita la visualizaci&#243;n de un modelo de cl&#250;steres, ya que el espacio en pantalla no permite observar todas las instancias.</p>     <p>Cuando el n&#250;mero de dimensiones es mayor a 3, no se pueden visualizar todos los atributos simult&#225;neamente.</p>     <p>Esta propuesta de soluci&#243;n consiste en dos pasos: clustering y visualizaci&#243;n. Con esto ayuda a los analistas de datos, a entender la distribuci&#243;n de un conjunto de datos con alta dimensionalidad. En el primer paso, se utilizan t&#233;cnicas de algoritmos jer&#225;rquicos para generar cl&#250;steres. En el segundo paso, se proporcionan dos m&#233;todos para visualizar los resultados. El primer m&#233;todo de visualizaci&#243;n utiliza un gr&#225;fico optimizado de estrellas, que minimiza el solapamiento. En el segundo m&#233;todo de visualizaci&#243;n, se combinan las t&#233;cnicas de; coordenadas paralelas, disposici&#243;n radial para estructuras jer&#225;rquicas, y coordenadas paralelas circulares. &#160;La <a href="#f1">Figura 1</a>, muestra la utilizaci&#243;n de coordenadas paralelas enlazadas con visualizaci&#243;n radial de &#225;rboles jer&#225;rquicos. El diagrama de coordenadas paralelas ubicados en la parte derecha, es desplegado interactivamente con la selecci&#243;n de cl&#250;steres del lado izquierdo. </p>     <p>&nbsp;</p>     <p align="center"><a name="f1"></a><img src="/img/revistas/rist/n21/21a06f1.jpg"/></p>     
<p>&nbsp;</p>     ]]></body>
<body><![CDATA[<p>En el ejemplo de la <a href="#f1">Figura 1</a>, se muestran las coordenadas paralelas correspondientes a los nodos <i>a</i>, <i>b</i> y <i>c</i> seleccionados previamente en el gr&#225;fico jer&#225;rquico, estos representan la concentraci&#243;n de minerales. Se puede observar en el diagrama de coordenadas paralelas, que los nodos <i>a</i> (verde) y <i>b</i> (amarillo) presentan una mayor cantidad de magnesio que el nodo <i>c</i>, y el nodo <i>a</i> presenta una mayor cantidad de uranio con respecto a los otros dos nodos seleccionados. A trav&#233;s de la selecci&#243;n de instancias es posible realizar comparaciones de componentes del modelo generado.</p>     <p>Un segundo trabajo relacionado plantea un entorno visual interactivo para modelos de clustering, en un contexto de an&#225;lisis de documentos de textos, y que genera grupos con base en la frecuencia de las palabras. La <a href="#f2">Figura 2</a>, muestra la interfaz principal de este entorno visual, en la cual existen diversos elementos para el an&#225;lisis de cl&#250;ster: coordenadas paralelas, vistas de relaci&#243;n para cl&#250;steres, vistas de &#225;rboles, entre otros. Este esquema visual provee diversos mecanismos de interacci&#243;n para refinar resultados de un proceso de clustering. Tambi&#233;n permite filtraci&#243;n de datos fuera de rango y re-agrupamiento de datos (Lee &amp; otros, 2012).</p>     <p>&nbsp;</p>     <p align="center"><a name="f2"></a><img src="/img/revistas/rist/n21/21a06f2.jpg"/></p>     
<p>&nbsp;</p>     <p>Se puede ver en el ejemplo de esta <a href="#f2">Figura 2</a>, en la secci&#243;n principal del entorno, que existen 454 documentos que son segmentados en 6 grupos. Esta secci&#243;n principal denominada <i>A</i>, est&#225; acompa&#241;ada con otras 6 secciones que aportan vistas complementarias y vinculadas al modelo, etiquetadas con las letras <i>B</i> hasta la <i>G</i>. En la secci&#243;n <i>A</i> se ve c&#243;mo se relacionan los documentos de cada cl&#250;ster, el cl&#250;ster rojo se relaciona con el cl&#250;ster verde, naranja y azul. En la secci&#243;n <i>B</i> se tiene una vista de &#225;rbol de cl&#250;steres, en donde se mantiene la estructura jer&#225;rquica con t&#243;picos definidos por el usuario. En la secci&#243;n <i>C</i> se ven las palabras que m&#225;s se repiten en los documentos, y en la secci&#243;n <i>D</i> las coordenadas paralelas vinculadas entre los cl&#250;steres. La secci&#243;n <i>E</i> corresponde a una vista donde se muestra el peso de cada palabra. La secci&#243;n <i>F </i>presenta una vista de trazado de documentos con un gr&#225;fico mapa de calor, que muestra los cambios de miembros que han ocurrido entre cl&#250;steres.&#160; Finalmente, en la secci&#243;n <i>G</i> se pueden seleccionar documentos interactivamente y se despliega el texto con las palabras marcadas.</p>     <p>El tercer trabajo revisado tiene relaci&#243;n con m&#233;tricas que se utilizan para la comparaci&#243;n de instancias de cl&#250;steres. En este aspecto, Grabusts presenta un trabajo donde realiza un an&#225;lisis de los resultados obtenidos por el algoritmo K-medias, con un conjunto de datos determinado. Para la generaci&#243;n de los cl&#250;steres, utiliza las m&#233;tricas: distancia Euclidiana, distancia de Manhattan y coeficiente correlaci&#243;n de Pearson. Se concluye en este estudio, que los resultados obtenidos son muy similares con cada m&#233;trica utilizada, y que la correlaci&#243;n de Pearson, le entrega mejores valores para todos los cl&#250;steres (Grabusts, 2011). </p>     <p>En cuanto a la evaluaci&#243;n de modelos de clustering, en la literatura existen diversos criterios, que se dividen en internos y externos, para la evaluaci&#243;n de cl&#250;steres. No obstante, s&#243;lo algunos de estos son aplicados, entre los cuales destacan: la suma del error cuadr&#225;tico (SSE), el &#237;ndice de Dunn, y el &#237;ndice de Davies-Bouldin (Maimon &amp; Rokach, 2010). El an&#225;lisis de cl&#250;ster es considerado como un proceso de aprendizaje no supervisado, es decir el resultado no puede ser comparado con un valor conocido previamente. Por lo tanto, las matrices de confusi&#243;n y las m&#233;tricas de precisi&#243;n utilizadas en tareas predictivas, no son aplicables para estos casos. </p>     <p>Los criterios de evaluaci&#243;n internos miden la compacidad de los cl&#250;steres a trav&#233;s de alguna medida de similitud, y por lo general miden la homogeneidad y separabilidad dentro de los cl&#250;steres, para esto consideran las distancias: intra-cl&#250;ster e inter-cl&#250;ster. Esto permite comparar cuantitativamente instancias de distintos cl&#250;steres, y medir el nivel de homogeneidad de los cl&#250;steres, lo cual permite conocer la conformaci&#243;n de los grupos generados por el proceso de clustering. En cuanto a los criterios de evaluaci&#243;n externos, pueden ser &#250;tiles para examinar si la estructura de los cl&#250;steres coincide con alguna clasificaci&#243;n previa. En estos casos se realiza una clasificaci&#243;n previa del conjunto de datos y posteriormente se comparan los resultados. Por ejemplo, para una secuencia de datos temporales con alta dimensionalidad, se puede aplicar el an&#225;lisis de componentes independientes para la extracci&#243;n de sus caracter&#237;sticas (Zhu, 2015).</p>     <p>Por otro lado, tambi&#233;n se revisaron 5 herramientas de MD entre las m&#225;s utilizadas hoy en d&#237;a, en relaci&#243;n a la representaci&#243;n visual que ofrecen sobre modelos de cl&#250;steres, y particularmente: el nivel y calidad de visualizaci&#243;n, si provee m&#233;tricas, y el nivel de interacci&#243;n en tres tipos de gr&#225;ficos seleccionados. Se califica el nivel de visualizaci&#243;n, considerando la cantidad de elementos visuales que la herramienta tiene. Si es menor a 2, su calificaci&#243;n es baja, si es igual a 2 se califica regular, y mayor a 2 es buena. Para medir el nivel de interacci&#243;n en los gr&#225;ficos, se tiene en cuenta el n&#250;mero de interacciones disponibles, por cada elemento visual: menor a 3 es bajo, entre 3 y 4 regular, y mayor a 4 es alto.</p>     ]]></body>
<body><![CDATA[<p>Se puede observar desde la <a href="#t1">Tabla 1</a>, que R es la herramienta m&#225;s completa, aunque no dispone del gr&#225;fico radar, y que junto a Weka son las &#250;nicas que proporcionan m&#233;tricas para el an&#225;lisis de cl&#250;steres. No obstante, R es un entorno de programaci&#243;n que maneja la generaci&#243;n de modelos y visualizaci&#243;n, a trav&#233;s de c&#243;digo con la librer&#237;a llamada Ggobi (Dianne &amp; Deborah, 2007). </p>     <p>&nbsp;</p>     <p align="center"><a name="t1"></a><img src="/img/revistas/rist/n21/21a06t1.jpg"/></p>     
<p>&nbsp;</p>     <p>Finalmente, en esta revisi&#243;n de trabajos relacionados, tambi&#233;n se analizan dos enfoques que sirven como referencia para establecer las bases del dise&#241;o de la propuesta de este trabajo de investigaci&#243;n. </p>     <p>Por un lado, est&#225; el campo de Anal&#237;tica Visual descrita por Keim y otros, que se centra en el proceso de an&#225;lisis y manejo de grandes vol&#250;menes de datos (heterog&#233;neos y din&#225;micos), mediante integraci&#243;n del juicio humano sobre representaciones visuales, y mecanismos de interacci&#243;n. Combina &#225;reas de: visualizaci&#243;n, MD, y estad&#237;stica. En este enfoque, visualizaci&#243;n es una etapa central del proceso, que se orienta no s&#243;lo a la descripci&#243;n visual de datos (entradas), sino que es fundamental para la construcci&#243;n del modelo (proceso), y para representar el conocimiento obtenido a trav&#233;s de patrones (salida) (Keim &amp; otros, 2010).</p>     <p>El segundo enfoque tomado como referencia, es el esquema de Visualizaci&#243;n Aumentada para Modelos (VAM) en un proceso de MD, propuesto por Castillo y otros. Este esquema considera como ejes centrales: visualizaci&#243;n de modelos para su an&#225;lisis exploratorio, modelos de percepci&#243;n visual, mecanismos de interacci&#243;n, combinaci&#243;n de t&#233;cnicas de MD, y m&#233;tricas para comparar componentes del modelo. Presenta un modelo de percepci&#243;n visual e interacci&#243;n del usuario, centrado en la etapa de construcci&#243;n y ajuste del modelo en un proceso de MD, y establece una forma de explorar el modelo original y sus componentes, considerando las caracter&#237;sticas o ejes indicados recientemente (Castillo &amp; Otros, 2015).</p>     <p>5.&#160;Dise&#241;o del Esquema VIMC</p>     <p>El esquema propuesto en este trabajo se denomina Visualizaci&#243;n Interactiva para Modelos de Cl&#250;steres (VIMC), que permite al analista de datos explorar y analizar visualmente un modelo de cl&#250;steres, en la etapa de construcci&#243;n y ajuste. Est&#225; orientado principalmente a tratar conjuntos de datos de alto volumen y alta dimensionalidad, y su arquitectura de dise&#241;o se puede observar en la <a href="#f3">Figura 3</a>. Este esquema, como se se&#241;ala al final de la secci&#243;n anterior, tiene como base dos enfoques: anal&#237;tica visual (Keim &amp; otros, 2010), y visualizaci&#243;n aumentada de modelos (Castillo &amp; Otros, 2015).</p>     <p>&nbsp;</p>     ]]></body>
<body><![CDATA[<p align="center"><a name="f3"></a><img src="/img/revistas/rist/n21/21a06f3.jpg"/></p>     
<p>&nbsp;</p>     <p>Como se puede ver en la <a href="#f3">Figura 3</a>, el esquema VIMC consta de dos estados representados por &#243;valos: Visualizaci&#243;n de Datos, y Visualizaci&#243;n de Cl&#250;steres:</p>     <p>1) Visualizaci&#243;n de Datos; en este primer estado el analista de datos puede interactuar para realizar an&#225;lisis exploratorio sobre los datos, utilizando artefactos gr&#225;ficos y mecanismos de interacci&#243;n apropiados. Para esto, las funcionalidades requeridas son: seleccionar y cargar el conjunto de datos de entrada o vista minable. El conjunto de datos debe ser previamente preparado, ya que el esquema VIMC no considera la preparaci&#243;n preliminar de la vista minable. Esta preparaci&#243;n del conjunto de datos se puede realizar utilizando herramientas de extracci&#243;n, transformaci&#243;n y carga, conocidas como ETL (Extract, Transform, Load).</p>     <p>2) Visualizaci&#243;n de Cl&#250;steres; la transici&#243;n a este segundo estado ocurre cuando el analista de datos solicita la generaci&#243;n del modelo de cl&#250;steres, y para esto debe indicar el n&#250;mero de cl&#250;steres como par&#225;metro. El analista de datos en este estado, puede interactuar directamente con el modelo de cl&#250;steres generado, seleccionando y aplicando los mismos artefactos gr&#225;ficos y mecanismos de interacci&#243;n del primer estado. Adicionalmente, puede aplicar y visualizar m&#233;tricas sobre los cl&#250;steres y sus instancias, as&#237; como tambi&#233;n tiene la opci&#243;n de generar modelos de RA sobre cl&#250;steres seleccionados. Esto &#250;ltimo para obtener una vista complementaria de cada cl&#250;ster.</p>     <p>Para dar soporte a estos dos estados, para el dise&#241;o de la arquitectura del esquema visual VIMC se consideran 4 elementos fundamentales, los primeros dos elementos deben estar disponibles para los dos estados; visualizaci&#243;n de datos y visualizaci&#243;n de cl&#250;steres. Mientras que los dos siguientes elementos, s&#243;lo deben estar disponibles para el segundo estado (visualizaci&#243;n de cl&#250;steres):</p>     <p>&#160;i. Artefactos Gr&#225;ficos: define un conjunto de artefactos gr&#225;ficos vinculados, y apropiados para representar conjuntos de datos y modelos de cl&#250;steres, de gran volumen y alta dimensionalidad. Como resultado del estudio del arte se logran determinar los elementos visuales m&#225;s apropiados, para abordar estas complejidades, estos gr&#225;ficos son: matriz de diagramas de dispersi&#243;n, coordenadas paralelas, gr&#225;fico de radar y circular.</p>     <p>ii. Mecanismos de Interacci&#243;n: establece la necesidad de contar con un conjunto de mecanismos de interacci&#243;n ad-hoc para que el analista de datos, pueda moverse a trav&#233;s del conjunto de datos y el modelo de cl&#250;steres. De este modo, utilizando las diferentes vistas provistas por los artefactos gr&#225;ficos y los mecanismos de interacci&#243;n, el analista debe tener la posibilidad de recorrer y explorar las componentes o instancias, ya sea del conjunto de datos o del modelo de cl&#250;steres. Por ejemplo, seleccionando instancias de distintos cl&#250;steres para compararlas entre s&#237;. Para esto, es necesario definir para cada artefacto gr&#225;fico, los mecanismos de interacci&#243;n o acciones requeridas para apoyar estas labores, y en este caso son los que se indican en la <a href="#t2">Tabla 2</a>:</p>     <p>&nbsp;</p>     <p align="center"><a name="t2"></a><img src="/img/revistas/rist/n21/21a06t2.jpg"/></p>     
]]></body>
<body><![CDATA[<p>&nbsp;</p>     <p>iii. M&#233;tricas: una vez que el analista de datos genera el modelo de cl&#250;steres y pasa al segundo estado, requiere m&#233;tricas para evaluar el modelo y comparar instancias de distintos cl&#250;steres, as&#237; como tambi&#233;n para medir la compacidad o dispersi&#243;n de cada cl&#250;ster. Para esto, se consideran necesarias algunas m&#233;tricas que utilizan criterios de evaluaci&#243;n interna. Se han seleccionado tres medidas: suma del error cuadr&#225;tico medio (SSE), &#237;ndice de Davies-Bouldin (DB-Index), y la distancia Euclidiana. Las dos primeras, se requieren para medir el nivel de compacidad o dispersi&#243;n de los cl&#250;steres, y la tercera para la generaci&#243;n de los cl&#250;steres.</p>     <p>iv. Combinaci&#243;n de Modelo RA: en el segundo estado, el analista de datos puede obtener una vista complementaria de cada cl&#250;ster, aplicando la t&#233;cnica RA sobre un cl&#250;ster seleccionado. Con esto, logra ampliar la descripci&#243;n del modelo de cl&#250;steres, utilizando la capacidad de la t&#233;cnica RA para determinar relaciones existentes entre atributos del conjunto de datos. La raz&#243;n por la cual se ha seleccionada la t&#233;cnica RA, radica en que se trata de una t&#233;cnica descriptiva, que a trav&#233;s de reglas permite tener una mirada adicional de la conformaci&#243;n de los cl&#250;steres. </p>     <p>6.&#160;&#160;&#160;&#160; Implementaci&#243;n del Esquema VIMC</p>     <p>El esquema VIMC se implementa a trav&#233;s de un entorno visual web bajo una arquitectura cliente-servidor. El lado del cliente, se encarga de generar las visualizaciones e interacciones, y es en el servidor, donde se ejecutan los algoritmos de clustering y RA, y tambi&#233;n se calculan las m&#233;tricas. Se utiliza para la generaci&#243;n de los cl&#250;steres el algoritmo &#8220;<i>K-medias</i>&#8221;, y el algoritmo &#8220;<i>A priori</i>&#8221; para generar las RA. El entorno visual est&#225; desarrollado principalmente utilizando JavaScript tanto en el lado del cliente como del servidor. Su motor gr&#225;fico y de interacciones es D3.js. Para calcular las m&#233;tricas y realizar las llamadas a los algoritmos de MD se utiliza Node.js.</p>     <p>En la <a href="#f4">Figura 4</a>, se presenta la interfaz principal del entorno visual, una vez que el usuario ha seleccionado y cargado el conjunto de datos a analizar. Esta parte representa el primer estado del esquema VIMC (visualizaci&#243;n de datos). En este estado, el analista puede llevar a cabo un an&#225;lisis multidimensional de los datos, pudiendo seleccionar m&#250;ltiples instancias para ser comparadas. El diagrama de dispersi&#243;n y las coordenadas paralelas son gr&#225;ficas vinculadas, de modo tal que el usuario al seleccionar una instancia o variable en unos de los gr&#225;ficos, se resalta autom&#225;ticamente en el otro. </p>     <p>&nbsp;</p>     <p align="center"><a name="f4"></a><img src="/img/revistas/rist/n21/21a06f4.jpg"/></p>     
<p>&nbsp;</p>     <p>Adem&#225;s, en estos gr&#225;ficos el usuario puede utilizar los mecanismos de interacci&#243;n descritos para cada uno en la <a href="#t2">Tabla 2</a>. La matriz de dispersi&#243;n se presenta de a un diagrama, el usuario puede seleccionar los atributos que requiere para su an&#225;lisis, a trav&#233;s de las coordenadas <i>(x, y)</i>, los gr&#225;ficos enlazados se actualizan de manera simult&#225;nea en la pantalla. Se puede observar adem&#225;s en esta misma <a href="#f4">Figura</a>, dos instancias seleccionadas en color rojo, que son se&#241;aladas con flechas de color verde en el diagrama de dispersi&#243;n, y simult&#225;neamente son destacadas con l&#237;neas de color azul en el gr&#225;fico de coordenadas paralelas en la parte baja de la interfaz. </p>     ]]></body>
<body><![CDATA[<p>Los valores de los atributos de las instancias seleccionadas, son agregadas al &#225;rea de comparaci&#243;n de la parte izquierda de la interfaz, como se indica tambi&#233;n con una flecha verde, y son visualizadas en el gr&#225;fico de radar ubicado en el v&#233;rtice inferior izquierdo. De esta forma, es posible comparar cuantitativamente dos o m&#225;s instancias, con el objetivo de encontrar diferencias o similitudes en sus caracter&#237;sticas.</p>     <p>Una vez que el usuario hace clic en el bot&#243;n de opci&#243;n para generar el modelo de cl&#250;steres, se pasa al segundo estado en el esquema VIMC (visualizaci&#243;n de cl&#250;steres), y la interfaz es la que se presenta en la <a href="#f5">Figura 5</a>. Se puede apreciar que adem&#225;s de los gr&#225;ficos y mecanismos de interacci&#243;n provistos en el estado 1, el analista dispone de una vista multidimensional del modelo de cl&#250;steres generado, a trav&#233;s de una matriz de diagramas de dispersi&#243;n que puede configurar seg&#250;n los atributos que requiera analizar, el cual tambi&#233;n est&#225; enlazado con el gr&#225;fico coordenadas paralelas. Se colorean autom&#225;ticamente las instancias de cada cl&#250;ster en todas las vistas de los diferentes artefactos gr&#225;ficos. En esta <a href="#f5">Figura</a> aparecen 3 cl&#250;steres: azul para el cl&#250;ster 1, naranja el cl&#250;ster 2 y ver para el cl&#250;ster 3. </p>     <p>&nbsp;</p>     <p align="center"><a name="f5"></a><img src="/img/revistas/rist/n21/21a06f5.jpg"/></p>     
<p>&nbsp;</p>     <p>Tambi&#233;n se puede observar, que aparece una nueva secci&#243;n en el extremo derecho de la interfaz. En esta secci&#243;n aparecen vistas complementarias que son provistas con: gr&#225;fico circular con los cl&#250;steres, la descripci&#243;n de los cl&#250;steres junto al valor de sus m&#233;tricas (SSE y DB-Index) y el gr&#225;fico de radar de cada cl&#250;ster. </p>     <p>Adicionalmente, como se se&#241;ala anteriormente, el usuario puede obtener vistas complementarias del modelo de cl&#250;steres, con la aplicaci&#243;n de una t&#233;cnica de RA sobre cada cl&#250;ster, la cual permite describir relaciones existentes entre atributos de las instancias. La t&#233;cnica RA est&#225; disponible para cualquier conjunto de datos, y el usuario puede proporcionar como par&#225;metro el porcentaje de confianza y cobertura requerido. Esto combinado con el gr&#225;fico de radar del cl&#250;ster, puede complementar el an&#225;lisis exploratorio de las RA, por ejemplo, puede determinar que atributos tienen m&#225;s peso en un cl&#250;ster. Tambi&#233;n, el gr&#225;fico de radar permite comparar los cl&#250;steres en cuanto a su compacidad o dispersi&#243;n, ya sea a nivel de instancias como aparece en el v&#233;rtice inferior izquierdo de la interfaz, como en la secci&#243;n del extremo derecho a nivel de cl&#250;steres.</p>     <p>En resumen, el entorno visual del esquema VIMC incorpora todas las caracter&#237;sticas y elementos definidos en el dise&#241;o de su arquitectura, entregando al usuario herramientas que le permitan analizar con mayor profundidad modelos de cl&#250;steres, en la etapa de construcci&#243;n y ajuste dentro de un proceso de MD. Estas herramientas est&#225;n orientadas, por un lado, a apoyar al an&#225;lisis cualitativo o subjetivo del modelo a trav&#233;s de vistas complementarias y, por otro lado, apoyar el an&#225;lisis cuantitativo u objetivo con el uso de las m&#233;tricas implementadas, tanto para comparar instancias como para comparar cl&#250;steres.</p>     <p>7.&#160;&#160;&#160;&#160; Prueba, Evaluaci&#243;n y Resultados</p>     <p>Para estimar el valor pr&#225;ctico de las caracter&#237;sticas definidas en el esquema VIMC e implementadas en un entorno visual web, se ha llevado a cabo un experimento controlado con usuarios experimentados en procesos de MD, para obtener sus percepciones subjetivas sobre la utilidad del esquema propuesto. Para esto, se ha dise&#241;ado una tarea de MD, que consiste en generar un modelo de cl&#250;steres a partir de un conjunto de datos determinado, para que los usuarios participantes en el experimento utilicen el entorno visual y desarrollen esta tarea. Luego, se ha dise&#241;ado una encuesta en l&#237;nea que recoge las evaluaciones de las distintas caracter&#237;sticas del esquema de visualizaci&#243;n VIMC.</p>     ]]></body>
<body><![CDATA[<p><b>7.1.</b> <b>Descripci&#243;n del Experimento</b></p>     <p>El experimento se realiz&#243; con un universo de 23 personas, los cuales tienen distintos niveles de experiencias en procesos de MD, y en el uso de herramientas de MD. La totalidad de los participantes tienen formaci&#243;n en inform&#225;tica a nivel de pre-grado y postgrado. </p>     <p>La experimentaci&#243;n se ha llevado a cabo en 3 etapas:</p>     <p>En primer lugar, los usuarios deben acceder a la siguiente URL: <a href="http://vimc.inf.unap.cl" target="_blank">http://vimc.inf.unap.cl</a>. En esta direcci&#243;n, ellos encuentran un tutorial con animaci&#243;n que explica el trabajo de investigaci&#243;n, el acceso y uso del entorno visual, y tambi&#233;n la encuesta en l&#237;nea que deben responder, una vez que analicen el modelo de cl&#250;steres presentado.</p>     <p>Primera Etapa &#8211; Tutorial: en esta etapa, se explica el trabajo de investigaci&#243;n, y las caracter&#237;sticas principales del esquema VIMC. Tambi&#233;n, el usuario conoce los aspectos generales del entorno visual.</p>     <p>Segunda Etapa &#8211; Entrenamiento: el usuario trabaja con el entorno visual y un conjunto de datos de entrenamiento, donde puede interactuar libremente generando un modelo de cl&#250;steres, comparar instancias, y aplicar RA en el modelo. El objetivo de esta etapa, es familiarizar al usuario con el entorno visual, y la usabilidad que proporciona para: generar, explorar y analizar un modelo de cl&#250;steres.</p>     <p>Tercera Etapa &#8211; Evaluaci&#243;n: en esta tercera etapa se presenta al usuario, el resultado del proceso de clustering con un segundo conjunto de datos, en el cual se han generado 2 cl&#250;steres. Adem&#225;s, ha sido aplicada la t&#233;cnica RA al primer cl&#250;ster, y dos elementos han sido seleccionados (uno de cada cl&#250;ster). Esta etapa tiene como objetivo, que el usuario debe observar y analizar el modelo de cl&#250;steres presentado, para luego responder una encuesta en l&#237;nea, la cual permite evaluar el esquema VIMC y el entorno visual.</p>     <p>El conjunto de datos utilizado en las etapas 1 y 2, es conocido como Iris, y contiene 150 registros de 3 tipos de flores. En donde los primeros 50 registros son del tipo Setosa, los siguientes 50 registros son Virg&#237;nica, y los &#250;ltimos 50 registros son Versicolor. Cada registro tiene 4 atributos (longitud del p&#233;talo, longitud del s&#233;palo, anchura del p&#233;talo, y anchura del s&#233;palo).&#160; </p>     <p>Para la etapa 3, se utiliz&#243; el conjunto de datos llamado Wine que contiene 1000 registros de vinos con 12 atributos (acidez fija, acidez vol&#225;til, &#225;cido c&#237;trico, az&#250;car residual, cloruros, di&#243;xido de azufre libre, di&#243;xido de azufre total, densidad, pH, sulfatos, y grado de alcohol). No obstante, el entorno visual permite manejar cualquier conjunto de datos, y s&#243;lo se requiere que est&#233; en el formato abierto CSV. </p>     <p>La encuesta dise&#241;ada para la validaci&#243;n del trabajo, consiste en 22 preguntas divididas en 6 secciones: informaci&#243;n del participante, visualizaciones, an&#225;lisis sobre el modelo de cl&#250;steres, an&#225;lisis de RA, comparaci&#243;n de objetos, y sobre el esquema VIMC.</p>     ]]></body>
<body><![CDATA[<p><b>7.2.</b> <b>Discusi&#243;n de Resultados</b></p>     <p>Todos los participantes, de la experimentaci&#243;n, expresan una alta valoraci&#243;n del esquema VIMC y su entorno visual. Respecto a las tres caracter&#237;sticas del esquema propuesto, se puede observar desde el gr&#225;fico de la <a href="#f6">Figura 6</a> a), que la mayor&#237;a ha evaluado a la herramienta como muy buena con un 70%, y buena con un 30%, en relaci&#243;n al nivel de interacciones que proporcionan sus elementos visuales. La combinaci&#243;n de modelos de MD es bien considerada por los usuarios, con un 30% muy buena y 57% buena, y esta misma valoraci&#243;n obtienen las m&#233;tricas que permiten comparar la compacidad y dispersi&#243;n de los cl&#250;steres.</p>     <p>&nbsp;</p>     <p align="center"><a name="f6"></a><img src="/img/revistas/rist/n21/21a06f6.jpg"/></p>     
<p>&nbsp;</p>     <p>En relaci&#243;n al nivel de utilidad de los elementos visuales disponibles, para describir tanto datos como instancias en los cl&#250;steres, se puede observar desde el gr&#225;fico de la <a href="#f6">Figura 6</a> b), que los usuarios entregan la m&#225;s alta valoraci&#243;n para el diagrama de dispersi&#243;n, con un 87% de apreciaci&#243;n positiva (61% muy buena y 26% buena), en segundo lugar, al gr&#225;fico radar, con un 73% (dividida en 43% muy buena y 30% buena). Y, en tercer lugar, las coordenadas paralelas, con un 61% de valoraci&#243;n positiva (9% muy buena y 52% buena), y que, adem&#225;s, obtienen la mayor valoraci&#243;n negativa (26% regular y 13% mala).</p>     <p>Al consultar a los participantes si la generaci&#243;n de un modelo de RA sobre un cl&#250;ster, ayuda a mejorar la comprensi&#243;n de &#233;stos, un 95% afirma que s&#237;, mientras que s&#243;lo un 4% se&#241;ala lo contrario. Cuando se les pregunta; si la comparaci&#243;n de instancias ayuda a comprender de mejor forma como se componen los cl&#250;steres, un 35% responde estar totalmente de acuerdo, un 57% est&#225; de acuerdo, y s&#243;lo un 9% no est&#225; de acuerdo. En cuanto a las m&#233;tricas disponibles, un 30% de los usuarios considera que su utilidad es muy buena, un 57% cree que es buena, s&#243;lo un 13% piensa que es regular, y ninguno piensa que es mala o muy mala.</p>     <p>Una de las tareas del experimento tiene por objetivo, validar el an&#225;lisis visual que consigue el usuario con la herramienta. Y para esto, el usuario debe observar dos cl&#250;steres, y luego determinar cu&#225;l de los dos es m&#225;s disperso. Su respuesta es comparada con la m&#233;trica (SSE), que determina emp&#237;ricamente la dispersi&#243;n de los cl&#250;steres. Se obtiene como resultado que el 91% de los participantes, ha podido responder correctamente que cl&#250;ster tiene mayor dispersi&#243;n, y que corresponde al segundo cl&#250;ster presentado. Esto es corroborado con su valor para SSE de 15.057, frente al primer cl&#250;ster que s&#243;lo tiene un valor para SSE de 10.806.</p>     <p>Finalmente, frente a la pregunta: si el esquema VIMC, apoya la comprensi&#243;n de un modelo de cl&#250;steres; el 48% de los participantes responde estar totalmente de acuerdo, y un 52% est&#225; de acuerdo. Esto significa que la totalidad de los participantes, eval&#250;an positivamente el esquema visual propuesto.</p>     <p>8.&#160;&#160;&#160;&#160; Conclusiones y Trabajo Futuro</p>     ]]></body>
<body><![CDATA[<p>Respecto a las conclusiones obtenidas en este trabajo, destacan las siguientes:</p>     <p>&#183; Los resultados del trabajo de investigaci&#243;n son muy alentadores, ya que la mayor&#237;a de los participantes en el experimento dan una valoraci&#243;n positiva sobre las caracter&#237;sticas del esquema VIMC. </p>     <p>&#183; El entorno visual logra una evaluaci&#243;n positiva en cuanto a: usabilidad, mecanismos de interacci&#243;n, y gr&#225;ficos implementados. Estos &#250;ltimos, permiten un an&#225;lisis exploratorio apropiado del conjunto de datos y del modelo de cl&#250;steres. Destaca la alta valoraci&#243;n de las interacciones implementadas en cada elemento visual, y tambi&#233;n entre los artefactos gr&#225;ficos, el diagrama de dispersi&#243;n es el que obtiene mejor evaluaci&#243;n.</p>     <p>&#183; En cuanto a las m&#233;tricas provistas, si bien sus evaluaciones son buenas no son las que se esperaban, por lo que se considera una oportunidad de mejora para una pr&#243;xima versi&#243;n del entorno visual, principalmente en lo que se relaciona con visualizaci&#243;n de estas m&#233;tricas.</p>     <p>&#183; La combinaci&#243;n de t&#233;cnicas de MD, aunque es valorada positivamente la aplicaci&#243;n de RA sobre cada cl&#250;ster, la idea es mejorar y evaluar su representaci&#243;n visual, de modo que sean m&#225;s entendibles por parte de los usuarios.</p>     <p>&#183; El esquema VIMC a trav&#233;s de su entorno visual, logra el objetivo de apoyar en la comprensi&#243;n de un modelo de cl&#250;steres, en particular con conjunto de datos de alto volumen y alta dimensionalidad. El an&#225;lisis visual del usuario en la experimentaci&#243;n, fue corroborado con m&#233;tricas, y ambas medidas coinciden, por ejemplo, en reconocer si un cl&#250;ster es m&#225;s compacto que otro.</p>     <p>En relaci&#243;n al trabajo futuro, este tiene relaci&#243;n con los siguientes aspectos:</p>     <p>&#183; Seleccionar y aplicar nuevos artefactos gr&#225;ficos, que puedan ser de mayor utilidad en la exploraci&#243;n de los datos, y de los cl&#250;steres, preferentemente para conjunto de datos con alta dimensionalidad.</p>     <p>&#183; Por el momento, VIMC utiliza el algoritmo K-medias con la distancia Euclidiana. Este algoritmo trabaja s&#243;lo con conjuntos de datos num&#233;ricos. Se propone incorporar otros algoritmos de clustering, y con otras medidas de distancia.</p>     <p>&#183; Una mejora interesante, es integrar todos los algoritmos de MD que proporciona Weka. </p>     ]]></body>
<body><![CDATA[<p>&nbsp;</p>     <p><b>REFERENCIAS</b></p>     <p>Castillo, W. &amp; Meneses, C. (2012). A Comparative Review of Schemes of Multidimensional Visualization for Data Mining Techniques. III Congreso Internacional de Computaci&#243;n e Inform&#225;tica del Norte de Chile (INFONOR-CHILE). Arica &#8211; Chile.</p>     <!-- ref --><p>Castillo, W., Meneses, C. &amp; Medina, C. (2015). Augmented visualization for data-mining models. Journal: Elsevier Procedia Computer Science., 55, pp. 650-659. DOI: 10.1016/j.procs.2015.07.063&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=989070&pid=S1646-9895201700010000600002&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --><!-- ref --><p>Dianne, D. &amp; Deborah, F. (2007). Interactive and Dynamic Graphics for Data Analysis: With R and Gobi, ISBN 978-0-387-71762-3.    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=989071&pid=S1646-9895201700010000600003&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --></p>     <!-- ref --><p>Faria, B. M., Gon&#231;alves, J., Reis, L. P., &amp; Rocha, &#193;. (2015). A Clinical Support System Based on Quality of Life Estimation. Journal of Medical Systems, 39(10), 114.    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=989073&pid=S1646-9895201700010000600004&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --></p>     <!-- ref --><p>Fraley, C. &amp; Raftery, A. (2007). Model-based methods of classification: Using the mclust Software in Chemometrics. University of Washington Seattle, United States. DOI: 10.18637/jss.v018.i06.    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=989075&pid=S1646-9895201700010000600005&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --> </p>     ]]></body>
<body><![CDATA[<!-- ref --><p>Grabusts, P. (2011). The choice of metrics for clustering algorithms. Letonia.&#160; ISBN 978-9984-44-071-2.    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=989077&pid=S1646-9895201700010000600006&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --></p>     <!-- ref --><p>Han, J. &amp; Kamber, M. (2006). Data Mining: Concepts and Techniques, 2&#186; ed., Estados Unidos, Elsevier. ISBN: 9781558609013.    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=989079&pid=S1646-9895201700010000600007&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --></p>     <!-- ref --><p>Hoffman, P. &amp; Grinstein, G. (2002). A Survey of Visualizations for High-Dimensional Data Mining, in: Fayyad U., Grinstein G. G., Wierse A. (eds.), Information Visualisation in Data Mining and Knowledge Discovery, Morgan Kaufmann Pub., San Francisco, pp. 47-85.    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=989081&pid=S1646-9895201700010000600008&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --></p>     <!-- ref --><p>Jain, A., Murty, M. &amp; Flynn, P. (1999). Data Clustering: A Review, ACM Computing Surveys, 31(3), pp. 264-323.    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=989083&pid=S1646-9895201700010000600009&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --></p>     <!-- ref --><p>Keim, D., Kohlhammer, J., Geoffrey, E. &amp; Mansmann, F. (2010). Mastering the Information Age Solving Problems with Visual Analytics. Edited by the authors Published by the Eurographics Association Postfach 8043, Printed in Germany,    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=989085&pid=S1646-9895201700010000600010&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --> Druckhaus Thomas M&#252;ntzer GmbH, Bad Langensalza. Theoretical Issues in Ergonomics Science. Vol. 8, N&#186; 1, ISBN 978-3-905673-77-7.</p>     ]]></body>
<body><![CDATA[<!-- ref --><p>Lee, H., Kihm, J., Choo, J., Stasko, J. &amp; Park, H. (2012). iVisClustering: An interactive visual document clustering via topic modeling. In Computer Graphics Forum (Vol. 31, No. 3pt3, pp. 1155-1164). Blackwell Publishing Ltd.    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=989087&pid=S1646-9895201700010000600011&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --> </p>     <!-- ref --><p>Long, T. (2011). Visualizing High-density Clusters in Multidimensional Data. Bremen, Germany. DOI 10.1007/s00180-011-0271-3.    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=989089&pid=S1646-9895201700010000600012&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --></p>     <!-- ref --><p>Maimon, O. &amp; Rokach, L. (2010). Data Mining and Knowledge Discovery Handbook, 2nd ed. Springer Science+Business Media. Edited by Maimon and Rokach, Tel-Aviv University, Israel. ISBN 978-0-387-09822-7.    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=989091&pid=S1646-9895201700010000600013&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --></p>     <p>Meneses, C. &amp; Grinstein, G. (2001). Visualization for Enhancing the Data Mining Process. In Proceedings of the Data Mining and Knowledge Discovery: Theory, Tools, and Technology III Conference. Orlando, FL. </p>     <!-- ref --><p>Witten, I. H. &amp; Frank, E., (2005). Data Mining:&#160; Practical Machine Learning Tools and Techniques, 2nd Edition. Morgan Kaufmann series in data Management Systems. ISBN: 0-12-088407-0.    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=989094&pid=S1646-9895201700010000600015&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --></p>     <p>Yue, W. (2016). Research on the Clustering Analysis Algorithm for Data Mining. Revista Ib&#233;rica de Sistemas y Tecnolog&#237;as de la Informaci&#243;n (RISTI), E6, pp. 209&#8211;221.</p>     ]]></body>
<body><![CDATA[<p>Zhu, Z. (2015). A Clustering Method for High-dimensional Data Analysis in Stock Market. Revista Ib&#233;rica de Sistemas y Tecnolog&#237;as de la Informaci&#243;n (RISTI), 17A, pp. 209&#8211;221.</p>     <p>&nbsp;</p>     <p>Recebido/Submission: 24/03/2016</p>     <p>Aceita&#231;&#227;o/Acceptance: 27/04/2016</p>      ]]></body><back>
<ref-list>
<ref id="B1">
<nlm-citation citation-type="">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Castillo]]></surname>
<given-names><![CDATA[W.]]></given-names>
</name>
<name>
<surname><![CDATA[Meneses]]></surname>
<given-names><![CDATA[C.]]></given-names>
</name>
</person-group>
<article-title xml:lang="en"><![CDATA[A Comparative Review of Schemes of Multidimensional Visualization for Data Mining Techniques]]></article-title>
<source><![CDATA[]]></source>
<year></year>
<publisher-loc><![CDATA[Arica ]]></publisher-loc>
</nlm-citation>
</ref>
<ref id="B2">
<nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Castillo]]></surname>
<given-names><![CDATA[W.]]></given-names>
</name>
<name>
<surname><![CDATA[Meneses]]></surname>
<given-names><![CDATA[C.]]></given-names>
</name>
<name>
<surname><![CDATA[Medina]]></surname>
<given-names><![CDATA[C.]]></given-names>
</name>
</person-group>
<article-title xml:lang="en"><![CDATA[Augmented visualization for data-mining models]]></article-title>
<source><![CDATA[Elsevier Procedia Computer Science]]></source>
<year>2015</year>
<volume>55</volume>
<page-range>650-659</page-range></nlm-citation>
</ref>
<ref id="B3">
<nlm-citation citation-type="">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Dianne]]></surname>
<given-names><![CDATA[D.]]></given-names>
</name>
<name>
<surname><![CDATA[Deborah]]></surname>
<given-names><![CDATA[F.]]></given-names>
</name>
</person-group>
<source><![CDATA[Interactive and Dynamic Graphics for Data Analysis: With R and Gobi]]></source>
<year>2007</year>
</nlm-citation>
</ref>
<ref id="B4">
<nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Faria]]></surname>
<given-names><![CDATA[B. M.]]></given-names>
</name>
<name>
<surname><![CDATA[Gonçalves]]></surname>
<given-names><![CDATA[J.]]></given-names>
</name>
<name>
<surname><![CDATA[Reis]]></surname>
<given-names><![CDATA[L. P.]]></given-names>
</name>
<name>
<surname><![CDATA[Rocha]]></surname>
<given-names><![CDATA[Á.]]></given-names>
</name>
</person-group>
<article-title xml:lang="en"><![CDATA[A Clinical Support System Based on Quality of Life Estimation]]></article-title>
<source><![CDATA[Journal of Medical Systems]]></source>
<year>2015</year>
<volume>39</volume>
<numero>10</numero>
<issue>10</issue>
<page-range>114</page-range></nlm-citation>
</ref>
<ref id="B5">
<nlm-citation citation-type="book">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Fraley]]></surname>
<given-names><![CDATA[C.]]></given-names>
</name>
<name>
<surname><![CDATA[Raftery]]></surname>
<given-names><![CDATA[A.]]></given-names>
</name>
</person-group>
<source><![CDATA[Model-based methods of classification: Using the mclust Software in Chemometrics]]></source>
<year>2007</year>
<publisher-name><![CDATA[University of Washington Seattle]]></publisher-name>
</nlm-citation>
</ref>
<ref id="B6">
<nlm-citation citation-type="">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Grabusts]]></surname>
<given-names><![CDATA[P.]]></given-names>
</name>
</person-group>
<source><![CDATA[The choice of metrics for clustering algorithms]]></source>
<year>2011</year>
</nlm-citation>
</ref>
<ref id="B7">
<nlm-citation citation-type="book">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Han]]></surname>
<given-names><![CDATA[J.]]></given-names>
</name>
<name>
<surname><![CDATA[Kamber]]></surname>
<given-names><![CDATA[M.]]></given-names>
</name>
</person-group>
<source><![CDATA[Data Mining: Concepts and Techniques]]></source>
<year>2006</year>
<edition>2</edition>
<publisher-name><![CDATA[Elsevier]]></publisher-name>
</nlm-citation>
</ref>
<ref id="B8">
<nlm-citation citation-type="book">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Hoffman]]></surname>
<given-names><![CDATA[P.]]></given-names>
</name>
<name>
<surname><![CDATA[Grinstein]]></surname>
<given-names><![CDATA[G.]]></given-names>
</name>
</person-group>
<article-title xml:lang="en"><![CDATA[A Survey of Visualizations for High-Dimensional Data Mining]]></article-title>
<person-group person-group-type="editor">
<name>
<surname><![CDATA[Fayyad]]></surname>
<given-names><![CDATA[U.]]></given-names>
</name>
<name>
<surname><![CDATA[Grinstein]]></surname>
<given-names><![CDATA[G. G.]]></given-names>
</name>
<name>
<surname><![CDATA[Wierse]]></surname>
<given-names><![CDATA[A.]]></given-names>
</name>
</person-group>
<source><![CDATA[Information Visualisation in Data Mining and Knowledge Discovery]]></source>
<year>2002</year>
<page-range>47-85</page-range><publisher-loc><![CDATA[San Francisco ]]></publisher-loc>
<publisher-name><![CDATA[Morgan Kaufmann Pub]]></publisher-name>
</nlm-citation>
</ref>
<ref id="B9">
<nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Jain]]></surname>
<given-names><![CDATA[A.]]></given-names>
</name>
<name>
<surname><![CDATA[Murty]]></surname>
<given-names><![CDATA[M.]]></given-names>
</name>
<name>
<surname><![CDATA[Flynn]]></surname>
<given-names><![CDATA[P.]]></given-names>
</name>
</person-group>
<article-title xml:lang="en"><![CDATA[Data Clustering: A Review]]></article-title>
<source><![CDATA[ACM Computing Surveys]]></source>
<year>1999</year>
<volume>31</volume>
<numero>3</numero>
<issue>3</issue>
<page-range>264-323</page-range></nlm-citation>
</ref>
<ref id="B10">
<nlm-citation citation-type="book">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Keim]]></surname>
<given-names><![CDATA[D.]]></given-names>
</name>
<name>
<surname><![CDATA[Kohlhammer]]></surname>
<given-names><![CDATA[J.]]></given-names>
</name>
<name>
<surname><![CDATA[Geoffrey]]></surname>
<given-names><![CDATA[E.]]></given-names>
</name>
<name>
<surname><![CDATA[Mansmann]]></surname>
<given-names><![CDATA[F.]]></given-names>
</name>
</person-group>
<source><![CDATA[Mastering the Information Age Solving Problems with Visual Analytics]]></source>
<year>2010</year>
<publisher-name><![CDATA[Eurographics Association]]></publisher-name>
</nlm-citation>
</ref>
<ref id="B11">
<nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Lee]]></surname>
<given-names><![CDATA[H.]]></given-names>
</name>
<name>
<surname><![CDATA[Kihm]]></surname>
<given-names><![CDATA[J.]]></given-names>
</name>
<name>
<surname><![CDATA[Choo]]></surname>
<given-names><![CDATA[J.]]></given-names>
</name>
<name>
<surname><![CDATA[Stasko]]></surname>
<given-names><![CDATA[J.]]></given-names>
</name>
<name>
<surname><![CDATA[Park]]></surname>
<given-names><![CDATA[H.]]></given-names>
</name>
</person-group>
<article-title xml:lang="en"><![CDATA[iVisClustering: An interactive visual document clustering via topic modeling]]></article-title>
<source><![CDATA[Computer Graphics Forum]]></source>
<year>2012</year>
<volume>31</volume>
<numero>3^spt3</numero>
<issue>3^spt3</issue>
<supplement>pt3</supplement>
<page-range>1155-1164</page-range></nlm-citation>
</ref>
<ref id="B12">
<nlm-citation citation-type="">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Long]]></surname>
<given-names><![CDATA[T.]]></given-names>
</name>
</person-group>
<source><![CDATA[Visualizing High-density Clusters in Multidimensional Data]]></source>
<year>2011</year>
<publisher-loc><![CDATA[Bremen ]]></publisher-loc>
</nlm-citation>
</ref>
<ref id="B13">
<nlm-citation citation-type="book">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Maimon]]></surname>
<given-names><![CDATA[O.]]></given-names>
</name>
<name>
<surname><![CDATA[Rokach]]></surname>
<given-names><![CDATA[L.]]></given-names>
</name>
</person-group>
<source><![CDATA[Data Mining and Knowledge Discovery Handbook]]></source>
<year>2010</year>
<edition>2</edition>
<publisher-name><![CDATA[Springer Science+Business Media]]></publisher-name>
</nlm-citation>
</ref>
<ref id="B14">
<nlm-citation citation-type="">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Meneses]]></surname>
<given-names><![CDATA[C.]]></given-names>
</name>
<name>
<surname><![CDATA[Grinstein]]></surname>
<given-names><![CDATA[G.]]></given-names>
</name>
</person-group>
<article-title xml:lang="en"><![CDATA[Visualization for Enhancing the Data Mining Process]]></article-title>
<source><![CDATA[Proceedings]]></source>
<year>2001</year>
<publisher-loc><![CDATA[Orlando ]]></publisher-loc>
</nlm-citation>
</ref>
<ref id="B15">
<nlm-citation citation-type="">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Witten]]></surname>
<given-names><![CDATA[I. H.]]></given-names>
</name>
<name>
<surname><![CDATA[Frank]]></surname>
<given-names><![CDATA[E.]]></given-names>
</name>
</person-group>
<source><![CDATA[Data Mining: Practical Machine Learning Tools and Techniques]]></source>
<year>2005</year>
<edition>2</edition>
</nlm-citation>
</ref>
<ref id="B16">
<nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Yue]]></surname>
<given-names><![CDATA[W.]]></given-names>
</name>
</person-group>
<article-title xml:lang="en"><![CDATA[Research on the Clustering Analysis Algorithm for Data Mining]]></article-title>
<source><![CDATA[RISTI - Revista Ibérica de Sistemas y Tecnologías de la Información]]></source>
<year>2016</year>
<numero>E6</numero>
<issue>E6</issue>
<page-range>209-221</page-range></nlm-citation>
</ref>
<ref id="B17">
<nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Zhu]]></surname>
<given-names><![CDATA[Z.]]></given-names>
</name>
</person-group>
<article-title xml:lang="en"><![CDATA[A Clustering Method for High-dimensional Data Analysis in Stock Market]]></article-title>
<source><![CDATA[RISTI - Revista Ibérica de Sistemas y Tecnologías de la Información]]></source>
<year>2015</year>
<numero>17A</numero>
<issue>17A</issue>
<page-range>209-221</page-range></nlm-citation>
</ref>
</ref-list>
</back>
</article>
