Simulador EGEL Ciencias Computacionales

⛏️ Minería de datos

Minería de datos y el proceso KDD

El KDD (Knowledge Discovery in Databases / Descubrimiento de Conocimiento en Bases de Datos) es el proceso global no trivial de identificar patrones válidos, novedosos, potencialmente útiles y comprensibles a partir de los datos. Atención al reactivo típico: la minería de datos es solo UNA etapa del KDD, no un sinónimo del proceso completo. Las etapas ordenadas de Fayyad et al. (1996) son: Selección → Preprocesamiento (limpieza) → Transformación → Minería de datos → Interpretación/Evaluación. La metodología industrial alternativa CRISP-DM define seis fases: comprensión del negocio, comprensión de los datos, preparación de los datos, modelado, evaluación y despliegue.

El preprocesamiento y limpieza corrige ruido, valores faltantes e inconsistencias antes de modelar. Se distingue el aprendizaje supervisado (datos con etiqueta; clasificación y regresión) del no supervisado (sin etiqueta; agrupamiento y reglas de asociación). El sobreajuste (overfitting) aparece cuando el modelo se ajusta al ruido del entrenamiento: alto desempeño en entrenamiento y bajo en prueba.

En clasificación, los árboles de decisión eligen el atributo de división con medidas de impureza: ID3/C4.5 usan entropía y ganancia de información [Entropía(S)=−Σ pᵢ·log₂(pᵢ)] y CART usa el índice de Gini [Gini(S)=1−Σ pᵢ²]; la ganancia = impureza del padre − impureza ponderada de los hijos. kNN y Bayes son también clasificadores supervisados. El k-means (agrupamiento no supervisado) exige fijar k a priori y minimiza la suma de cuadrados intra-grupo (SSE=Σ Σ ‖x − cᵢ‖²), asignando cada punto al centroide más cercano por distancia euclidiana.

Las reglas de asociación X→Y (algoritmo Apriori) se evalúan con:

La matriz de confusión binaria compara la clase real con la predicha en cuatro celdas (VP, FP, FN, VN) y permite calcular métricas directamente desde una tabla:

Para validar se usan holdout (~70/30) y validación cruzada k-fold (k=10 habitual). La reducción de dimensionalidad y selección de atributos disminuye el número de variables conservando la información relevante, lo que reduce el ruido y el sobreajuste.

Practica el banco completo y haz simulacros gratis

Preguntas de muestra (35)

1. En el marco propuesto por Fayyad, Piatetsky-Shapiro y Smyth (1996), la sigla KDD (Knowledge Discovery in Databases) se refiere a:

  1. El proceso completo de descubrir patrones válidos y útiles en los datos, del cual la minería es solo una etapa
  2. El algoritmo que construye árboles de decisión a partir de una base de datos relacional
  3. La etapa de limpieza y transformación de los datos, previa a construir el modelo de minería
  4. El software comercial empleado para almacenar y consultar bases de datos históricas

Fayyad et al. (1996) definen KDD como el proceso global no trivial de descubrimiento de conocimiento; la minería de datos es solo una etapa dentro de ese proceso, no un sinónimo de él. (Fayyad, U., Piatetsky-Shapiro, G. & Smyth, P. (1996). From Data Mining to Knowledge Discovery in Databases. AI Magazine, 17(3), 37-54.)

2. De acuerdo con el proceso KDD descrito por Fayyad et al., ¿cuál es el orden correcto de las etapas, desde los datos crudos hasta el conocimiento final?

  1. Transformación → Selección → Minería de datos → Preprocesamiento → Interpretación/Evaluación
  2. Selección → Preprocesamiento → Transformación → Minería de datos → Interpretación/Evaluación
  3. Selección → Minería de datos → Preprocesamiento → Transformación → Interpretación/Evaluación
  4. Preprocesamiento → Minería de datos → Selección → Transformación → Interpretación/Evaluación

El orden correcto es Selección → Preprocesamiento → Transformación → Minería de datos → Interpretación/Evaluación; las demás opciones invierten el orden de etapas adyacentes, un error común. (Fayyad, Piatetsky-Shapiro & Smyth (1996), AI Magazine, 17(3).)

3. Un analista recibe una base de datos de clientes con múltiples tablas y, antes de cualquier otro paso, extrae únicamente el subconjunto de registros y atributos relevantes para el objetivo del análisis. Dentro del proceso KDD, ¿qué etapa está realizando?

  1. Transformación de los datos seleccionados
  2. Preprocesamiento y limpieza de los datos
  3. Selección de los datos relevantes
  4. Minería de datos sobre el conjunto

Extraer el subconjunto relevante de la base de datos corresponde a la etapa de selección, la primera del proceso KDD; el preprocesamiento se enfoca en limpieza, no en elegir qué datos usar. (Fayyad, Piatetsky-Shapiro & Smyth (1996), AI Magazine, 17(3).)

4. Durante un proyecto de minería de datos, el equipo detecta valores faltantes y registros duplicados en el conjunto de datos ya seleccionado, y procede a corregirlos antes de construir cualquier modelo. Esta actividad corresponde a la etapa de:

  1. Selección de los datos relevantes
  2. Transformación de los datos seleccionados
  3. Interpretación y evaluación de los resultados
  4. Preprocesamiento y limpieza de los datos

El preprocesamiento incluye la limpieza de ruido, valores faltantes y duplicados, un paso distinto y posterior a la selección de datos. (Fayyad, Piatetsky-Shapiro & Smyth (1996), AI Magazine, 17(3).)

5. Después de aplicar un algoritmo de agrupamiento sobre los datos ya transformados, el equipo de KDD presenta los grupos obtenidos a un experto del dominio para determinar si los patrones encontrados son realmente novedosos y útiles para el negocio. Esta actividad corresponde a la etapa final del proceso KDD, denominada:

  1. Interpretación y evaluación de los patrones encontrados
  2. Transformación de los datos ya seleccionados
  3. Minería de datos sobre el conjunto transformado
  4. Selección de los datos relevantes del proyecto

La etapa final del KDD valida que los patrones descubiertos sean válidos, novedosos y útiles para el negocio; la minería de datos ya se ejecutó previamente, por lo que no es la respuesta correcta. (Fayyad, Piatetsky-Shapiro & Smyth (1996), AI Magazine, 17(3).)

6. La metodología CRISP-DM, usada en la industria como alternativa al proceso KDD académico, organiza un proyecto de minería de datos en seis fases. ¿Cuál es el orden correcto de esas fases?

  1. Comprensión de los datos → Comprensión del negocio → Modelado → Preparación de los datos → Evaluación → Despliegue
  2. Comprensión del negocio → Comprensión de los datos → Preparación de los datos → Modelado → Evaluación → Despliegue
  3. Preparación de los datos → Comprensión del negocio → Comprensión de los datos → Evaluación → Modelado → Despliegue
  4. Comprensión del negocio → Modelado → Comprensión de los datos → Preparación de los datos → Despliegue → Evaluación

CRISP-DM ordena las fases comenzando siempre con la comprensión del negocio y terminando con el despliegue; las demás opciones invierten pares de fases adyacentes. (Chapman, P. et al. (2000). CRISP-DM 1.0: Step-by-step data mining guide.)

7. Antes de recolectar o examinar cualquier dato, el equipo de un proyecto de minería de datos se reúne con los directivos de la empresa para definir los objetivos del negocio y traducirlos en objetivos de minería de datos. Según CRISP-DM, esta actividad corresponde a la fase de:

  1. Comprensión de los datos disponibles
  2. Preparación de los datos para el modelado
  3. Comprensión del negocio y sus objetivos
  4. Evaluación de los modelos obtenidos

Es la primera fase de CRISP-DM: entender los objetivos del negocio antes de examinar cualquier dato. (Chapman, P. et al. (2000). CRISP-DM 1.0: Step-by-step data mining guide.)

8. ¿Cuál de las siguientes NO es una de las seis fases de la metodología CRISP-DM?

  1. Modelado
  2. Evaluación
  3. Despliegue
  4. Validación

Las seis fases de CRISP-DM son comprensión del negocio, comprensión de los datos, preparación de los datos, modelado, evaluación y despliegue; 'validación' no es el nombre de ninguna de ellas, aunque es un término cercano a evaluación. (Chapman, P. et al. (2000). CRISP-DM 1.0: Step-by-step data mining guide.)

9. El algoritmo k-means es una técnica de minería de datos que se clasifica como:

  1. Aprendizaje no supervisado, porque agrupa datos sin usar una etiqueta de clase previa
  2. Aprendizaje supervisado, porque requiere una variable de clase para entrenar el modelo
  3. Un método de reglas de asociación que relaciona atributos entre sí
  4. Un método de regresión para predecir valores numéricos continuos

k-means agrupa observaciones sin usar etiquetas de clase, por lo que es una técnica de aprendizaje no supervisado, a diferencia de la clasificación y la regresión. (Witten, I. H., Frank, E. & Hall, M. A. (2011), Data Mining: Practical Machine Learning Tools and Techniques, 3rd ed.; Tan, Steinbach & Kumar (2019), cap. 7.)

10. El objetivo matemático que busca minimizar el algoritmo k-means durante su ejecución es:

  1. La ganancia de información de cada atributo respecto a la clase objetivo
  2. La suma de cuadrados intra-grupo, es decir, la distancia de cada punto a su centroide
  3. La entropía total calculada sobre todos los grupos formados por el algoritmo
  4. La suma de las distancias entre todos los pares de centroides del modelo

k-means minimiza el SSE (suma de cuadrados intra-grupo), es decir, la suma de las distancias al cuadrado entre cada punto y el centroide de su grupo. (Tan, P.-N., Steinbach, M. & Kumar, V. (2019), Introduction to Data Mining, 2nd ed., cap. 7.)

11. Un equipo de análisis desea aplicar k-means para segmentar a sus clientes, pero aún no sabe con certeza cuántos segmentos existen en los datos. ¿Qué limitación del algoritmo enfrenta directamente este equipo?

  1. k-means necesita un conjunto de entrenamiento y otro de prueba por separado
  2. k-means solo puede aplicarse a datos con variable de clase conocida
  3. k-means exige fijar de antemano el número de grupos k antes de ejecutar el algoritmo
  4. k-means requiere calcular primero la ganancia de información de cada atributo

A diferencia de otros métodos de agrupamiento, k-means requiere especificar el número de grupos k antes de correr el algoritmo, lo que obliga al equipo a decidirlo de antemano o probar varios valores. (Tan, Steinbach & Kumar (2019), Introduction to Data Mining, 2nd ed., cap. 7.)

12. En una ejecución de k-means con k=2, los centroides actuales son C1=(2,2) y C2=(8,8). Debe asignarse el punto P=(3,4) al grupo cuyo centroide esté más cerca, usando distancia euclidiana. ¿A qué grupo debe asignarse P?

  1. A ningún grupo, porque P se encuentra fuera del rango definido por los centroides
  2. Al grupo de C2, porque su distancia euclidiana a P es menor que la distancia a C1
  3. A ambos grupos por igual, porque las distancias euclidianas son idénticas
  4. Al grupo de C1, porque su distancia euclidiana a P es menor que la distancia a C2

Distancia P-C1=√((3−2)²+(4−2)²)=√5≈2.24; distancia P-C2=√((3−8)²+(4−8)²)=√41≈6.4; por lo tanto P se asigna al grupo de C1, el centroide más cercano. (Tan, Steinbach & Kumar (2019), Introduction to Data Mining, 2nd ed., cap. 7 (asignación por distancia euclidiana al centroide más cercano).)

13. En una iteración de k-means, al grupo 1 se le asignaron los puntos (2,2), (4,2) y (3,5). Según la regla de actualización del algoritmo, ¿cuál será el nuevo centroide del grupo 1 en la siguiente iteración?

  1. (3, 3), el promedio de las coordenadas de los tres puntos asignados
  2. (2, 2), simplemente el primer punto que fue asignado al grupo
  3. (4.5, 3.5), el punto medio entre el primer y el último punto de la lista
  4. (3, 5), el punto con mayor valor en el eje Y entre los asignados

El nuevo centroide es la media aritmética de los puntos asignados: x=(2+4+3)/3=3, y=(2+2+5)/3=3, es decir (3,3); las demás opciones son errores típicos de tomar un solo punto en vez de calcular el promedio. (Tan, Steinbach & Kumar (2019), Introduction to Data Mining, 2nd ed., cap. 7 (actualización de centroides como media de los puntos asignados).)

14. El algoritmo k-means se detiene (converge) cuando:

  1. El soporte de todas las reglas generadas supera el umbral mínimo definido
  2. Las asignaciones de puntos y los centroides ya no cambian entre iteraciones
  3. Se alcanza exactamente el número máximo de atributos del conjunto de datos
  4. La ganancia de información deja de aumentar en cada nodo

k-means itera asignación-actualización hasta que las asignaciones y los centroides se estabilizan; las otras opciones corresponden a reglas de asociación y árboles de decisión, no a k-means. (Tan, Steinbach & Kumar (2019), Introduction to Data Mining, 2nd ed., cap. 7.)

15. Una empresa de comercio electrónico no cuenta con ninguna etiqueta previa sobre el tipo de cliente y desea descubrir grupos naturales de comportamiento de compra a partir de variables numéricas como frecuencia de compra y monto gastado. ¿Cuál técnica es la más adecuada para este objetivo?

  1. Una regresión lineal para predecir el monto gastado en la siguiente compra
  2. Un árbol de decisión C4.5, entrenado con la variable de clase 'tipo de cliente'
  3. Agrupamiento con k-means, por tratarse de un problema no supervisado sin clase objetivo
  4. Un clasificador evaluado mediante la especificidad y la sensibilidad del modelo anterior

Sin etiquetas previas, la tarea es de agrupamiento no supervisado; k-means es adecuado, mientras que árboles de decisión y regresión requieren una variable objetivo, es decir, son supervisados. (Witten, Frank & Hall (2011); Tan, Steinbach & Kumar (2019), cap. 7.)

16. Un analista ejecuta k-means para distintos valores de k (2, 3, 4, 5...) y grafica la suma de cuadrados intra-grupo (SSE) obtenida para cada valor, buscando el punto donde la reducción del SSE se vuelve marginal al aumentar k. Esta técnica para elegir el número de grupos se conoce como:

  1. Poda del árbol de decisión basada en el índice de impureza de Gini
  2. Validación cruzada de k particiones (k-fold cross-validation)
  3. Cálculo del lift de las reglas de asociación generadas
  4. Método del codo (elbow method), basado en la curva de SSE respecto a k

El método del codo grafica el SSE contra distintos valores de k para identificar el punto de rendimientos decrecientes; k-fold es una técnica de validación de modelos supervisados, no de selección de k. (Tan, Steinbach & Kumar (2019), Introduction to Data Mining, 2nd ed., cap. 7 (selección del número de grupos mediante SSE).)

17. Se tienen tres puntos: A=(1,1), B=(2,1) y C=(9,9). Se comparan dos particiones en dos grupos. Partición 1: {A,B} con centroide (1.5,1) y {C} con centroide (9,9). Partición 2: {A} con centroide (1,1) y {B,C} con centroide (5.5,5). Calculando la suma de cuadrados intra-grupo (SSE) de cada partición, ¿cuál produce un SSE menor y sería preferida por k-means?

  1. Partición 1, porque agrupa los puntos cercanos entre sí y su SSE es menor
  2. Partición 2, porque su SSE es menor al agrupar B y C en un mismo grupo
  3. Ambas particiones producen el mismo SSE, por lo que son equivalentes
  4. No puede calcularse el SSE sin conocer primero la etiqueta de clase de cada punto

SSE partición 1=0.25+0.25+0=0.5; SSE partición 2=0+28.25+28.25=56.5; la partición 1 agrupa puntos verdaderamente cercanos y produce un SSE mucho menor, por lo que k-means la preferiría. (Tan, Steinbach & Kumar (2019), Introduction to Data Mining, 2nd ed., cap. 7 (SSE = Σ‖x−centroide‖²).)

18. En la matriz de confusión de un clasificador binario, la celda que representa los casos en que el modelo predijo la clase positiva y el valor real también era positivo se denomina:

  1. Falsos negativos (FN)
  2. Verdaderos positivos (VP)
  3. Falsos positivos (FP)
  4. Verdaderos negativos (VN)

VP son los casos correctamente predichos como positivos; FP son casos predichos como positivos pero cuyo valor real era negativo. (Han, J., Kamber, M. & Pei, J. (2011), Data Mining: Concepts and Techniques, 3rd ed., cap. 8.)

19. Un clasificador de correos electrónicos (spam / no spam) fue evaluado sobre 200 mensajes, obteniendo la siguiente matriz de confusión: Verdaderos Positivos (spam detectado correctamente) = 60; Falsos Positivos (no spam marcado como spam) = 20; Falsos Negativos (spam no detectado) = 15; Verdaderos Negativos (no spam identificado correctamente) = 105. Con estos datos, ¿cuál es la precisión (precision) del clasificador?

  1. 30%, obtenida al dividir los verdaderos positivos entre el total de correos evaluados
  2. 80%, obtenida al dividir los verdaderos positivos entre la suma de verdaderos positivos y falsos negativos
  3. 75%, obtenida al dividir los verdaderos positivos entre la suma de verdaderos y falsos positivos
  4. 82.5%, obtenida al dividir la suma de verdaderos positivos y verdaderos negativos entre el total

Precisión = VP/(VP+FP) = 60/80 = 75%; la fórmula que usa falsos negativos en el denominador corresponde en realidad al recall, y la que suma verdaderos positivos y verdaderos negativos sobre el total corresponde a la exactitud (accuracy). (Han, J., Kamber, M. & Pei, J. (2011), Data Mining: Concepts and Techniques, 3rd ed., cap. 8 (Precisión = VP/(VP+FP)).)

20. Usando la misma matriz de confusión del clasificador de correo (VP=60, FP=20, FN=15, VN=105, total=200 correos), ¿cuál es el valor del recall (exhaustividad) del modelo?

  1. 84%, obtenido al dividir los verdaderos negativos entre la suma de verdaderos negativos y falsos positivos
  2. 75%, obtenido al dividir los verdaderos positivos entre la suma de verdaderos y falsos positivos
  3. 20%, obtenido al dividir los falsos negativos entre la suma de verdaderos positivos y falsos negativos
  4. 80%, obtenido al dividir los verdaderos positivos entre la suma de verdaderos positivos y falsos negativos

Recall = VP/(VP+FN) = 60/75 = 80%; el valor de 75% corresponde en realidad a la precisión, el de 84% a la especificidad (VN/(VN+FP)=105/125), y el de 20% es la tasa de falsos negativos (1−recall), no el recall. (Han, J., Kamber, M. & Pei, J. (2011), Data Mining: Concepts and Techniques, 3rd ed., cap. 8 (Recall = VP/(VP+FN)).)

21. Continuando con el clasificador de correo anterior (precisión = 75%, recall = 80%), ¿cuál es el valor de la medida F1 del modelo, calculada como la media armónica entre precisión y recall?

  1. 77.4%, calculada como 2×(precisión×recall)/(precisión+recall)
  2. 77.5%, calculada como el promedio aritmético simple entre precisión y recall
  3. 82.5%, que corresponde en realidad a la exactitud (accuracy) del modelo, no a F1
  4. 60%, calculada multiplicando directamente precisión por recall sin dividir entre su suma

F1 = 2×(0.75×0.8)/(0.75+0.8) = 1.2/1.55 ≈ 77.4%; el promedio aritmético simple da 77.5%, un valor muy cercano pero conceptualmente distinto, ya que F1 usa la media armónica, no la aritmética. (Tan, Steinbach & Kumar (2019), Introduction to Data Mining, 2nd ed., cap. 3 (F1 = media armónica de precisión y recall).)

22. Una prueba de laboratorio para detectar una enfermedad rara se aplicó a 500 pacientes. De ellos, 40 realmente tenían la enfermedad. La prueba resultó positiva en 50 pacientes, de los cuales 30 sí tenían la enfermedad (verdaderos positivos). Con estos datos, ¿cuál es el valor de la medida F1 de la prueba?

  1. 6%, calculada al dividir los verdaderos positivos entre el total de pacientes evaluados
  2. 66.7%, calculada a partir de una precisión de 60% y un recall de 75%
  3. 60%, calculada usando únicamente la precisión, sin considerar el recall
  4. 75%, calculada usando únicamente el recall, sin considerar la precisión

VP=30, FP=50−30=20, FN=40−30=10; precisión=30/50=60%, recall=30/40=75%; F1=2×(0.6×0.75)/(0.6+0.75)=0.9/1.35≈66.7%; usar solo una de las dos métricas produce los valores incorrectos de 60% o 75%. (Tan, Steinbach & Kumar (2019), Introduction to Data Mining, 2nd ed., cap. 3 (F1 = media armónica de precisión y recall).)

23. Dada la matriz de confusión de un clasificador binario, la exactitud (accuracy) del modelo se calcula como:

  1. VP / (VP + FN)
  2. (FP + FN) / (VP + VN + FP + FN)
  3. (VP + VN) / (VP + VN + FP + FN)
  4. VP / (VP + FP)

La exactitud es la proporción de instancias correctamente clasificadas (VP+VN) sobre el total; la opción con (FP+FN) es la tasa de error, y las otras dos son recall y precisión, respectivamente. (Tan, Steinbach & Kumar (2019), cap. 3; Han, Kamber & Pei (2011), cap. 8.)

24. Un banco entrena un clasificador para detectar transacciones fraudulentas, donde apenas el 2% de las transacciones son realmente fraude. El equipo nota que un modelo que predice 'no fraude' para absolutamente todas las transacciones obtiene una exactitud (accuracy) del 98%, a pesar de no detectar ningún fraude real. ¿Qué métrica sería más adecuada para evaluar el desempeño real del modelo en detectar el fraude?

  1. Ganancia de información calculada sobre el atributo 'monto de la transacción'
  2. Soporte de las reglas de asociación generadas a partir del modelo entrenado
  3. Exactitud (accuracy), porque sigue siendo la medida estándar independientemente del balance de clases
  4. F1, porque combina precisión y recall y es más informativa cuando las clases están desbalanceadas

Con clases muy desbalanceadas la exactitud puede ser engañosa, como en el ejemplo (98% sin detectar fraude); F1 refleja mejor el desempeño al combinar precisión y recall. (Tan, Steinbach & Kumar (2019), Introduction to Data Mining, 2nd ed., cap. 3 (F1 útil ante clases desbalanceadas).)

25. En un sistema de detección de una enfermedad grave, el equipo médico decide que es preferible generar algunas falsas alarmas (pacientes sanos marcados como enfermos) con tal de no dejar pasar ningún caso real de la enfermedad. ¿Qué métrica debe priorizarse al ajustar el modelo, dado este objetivo?

  1. Recall (exhaustividad), porque mide qué proporción de los enfermos reales son detectados
  2. Precisión, porque mide qué proporción de los diagnósticos positivos son realmente correctos
  3. Especificidad, porque mide qué proporción de los sanos son correctamente identificados
  4. Soporte, porque mide la frecuencia conjunta de la enfermedad y el diagnóstico positivo

Priorizar no dejar pasar enfermos reales equivale a minimizar falsos negativos, lo cual maximiza el recall (VP/(VP+FN)), aun a costa de más falsos positivos y menor precisión. (Han, J., Kamber, M. & Pei, J. (2011), Data Mining: Concepts and Techniques, 3rd ed., cap. 8 (Recall = VP/(VP+FN)).)

26. ¿Cuál de las siguientes NO es una de las cuatro celdas de la matriz de confusión de un clasificador binario?

  1. Falsos positivos
  2. Verdaderos neutros
  3. Verdaderos positivos
  4. Falsos negativos

Las cuatro celdas son verdaderos positivos, falsos positivos, falsos negativos y verdaderos negativos; 'verdaderos neutros' no es un concepto de la matriz de confusión. (Han, J., Kamber, M. & Pei, J. (2011), Data Mining: Concepts and Techniques, 3rd ed., cap. 8.)

27. En el proceso de Descubrimiento de Conocimiento en Bases de Datos (KDD) propuesto por Fayyad, Piatetsky-Shapiro y Smyth, ¿en qué etapa se corrigen los valores faltantes, los datos ruidosos y las inconsistencias del conjunto de datos, antes de aplicar los algoritmos de minería?

  1. Transformación
  2. Preprocesamiento
  3. Selección
  4. Interpretación y evaluación

El preprocesamiento es la etapa del KDD dedicada a la limpieza de datos (valores faltantes, ruido, inconsistencias); la selección solo delimita el subconjunto de datos a analizar y la transformación prepara los atributos ya limpios para la minería. (Fayyad, U., Piatetsky-Shapiro, G. & Smyth, P. (1996). From Data Mining to Knowledge Discovery in Databases. AI Magazine, 17(3), 37-54.)

28. ¿Cuál de las siguientes secuencias representa correctamente el orden de las etapas del proceso KDD según Fayyad, Piatetsky-Shapiro y Smyth (1996)?

  1. Selección → Transformación → Preprocesamiento → Minería de datos → Interpretación/Evaluación
  2. Preprocesamiento → Selección → Transformación → Minería de datos → Interpretación/Evaluación
  3. Selección → Preprocesamiento → Transformación → Minería de datos → Interpretación/Evaluación
  4. Selección → Preprocesamiento → Minería de datos → Transformación → Interpretación/Evaluación

El KDD sigue el orden selección, preprocesamiento (limpieza), transformación (normalización o construcción de atributos), minería de datos y, finalmente, interpretación/evaluación de los patrones. (Fayyad, U., Piatetsky-Shapiro, G. & Smyth, P. (1996). From Data Mining to Knowledge Discovery in Databases. AI Magazine, 17(3).)

29. Un equipo de minería de datos aplica un algoritmo de reglas de asociación directamente sobre una tabla de ventas que contiene registros de clientes duplicados y precios capturados en formatos inconsistentes (algunos con punto decimal, otros con coma), sin haber revisado ni corregido estos problemas de antemano. ¿Qué etapa del proceso KDD fue omitida y cuál es la consecuencia más probable?

  1. Se omitió la etapa de selección; el algoritmo no podrá ejecutarse sobre la tabla
  2. Se omitió la etapa de interpretación; los patrones obtenidos carecerán de utilidad práctica
  3. Se omitió el preprocesamiento; los patrones obtenidos pueden ser inválidos o poco confiables
  4. Se omitió la transformación; el soporte de las reglas aumentará artificialmente

Los registros duplicados y los formatos inconsistentes son problemas propios de la limpieza de datos (preprocesamiento); si se omite esta etapa, los patrones que arroje el algoritmo pueden ser incorrectos o poco confiables. (Fayyad, U., Piatetsky-Shapiro, G. & Smyth, P. (1996), AI Magazine 17(3); Han, J., Kamber, M. & Pei, J. (2011). Data Mining: Concepts and Techniques, 3rd ed., cap. 3.)

30. En la limpieza de datos (data cleaning), ¿cuál de las siguientes técnicas se utiliza para suavizar el ruido (variaciones o errores aleatorios) presente en un atributo numérico, agrupando sus valores en intervalos y sustituyéndolos por una medida representativa del intervalo?

  1. Agrupamiento en contenedores (binning)
  2. Codificación one-hot del atributo
  3. Análisis de componentes principales
  4. Muestreo aleatorio estratificado

El agrupamiento en contenedores (binning) ordena los valores y los sustituye por la media, la mediana o los límites del intervalo, suavizando el ruido; el one-hot es una transformación categórica, el PCA reduce dimensiones y el muestreo reduce el número de registros. (Han, J., Kamber, M. & Pei, J. (2011). Data Mining: Concepts and Techniques, 3rd ed., cap. 3 (Data Preprocessing).)

31. Un atributo numérico 'ingreso mensual' de una tabla de clientes presenta una distribución sesgada, con algunos valores atípicos (clientes con ingresos muy superiores al resto). Para imputar los valores faltantes de este atributo sin que la imputación se vea distorsionada por los valores atípicos, ¿qué medida es más recomendable usar?

  1. La media aritmética del atributo
  2. La mediana del atributo
  3. La moda del atributo
  4. La desviación estándar del atributo

La mediana es robusta ante valores atípicos y distribuciones sesgadas, a diferencia de la media, que se distorsiona con ellos; la moda se usa para atributos categóricos y la desviación estándar no es una medida de tendencia central para imputar. (Han, J., Kamber, M. & Pei, J. (2011). Data Mining: Concepts and Techniques, 3rd ed., cap. 3.)

32. Un analista normaliza el atributo 'edad' de una tabla de clientes mediante normalización min-max al rango [0,1]. El valor mínimo de la tabla es 20 años y el máximo es 60 años. ¿Qué valor normalizado corresponde a un registro con edad = 35 años?

  1. 0.625
  2. 0.583
  3. 0.375
  4. 0.300

Con normalización min-max, valor_norm = (v − mín)/(máx − mín) = (35 − 20)/(60 − 20) = 15/40 = 0.375; 0.625 invierte la resta del numerador y 0.583 divide el valor entre el máximo sin restar el mínimo. (Han, J., Kamber, M. & Pei, J. (2011). Data Mining: Concepts and Techniques, 3rd ed., cap. 3 (normalización min-max).)

33. El proceso de convertir un atributo numérico continuo, como el ingreso mensual, en un número reducido de intervalos o categorías (por ejemplo, 'bajo', 'medio', 'alto'), se conoce en el preprocesamiento de datos como:

  1. Normalización min-max
  2. Discretización
  3. Reducción de dimensionalidad
  4. Estandarización z-score

La discretización agrupa los valores continuos de un atributo en intervalos o categorías; la normalización y la estandarización re-escalan los valores sin categorizarlos, y la reducción de dimensionalidad disminuye el número de atributos, no las categorías de uno solo. (Han, J., Kamber, M. & Pei, J. (2011). Data Mining: Concepts and Techniques, 3rd ed., cap. 3.)

34. Al integrar dos bases de datos de clientes provenientes de sistemas distintos, un analista detecta que el mismo cliente aparece registrado con identificadores diferentes en cada sistema (por ejemplo, 'Cust-001' en uno y '001-CUST' en el otro), por lo que resulta difícil reconocer que ambos registros corresponden a la misma entidad del mundo real. Este problema, propio de la etapa de integración de datos, se conoce como:

  1. Problema de identificación de entidades
  2. Redundancia por correlación de atributos
  3. Sesgo de selección muestral
  4. Maldición de la dimensionalidad

El problema de identificación de entidades consiste en reconciliar entidades del mundo real equivalentes provenientes de distintas fuentes cuando aparecen con distinta nomenclatura o formato; la redundancia por correlación se refiere a atributos duplicados en contenido, no a la misma entidad con distintos identificadores. (Han, J., Kamber, M. & Pei, J. (2011). Data Mining: Concepts and Techniques, 3rd ed., cap. 3 (Data Integration).)

35. ¿Cuál de las siguientes tareas NO forma parte de la limpieza de datos (data cleaning) dentro del preprocesamiento del proceso KDD?

  1. Relleno o imputación de valores faltantes
  2. Identificación y suavizado de datos ruidosos
  3. Selección del algoritmo de minería que se aplicará al conjunto de datos
  4. Corrección de registros inconsistentes

Elegir el algoritmo de minería corresponde a la etapa de minería de datos del proceso KDD, no a la limpieza; el relleno de valores faltantes, el suavizado de ruido y la corrección de inconsistencias sí son tareas propias de la limpieza de datos. (Han, J., Kamber, M. & Pei, J. (2011). Data Mining: Concepts and Techniques, 3rd ed., cap. 3; Fayyad et al. (1996), AI Magazine 17(3).)

Comienza gratis