El KDD (Knowledge Discovery in Databases / Descubrimiento de Conocimiento en Bases de Datos) es el proceso global no trivial de identificar patrones válidos, novedosos, potencialmente útiles y comprensibles a partir de los datos. Atención al reactivo típico: la minería de datos es solo UNA etapa del KDD, no un sinónimo del proceso completo. Las etapas ordenadas de Fayyad et al. (1996) son: Selección → Preprocesamiento (limpieza) → Transformación → Minería de datos → Interpretación/Evaluación. La metodología industrial alternativa CRISP-DM define seis fases: comprensión del negocio, comprensión de los datos, preparación de los datos, modelado, evaluación y despliegue.
El preprocesamiento y limpieza corrige ruido, valores faltantes e inconsistencias antes de modelar. Se distingue el aprendizaje supervisado (datos con etiqueta; clasificación y regresión) del no supervisado (sin etiqueta; agrupamiento y reglas de asociación). El sobreajuste (overfitting) aparece cuando el modelo se ajusta al ruido del entrenamiento: alto desempeño en entrenamiento y bajo en prueba.
En clasificación, los árboles de decisión eligen el atributo de división con medidas de impureza: ID3/C4.5 usan entropía y ganancia de información [Entropía(S)=−Σ pᵢ·log₂(pᵢ)] y CART usa el índice de Gini [Gini(S)=1−Σ pᵢ²]; la ganancia = impureza del padre − impureza ponderada de los hijos. kNN y Bayes son también clasificadores supervisados. El k-means (agrupamiento no supervisado) exige fijar k a priori y minimiza la suma de cuadrados intra-grupo (SSE=Σ Σ ‖x − cᵢ‖²), asignando cada punto al centroide más cercano por distancia euclidiana.
Las reglas de asociación X→Y (algoritmo Apriori) se evalúan con:
La matriz de confusión binaria compara la clase real con la predicha en cuatro celdas (VP, FP, FN, VN) y permite calcular métricas directamente desde una tabla:
Para validar se usan holdout (~70/30) y validación cruzada k-fold (k=10 habitual). La reducción de dimensionalidad y selección de atributos disminuye el número de variables conservando la información relevante, lo que reduce el ruido y el sobreajuste.
1. En el marco propuesto por Fayyad, Piatetsky-Shapiro y Smyth (1996), la sigla KDD (Knowledge Discovery in Databases) se refiere a:
Fayyad et al. (1996) definen KDD como el proceso global no trivial de descubrimiento de conocimiento; la minería de datos es solo una etapa dentro de ese proceso, no un sinónimo de él. (Fayyad, U., Piatetsky-Shapiro, G. & Smyth, P. (1996). From Data Mining to Knowledge Discovery in Databases. AI Magazine, 17(3), 37-54.)
2. De acuerdo con el proceso KDD descrito por Fayyad et al., ¿cuál es el orden correcto de las etapas, desde los datos crudos hasta el conocimiento final?
El orden correcto es Selección → Preprocesamiento → Transformación → Minería de datos → Interpretación/Evaluación; las demás opciones invierten el orden de etapas adyacentes, un error común. (Fayyad, Piatetsky-Shapiro & Smyth (1996), AI Magazine, 17(3).)
3. Un analista recibe una base de datos de clientes con múltiples tablas y, antes de cualquier otro paso, extrae únicamente el subconjunto de registros y atributos relevantes para el objetivo del análisis. Dentro del proceso KDD, ¿qué etapa está realizando?
Extraer el subconjunto relevante de la base de datos corresponde a la etapa de selección, la primera del proceso KDD; el preprocesamiento se enfoca en limpieza, no en elegir qué datos usar. (Fayyad, Piatetsky-Shapiro & Smyth (1996), AI Magazine, 17(3).)
4. Durante un proyecto de minería de datos, el equipo detecta valores faltantes y registros duplicados en el conjunto de datos ya seleccionado, y procede a corregirlos antes de construir cualquier modelo. Esta actividad corresponde a la etapa de:
El preprocesamiento incluye la limpieza de ruido, valores faltantes y duplicados, un paso distinto y posterior a la selección de datos. (Fayyad, Piatetsky-Shapiro & Smyth (1996), AI Magazine, 17(3).)
5. Después de aplicar un algoritmo de agrupamiento sobre los datos ya transformados, el equipo de KDD presenta los grupos obtenidos a un experto del dominio para determinar si los patrones encontrados son realmente novedosos y útiles para el negocio. Esta actividad corresponde a la etapa final del proceso KDD, denominada:
La etapa final del KDD valida que los patrones descubiertos sean válidos, novedosos y útiles para el negocio; la minería de datos ya se ejecutó previamente, por lo que no es la respuesta correcta. (Fayyad, Piatetsky-Shapiro & Smyth (1996), AI Magazine, 17(3).)
6. La metodología CRISP-DM, usada en la industria como alternativa al proceso KDD académico, organiza un proyecto de minería de datos en seis fases. ¿Cuál es el orden correcto de esas fases?
CRISP-DM ordena las fases comenzando siempre con la comprensión del negocio y terminando con el despliegue; las demás opciones invierten pares de fases adyacentes. (Chapman, P. et al. (2000). CRISP-DM 1.0: Step-by-step data mining guide.)
7. Antes de recolectar o examinar cualquier dato, el equipo de un proyecto de minería de datos se reúne con los directivos de la empresa para definir los objetivos del negocio y traducirlos en objetivos de minería de datos. Según CRISP-DM, esta actividad corresponde a la fase de:
Es la primera fase de CRISP-DM: entender los objetivos del negocio antes de examinar cualquier dato. (Chapman, P. et al. (2000). CRISP-DM 1.0: Step-by-step data mining guide.)
8. ¿Cuál de las siguientes NO es una de las seis fases de la metodología CRISP-DM?
Las seis fases de CRISP-DM son comprensión del negocio, comprensión de los datos, preparación de los datos, modelado, evaluación y despliegue; 'validación' no es el nombre de ninguna de ellas, aunque es un término cercano a evaluación. (Chapman, P. et al. (2000). CRISP-DM 1.0: Step-by-step data mining guide.)
9. El algoritmo k-means es una técnica de minería de datos que se clasifica como:
k-means agrupa observaciones sin usar etiquetas de clase, por lo que es una técnica de aprendizaje no supervisado, a diferencia de la clasificación y la regresión. (Witten, I. H., Frank, E. & Hall, M. A. (2011), Data Mining: Practical Machine Learning Tools and Techniques, 3rd ed.; Tan, Steinbach & Kumar (2019), cap. 7.)
10. El objetivo matemático que busca minimizar el algoritmo k-means durante su ejecución es:
k-means minimiza el SSE (suma de cuadrados intra-grupo), es decir, la suma de las distancias al cuadrado entre cada punto y el centroide de su grupo. (Tan, P.-N., Steinbach, M. & Kumar, V. (2019), Introduction to Data Mining, 2nd ed., cap. 7.)
11. Un equipo de análisis desea aplicar k-means para segmentar a sus clientes, pero aún no sabe con certeza cuántos segmentos existen en los datos. ¿Qué limitación del algoritmo enfrenta directamente este equipo?
A diferencia de otros métodos de agrupamiento, k-means requiere especificar el número de grupos k antes de correr el algoritmo, lo que obliga al equipo a decidirlo de antemano o probar varios valores. (Tan, Steinbach & Kumar (2019), Introduction to Data Mining, 2nd ed., cap. 7.)
12. En una ejecución de k-means con k=2, los centroides actuales son C1=(2,2) y C2=(8,8). Debe asignarse el punto P=(3,4) al grupo cuyo centroide esté más cerca, usando distancia euclidiana. ¿A qué grupo debe asignarse P?
Distancia P-C1=√((3−2)²+(4−2)²)=√5≈2.24; distancia P-C2=√((3−8)²+(4−8)²)=√41≈6.4; por lo tanto P se asigna al grupo de C1, el centroide más cercano. (Tan, Steinbach & Kumar (2019), Introduction to Data Mining, 2nd ed., cap. 7 (asignación por distancia euclidiana al centroide más cercano).)
13. En una iteración de k-means, al grupo 1 se le asignaron los puntos (2,2), (4,2) y (3,5). Según la regla de actualización del algoritmo, ¿cuál será el nuevo centroide del grupo 1 en la siguiente iteración?
El nuevo centroide es la media aritmética de los puntos asignados: x=(2+4+3)/3=3, y=(2+2+5)/3=3, es decir (3,3); las demás opciones son errores típicos de tomar un solo punto en vez de calcular el promedio. (Tan, Steinbach & Kumar (2019), Introduction to Data Mining, 2nd ed., cap. 7 (actualización de centroides como media de los puntos asignados).)
14. El algoritmo k-means se detiene (converge) cuando:
k-means itera asignación-actualización hasta que las asignaciones y los centroides se estabilizan; las otras opciones corresponden a reglas de asociación y árboles de decisión, no a k-means. (Tan, Steinbach & Kumar (2019), Introduction to Data Mining, 2nd ed., cap. 7.)
15. Una empresa de comercio electrónico no cuenta con ninguna etiqueta previa sobre el tipo de cliente y desea descubrir grupos naturales de comportamiento de compra a partir de variables numéricas como frecuencia de compra y monto gastado. ¿Cuál técnica es la más adecuada para este objetivo?
Sin etiquetas previas, la tarea es de agrupamiento no supervisado; k-means es adecuado, mientras que árboles de decisión y regresión requieren una variable objetivo, es decir, son supervisados. (Witten, Frank & Hall (2011); Tan, Steinbach & Kumar (2019), cap. 7.)
16. Un analista ejecuta k-means para distintos valores de k (2, 3, 4, 5...) y grafica la suma de cuadrados intra-grupo (SSE) obtenida para cada valor, buscando el punto donde la reducción del SSE se vuelve marginal al aumentar k. Esta técnica para elegir el número de grupos se conoce como:
El método del codo grafica el SSE contra distintos valores de k para identificar el punto de rendimientos decrecientes; k-fold es una técnica de validación de modelos supervisados, no de selección de k. (Tan, Steinbach & Kumar (2019), Introduction to Data Mining, 2nd ed., cap. 7 (selección del número de grupos mediante SSE).)
17. Se tienen tres puntos: A=(1,1), B=(2,1) y C=(9,9). Se comparan dos particiones en dos grupos. Partición 1: {A,B} con centroide (1.5,1) y {C} con centroide (9,9). Partición 2: {A} con centroide (1,1) y {B,C} con centroide (5.5,5). Calculando la suma de cuadrados intra-grupo (SSE) de cada partición, ¿cuál produce un SSE menor y sería preferida por k-means?
SSE partición 1=0.25+0.25+0=0.5; SSE partición 2=0+28.25+28.25=56.5; la partición 1 agrupa puntos verdaderamente cercanos y produce un SSE mucho menor, por lo que k-means la preferiría. (Tan, Steinbach & Kumar (2019), Introduction to Data Mining, 2nd ed., cap. 7 (SSE = Σ‖x−centroide‖²).)
18. En la matriz de confusión de un clasificador binario, la celda que representa los casos en que el modelo predijo la clase positiva y el valor real también era positivo se denomina:
VP son los casos correctamente predichos como positivos; FP son casos predichos como positivos pero cuyo valor real era negativo. (Han, J., Kamber, M. & Pei, J. (2011), Data Mining: Concepts and Techniques, 3rd ed., cap. 8.)
19. Un clasificador de correos electrónicos (spam / no spam) fue evaluado sobre 200 mensajes, obteniendo la siguiente matriz de confusión: Verdaderos Positivos (spam detectado correctamente) = 60; Falsos Positivos (no spam marcado como spam) = 20; Falsos Negativos (spam no detectado) = 15; Verdaderos Negativos (no spam identificado correctamente) = 105. Con estos datos, ¿cuál es la precisión (precision) del clasificador?
Precisión = VP/(VP+FP) = 60/80 = 75%; la fórmula que usa falsos negativos en el denominador corresponde en realidad al recall, y la que suma verdaderos positivos y verdaderos negativos sobre el total corresponde a la exactitud (accuracy). (Han, J., Kamber, M. & Pei, J. (2011), Data Mining: Concepts and Techniques, 3rd ed., cap. 8 (Precisión = VP/(VP+FP)).)
20. Usando la misma matriz de confusión del clasificador de correo (VP=60, FP=20, FN=15, VN=105, total=200 correos), ¿cuál es el valor del recall (exhaustividad) del modelo?
Recall = VP/(VP+FN) = 60/75 = 80%; el valor de 75% corresponde en realidad a la precisión, el de 84% a la especificidad (VN/(VN+FP)=105/125), y el de 20% es la tasa de falsos negativos (1−recall), no el recall. (Han, J., Kamber, M. & Pei, J. (2011), Data Mining: Concepts and Techniques, 3rd ed., cap. 8 (Recall = VP/(VP+FN)).)
21. Continuando con el clasificador de correo anterior (precisión = 75%, recall = 80%), ¿cuál es el valor de la medida F1 del modelo, calculada como la media armónica entre precisión y recall?
F1 = 2×(0.75×0.8)/(0.75+0.8) = 1.2/1.55 ≈ 77.4%; el promedio aritmético simple da 77.5%, un valor muy cercano pero conceptualmente distinto, ya que F1 usa la media armónica, no la aritmética. (Tan, Steinbach & Kumar (2019), Introduction to Data Mining, 2nd ed., cap. 3 (F1 = media armónica de precisión y recall).)
22. Una prueba de laboratorio para detectar una enfermedad rara se aplicó a 500 pacientes. De ellos, 40 realmente tenían la enfermedad. La prueba resultó positiva en 50 pacientes, de los cuales 30 sí tenían la enfermedad (verdaderos positivos). Con estos datos, ¿cuál es el valor de la medida F1 de la prueba?
VP=30, FP=50−30=20, FN=40−30=10; precisión=30/50=60%, recall=30/40=75%; F1=2×(0.6×0.75)/(0.6+0.75)=0.9/1.35≈66.7%; usar solo una de las dos métricas produce los valores incorrectos de 60% o 75%. (Tan, Steinbach & Kumar (2019), Introduction to Data Mining, 2nd ed., cap. 3 (F1 = media armónica de precisión y recall).)
23. Dada la matriz de confusión de un clasificador binario, la exactitud (accuracy) del modelo se calcula como:
La exactitud es la proporción de instancias correctamente clasificadas (VP+VN) sobre el total; la opción con (FP+FN) es la tasa de error, y las otras dos son recall y precisión, respectivamente. (Tan, Steinbach & Kumar (2019), cap. 3; Han, Kamber & Pei (2011), cap. 8.)
24. Un banco entrena un clasificador para detectar transacciones fraudulentas, donde apenas el 2% de las transacciones son realmente fraude. El equipo nota que un modelo que predice 'no fraude' para absolutamente todas las transacciones obtiene una exactitud (accuracy) del 98%, a pesar de no detectar ningún fraude real. ¿Qué métrica sería más adecuada para evaluar el desempeño real del modelo en detectar el fraude?
Con clases muy desbalanceadas la exactitud puede ser engañosa, como en el ejemplo (98% sin detectar fraude); F1 refleja mejor el desempeño al combinar precisión y recall. (Tan, Steinbach & Kumar (2019), Introduction to Data Mining, 2nd ed., cap. 3 (F1 útil ante clases desbalanceadas).)
25. En un sistema de detección de una enfermedad grave, el equipo médico decide que es preferible generar algunas falsas alarmas (pacientes sanos marcados como enfermos) con tal de no dejar pasar ningún caso real de la enfermedad. ¿Qué métrica debe priorizarse al ajustar el modelo, dado este objetivo?
Priorizar no dejar pasar enfermos reales equivale a minimizar falsos negativos, lo cual maximiza el recall (VP/(VP+FN)), aun a costa de más falsos positivos y menor precisión. (Han, J., Kamber, M. & Pei, J. (2011), Data Mining: Concepts and Techniques, 3rd ed., cap. 8 (Recall = VP/(VP+FN)).)
26. ¿Cuál de las siguientes NO es una de las cuatro celdas de la matriz de confusión de un clasificador binario?
Las cuatro celdas son verdaderos positivos, falsos positivos, falsos negativos y verdaderos negativos; 'verdaderos neutros' no es un concepto de la matriz de confusión. (Han, J., Kamber, M. & Pei, J. (2011), Data Mining: Concepts and Techniques, 3rd ed., cap. 8.)
27. En el proceso de Descubrimiento de Conocimiento en Bases de Datos (KDD) propuesto por Fayyad, Piatetsky-Shapiro y Smyth, ¿en qué etapa se corrigen los valores faltantes, los datos ruidosos y las inconsistencias del conjunto de datos, antes de aplicar los algoritmos de minería?
El preprocesamiento es la etapa del KDD dedicada a la limpieza de datos (valores faltantes, ruido, inconsistencias); la selección solo delimita el subconjunto de datos a analizar y la transformación prepara los atributos ya limpios para la minería. (Fayyad, U., Piatetsky-Shapiro, G. & Smyth, P. (1996). From Data Mining to Knowledge Discovery in Databases. AI Magazine, 17(3), 37-54.)
28. ¿Cuál de las siguientes secuencias representa correctamente el orden de las etapas del proceso KDD según Fayyad, Piatetsky-Shapiro y Smyth (1996)?
El KDD sigue el orden selección, preprocesamiento (limpieza), transformación (normalización o construcción de atributos), minería de datos y, finalmente, interpretación/evaluación de los patrones. (Fayyad, U., Piatetsky-Shapiro, G. & Smyth, P. (1996). From Data Mining to Knowledge Discovery in Databases. AI Magazine, 17(3).)
29. Un equipo de minería de datos aplica un algoritmo de reglas de asociación directamente sobre una tabla de ventas que contiene registros de clientes duplicados y precios capturados en formatos inconsistentes (algunos con punto decimal, otros con coma), sin haber revisado ni corregido estos problemas de antemano. ¿Qué etapa del proceso KDD fue omitida y cuál es la consecuencia más probable?
Los registros duplicados y los formatos inconsistentes son problemas propios de la limpieza de datos (preprocesamiento); si se omite esta etapa, los patrones que arroje el algoritmo pueden ser incorrectos o poco confiables. (Fayyad, U., Piatetsky-Shapiro, G. & Smyth, P. (1996), AI Magazine 17(3); Han, J., Kamber, M. & Pei, J. (2011). Data Mining: Concepts and Techniques, 3rd ed., cap. 3.)
30. En la limpieza de datos (data cleaning), ¿cuál de las siguientes técnicas se utiliza para suavizar el ruido (variaciones o errores aleatorios) presente en un atributo numérico, agrupando sus valores en intervalos y sustituyéndolos por una medida representativa del intervalo?
El agrupamiento en contenedores (binning) ordena los valores y los sustituye por la media, la mediana o los límites del intervalo, suavizando el ruido; el one-hot es una transformación categórica, el PCA reduce dimensiones y el muestreo reduce el número de registros. (Han, J., Kamber, M. & Pei, J. (2011). Data Mining: Concepts and Techniques, 3rd ed., cap. 3 (Data Preprocessing).)
31. Un atributo numérico 'ingreso mensual' de una tabla de clientes presenta una distribución sesgada, con algunos valores atípicos (clientes con ingresos muy superiores al resto). Para imputar los valores faltantes de este atributo sin que la imputación se vea distorsionada por los valores atípicos, ¿qué medida es más recomendable usar?
La mediana es robusta ante valores atípicos y distribuciones sesgadas, a diferencia de la media, que se distorsiona con ellos; la moda se usa para atributos categóricos y la desviación estándar no es una medida de tendencia central para imputar. (Han, J., Kamber, M. & Pei, J. (2011). Data Mining: Concepts and Techniques, 3rd ed., cap. 3.)
32. Un analista normaliza el atributo 'edad' de una tabla de clientes mediante normalización min-max al rango [0,1]. El valor mínimo de la tabla es 20 años y el máximo es 60 años. ¿Qué valor normalizado corresponde a un registro con edad = 35 años?
Con normalización min-max, valor_norm = (v − mín)/(máx − mín) = (35 − 20)/(60 − 20) = 15/40 = 0.375; 0.625 invierte la resta del numerador y 0.583 divide el valor entre el máximo sin restar el mínimo. (Han, J., Kamber, M. & Pei, J. (2011). Data Mining: Concepts and Techniques, 3rd ed., cap. 3 (normalización min-max).)
33. El proceso de convertir un atributo numérico continuo, como el ingreso mensual, en un número reducido de intervalos o categorías (por ejemplo, 'bajo', 'medio', 'alto'), se conoce en el preprocesamiento de datos como:
La discretización agrupa los valores continuos de un atributo en intervalos o categorías; la normalización y la estandarización re-escalan los valores sin categorizarlos, y la reducción de dimensionalidad disminuye el número de atributos, no las categorías de uno solo. (Han, J., Kamber, M. & Pei, J. (2011). Data Mining: Concepts and Techniques, 3rd ed., cap. 3.)
34. Al integrar dos bases de datos de clientes provenientes de sistemas distintos, un analista detecta que el mismo cliente aparece registrado con identificadores diferentes en cada sistema (por ejemplo, 'Cust-001' en uno y '001-CUST' en el otro), por lo que resulta difícil reconocer que ambos registros corresponden a la misma entidad del mundo real. Este problema, propio de la etapa de integración de datos, se conoce como:
El problema de identificación de entidades consiste en reconciliar entidades del mundo real equivalentes provenientes de distintas fuentes cuando aparecen con distinta nomenclatura o formato; la redundancia por correlación se refiere a atributos duplicados en contenido, no a la misma entidad con distintos identificadores. (Han, J., Kamber, M. & Pei, J. (2011). Data Mining: Concepts and Techniques, 3rd ed., cap. 3 (Data Integration).)
35. ¿Cuál de las siguientes tareas NO forma parte de la limpieza de datos (data cleaning) dentro del preprocesamiento del proceso KDD?
Elegir el algoritmo de minería corresponde a la etapa de minería de datos del proceso KDD, no a la limpieza; el relleno de valores faltantes, el suavizado de ruido y la corrección de inconsistencias sí son tareas propias de la limpieza de datos. (Han, J., Kamber, M. & Pei, J. (2011). Data Mining: Concepts and Techniques, 3rd ed., cap. 3; Fayyad et al. (1996), AI Magazine 17(3).)