Test cuestionario de ciencia de datos - the question form
Preguntas: 16 · 10 minutos
1. Un modelo de detección médica predice una afección poco frecuente. No detectar a una persona que tiene la afección resulta especialmente costoso. ¿Qué métrica mide más directamente la proporción de casos realmente positivos que identifica el modelo?
Especificidad
Precisión
Sensibilidad
Exactitud
2. Un analista estandariza cada columna numérica utilizando la media y la desviación estándar del conjunto de datos completo y luego divide los datos en conjuntos de entrenamiento y prueba. ¿Cuál es el principal problema?
Se filtró información del conjunto de prueba al preprocesamiento
El conjunto de entrenamiento necesariamente será demasiado pequeño
Los modelos predictivos no pueden utilizar características estandarizadas
La estandarización solo puede utilizarse con variables categóricas
3. Un conjunto de datos observacionales muestra que las personas que usan con mayor frecuencia una aplicación de actividad física también hacen más ejercicio. ¿Qué respaldaría mejor la afirmación causal de que la aplicación aumenta el ejercicio?
Una correlación más fuerte en el mismo conjunto de datos observacionales
Una muestra más grande recopilada con el mismo diseño observacional
Un gráfico que muestre que, en el conjunto de datos, el uso de la aplicación ocurre antes del ejercicio
Un experimento aleatorizado bien diseñado que compare el acceso a la aplicación con una condición de control
4. Un equipo quiere estimar qué tan bien funcionará un modelo predictivo con registros nuevos que no ha visto antes. ¿Cuál es el objetivo principal de mantener un conjunto de prueba independiente?
Garantizar que el modelo funcionará igual de bien después de implementarlo
Aumentar la cantidad de características disponibles durante el entrenamiento
Evaluar el modelo final con datos que no se utilizaron para el ajuste ni para la selección del modelo
Eliminar la necesidad de validación durante el desarrollo del modelo
5. Un equipo de detección de fraude revisa cada transacción que un modelo marca como sospechosa, y resulta muy costoso enviar transacciones legítimas a revisión. ¿Qué métrica se enfoca en cuántas de las transacciones marcadas son realmente fraudulentas?
Sensibilidad
Error cuadrático medio
Especificidad
Precisión
6. Los ingresos de los hogares de una muestra presentan un fuerte sesgo hacia la derecha porque algunos valores son extremadamente altos. ¿Qué medida representa mejor un ingreso típico y limita la influencia de esos valores extremos?
El rango
La media aritmética
La mediana
La varianza
7. En una prueba A/B, un intervalo de confianza para la diferencia entre los resultados promedio está completamente por encima de cero en el nivel de confianza elegido. ¿Qué conclusión está más justificada?
La nueva versión mejorará el resultado para todos los usuarios
La magnitud de la mejora es automáticamente importante en la práctica
Ya no queda ninguna incertidumbre sobre el efecto verdadero
Los datos aportan evidencia de una diferencia promedio positiva en ese nivel de confianza
8. Un científico de datos quiere que las ejecuciones repetidas de la misma división aleatoria entre entrenamiento y prueba seleccionen los mismos registros. ¿Cuál es la medida más directa?
Agregar más filas después de cada ejecución
Establecer y registrar la semilla aleatoria utilizada por el procedimiento de división
Ordenar los valores objetivo de mayor a menor antes de realizar la división
Eliminar la columna objetivo antes de guardar el conjunto de datos
9. Durante el desarrollo de un modelo, ¿cuál es el objetivo principal de la validación cruzada de k particiones?
Convertir una variable objetivo de regresión en categorías
Eliminar todas las fuentes de sesgo de muestreo
Estimar el rendimiento con múltiples divisiones de entrenamiento y validación
Reemplazar en todos los casos la necesidad de un conjunto de prueba final que no se haya utilizado previamente
10. ¿Cuál es un objetivo habitual de la regularización en un modelo predictivo?
Hacer que todas las características tengan la misma correlación con la variable objetivo
Convertir una tarea no supervisada en una supervisada
Garantizar que todos los ejemplos de entrenamiento se predigan correctamente
Desalentar una complejidad excesiva del modelo y ayudar a reducir el sobreajuste
11. Seis meses después de la implementación, el rendimiento de un modelo disminuye porque cambió la relación entre el comportamiento de los clientes y la variable objetivo. ¿Qué ilustra esto de manera más directa?
Un error de sintaxis en el código de entrenamiento
Deriva de concepto que afecta al modelo después de la implementación
Regularización exitosa durante el entrenamiento
Multicolinealidad perfecta en todas las características de entrada
12. Un conjunto de datos tiene muchas características numéricas correlacionadas y un analista quiere un conjunto más pequeño de componentes no correlacionados que conserve tanta varianza como sea posible. ¿Qué técnica se ajusta a este objetivo?
Análisis de componentes principales
Regresión logística
Codificación one-hot
Muestreo estratificado
13. Una tabla llamada sales contiene las columnas region y revenue. ¿Qué consulta SQL calcula correctamente el ingreso promedio de cada región?
SELECT region, AVG(revenue) FROM sales GROUP BY revenue;
SELECT region, AVG(revenue) FROM sales GROUP BY region;
SELECT AVG(region), revenue FROM sales GROUP BY region;
SELECT region, revenue FROM sales WHERE revenue = AVG(revenue);
14. Una característica registra el canal de contacto preferido de los clientes como correo electrónico, teléfono, chat o correo postal, sin ningún orden natural. ¿Qué codificación básica evita dar a entender que una categoría ocupa un nivel superior a otra?
Codificación one-hot
Asignar los valores 1, 2, 3 y 4 a las categorías
Reemplazar cada categoría por el número de fila
Aplicar escalamiento mínimo-máximo a los nombres de las categorías
15. Una empresa minorista tiene datos sobre el comportamiento de sus clientes, pero no cuenta con tipos de clientes predefinidos. Quiere descubrir grupos de clientes con comportamientos similares. ¿Qué enfoque es el más adecuado?
Regresión lineal
Agrupamiento
Clasificación binaria
Pronóstico de series temporales
16. Un modelo alcanza una exactitud del 99 % con sus datos de entrenamiento, pero solo del 68 % con datos de prueba que no ha visto antes. ¿Cuál es la explicación más probable?
El modelo está sobreajustando patrones específicos de los datos de entrenamiento
El modelo presenta subajuste porque ambas puntuaciones son igualmente bajas
La variable objetivo debe ser continua
Los datos de prueba se utilizaron demasiadas veces durante el entrenamiento