Calidad de datos en una hoja: un pequeño proyecto
Un ejercicio de calidad de datos empieza con una tabla pequeña y una definición clara de sus columnas. Revisa ausencias, duplicados y formatos antes de calcular un resumen. Esta guía muestra por qué un panel atractivo puede engañar cuando nadie ha comprobado las filas que sostienen sus cifras.

Un ejercicio de calidad de datos empieza con una tabla pequeña y una definición clara de sus columnas. Revisa ausencias, duplicados y formatos antes de calcular un resumen. Esta guía muestra por qué un panel atractivo puede engañar cuando nadie ha comprobado las filas que sostienen sus cifras.
Ideas principales
- La unidad de una fila está definida.
- Se conserva una copia original sin cambios.
- Los duplicados tienen una regla explícita.
- Ausencias e inválidos se distinguen.
Define las columnas y conserva el original
Crea una tabla ficticia de consultas de cursos con ID, fecha, fuente y estado. Guarda una copia antes de cambiarla. Define si una fila representa consulta, persona o acción: son unidades distintas. La guía de eventos de Google Analytics aporta contexto para acciones registradas, pero esta hoja no es una exportación de Analytics ni afirma nada sobre tráfico real de VITON13.
Detecta incoherencias antes de corregir
Busca IDs repetidos, estados vacíos y fechas con formatos diferentes. Define duplicados según el significado de la fila. Dos consultas de una persona no tienen por qué ser duplicadas. Marca las dudosas en lugar de borrarlas. Si no puedes justificar una modificación, conserva el valor original junto a la propuesta y deja la fila pendiente de revisión.
Haz explícita la regla de corrección
Escribe una regla para cada cambio: quitar espacios exteriores, normalizar una variante aprobada de estado o distinguir fecha ausente e inválida. Mantén IDs como texto cuando importe el formato. La documentación CSV de Python explica intercambio tabular; el archivo no determina el significado comercial de una columna. Esa definición debe figurar en tu nota, sin sustituir vacíos por valores cómodos sin justificación.
Reconcilia el resumen con las filas
Cuenta filas originales, conservadas y apartadas y explica cada diferencia. Construye el resumen después de revisar y comprueba un ejemplo de cada categoría. Para una tasa, muestra numerador y denominador. La tabla inventada enseña el método; sus valores no son una referencia del mercado, una previsión de conversión ni información de una organización real.
Tu lista de evidencias
Marca solo lo que hayas comprobado. Registra tu progreso, no una auditoría independiente ni una predicción. No hay guardado automático; descarga la nota si quieres conservarla.
0 / 6 comprobados
En palabras sencillas
Un resumen útil explica cada fila original y cada cambio que modifica la respuesta.
Pruébalo
Crea diez consultas ficticias con un ID repetido, un estado vacío y una fecha inconsistente. Marca cada problema, documenta la regla y resume explicando las diez filas originales.
Resultado esperado
Una hoja original, otra revisada y un registro de incidencias con recuentos reconciliados. Los datos sintéticos no representan rendimiento empresarial.
Comprueba tu respuesta: ¿Puedo borrar todos los nombres repetidos?
No. Los nombres pueden coincidir y una persona puede generar varias consultas válidas. Define primero unidad e identificador. Si el significado no está claro, marca la fila para revisar en lugar de eliminar información que puede ser correcta.
Preguntas y respuestas
¿Puedo borrar todos los nombres repetidos?
No. Los nombres pueden coincidir y una persona puede generar varias consultas válidas. Define primero unidad e identificador. Si el significado no está claro, marca la fila para revisar en lugar de eliminar información que puede ser correcta.
¿Por qué guardar el original después de limpiar?
Permite estudiar cómo cambió el resultado y recuperar información si una regla era incorrecta. Una tabla limpia sin historial es difícil de revisar. Mantén conectados original, regla y valor corregido para que otra persona pueda entender la transformación.
Un resumen útil explica cada fila original y cada cambio que modifica la respuesta.
Fuentes y lecturas
- Python — CSV reading and writing ↗Fuentes revisadas:
- Google Analytics — Set up events ↗Fuentes revisadas: