Revisar Datos Antes de Construir

Cuando alguien te entrega un extracto que nadie ha modelado aún, el movimiento más arriesgado es empezar a construir. Este tutorial muestra cómo ejecutar una revisión de datos en su lugar: un Trabajo AI que examina los archivos en bruto y te dice qué pueden soportar honestamente, qué uniones se mantienen, quién está realmente representado y qué decisiones son tuyas - todo antes de que se modele algo.

Una revisión de datos comienza desde la misma pantalla que un trabajo de informe. La diferencia está enteramente en el prompt: en lugar de pedir al agente que construya un registro de eventos, le pides que revise primero los archivos.

El ejemplo usa un extracto real y público de una universidad - seis tablas relacionadas que cubren 32,593 inscripciones en cursos, sus registros, evaluaciones y calificaciones - por lo que cada captura de pantalla y número en esta página proviene de una ejecución real.

Crédito de datos de muestra: los archivos usados aquí son del Open University Learning Analytics Dataset (OULAD), publicado bajo la licencia CC BY 4.0. Puedes sustituirlo por cualquier extracto multi-archivo propio.

Cuándo Revisar Primero

Ejecuta una revisión de datos cuando:

  • El extracto es desconocido - cliente nuevo, sistema nuevo, exportación nueva
  • Llegan varios archivos juntos y nadie ha confirmado cómo se unen
  • Estás a punto de prometer un análisis y quieres saber si los datos pueden soportarlo
  • Un informe salió extraño y sospechas que el problema es de datos, no de la pregunta

El trabajo de la revisión es entregarte hechos y decisiones, no responder preguntas por ti. Espera números presentados sobre totales, chequeos fallidos reportados deliberadamente y una lista de decisiones que nombra lo que solo tú puedes resolver.

Paso 1: Subir el Extracto

Inicia un nuevo Trabajo AI, elige Informe AI Insight desde archivos CSV, y sube el extracto. Un .zip de CSVs se descomprime automáticamente - el extracto universitario de seis tablas llega como un zip y aparece como seis archivos:

Un zip de seis CSVs, descomprimidos al subir

Haz clic en Siguiente: Tipo de informe.

Paso 2: Eliminar la Instrucción de Construcción Pre-llenada

El cuadro de prompt se abre pre-llenado con una instrucción para construir un registro de eventos a partir de los archivos, terminando en "Luego:":

El cuadro de prompt se abre pre-llenado

Ese es el valor predeterminado correcto para un informe - y lo opuesto a lo que se busca en una revisión. Para una revisión, este texto debe irse. Puedes simplemente seleccionar todo en el cuadro y borrarlo, o dejar que un prompt de la biblioteca lo maneje, como en el siguiente paso.

El agente recibe exactamente la lista de archivos que subiste más lo que dice este cuadro - así que una vez que la instrucción de construcción desaparece, nada indica al agente modelar algo.

Paso 3: Elegir un Prompt de Revisión de la Biblioteca

El primer grupo de la biblioteca de prompts es Revisión / preparación de datos - seis prompts, cada uno dirigido a una pregunta diferente que podrías tener:

El grupo Revisión / preparación de datos

Prompt Úsalo cuando necesites
Revisión completa de preparación de datos Qué son estos archivos, qué enlaces tienen, qué población sobrevive y qué debes decidir primero.
¿Qué hay realmente en estos archivos? Grano de fila, perfil de columnas, estructura oculta dentro de texto libre y cómo están escritas las fechas.
¿Se pueden unir estos archivos? Todas las claves candidatas probadas, fallos retenidos y una comprobación semántica sobre todo lo que aceptes.
Revisar un registro de auditoría o de cambios Marcadores, qué fue realmente cada escritura, cargas masivas y el ciclo de vida del registro.
¿Quién está realmente representado? La población en cada nivel, quién desaparece y si la pérdida es sistemática.
¿Pueden estos datos responder a mis preguntas? Califica cada pregunta que te hayan dado frente a lo que los archivos pueden soportar realmente.

Haz clic en Vista previa para leer un prompt completo, y en + Añadir para ponerlo en el cuadro. Para una primera mirada a un extracto desconocido, Revisión completa de preparación de datos es la opción más amplia, y es la que este tutorial utiliza.

Uno de los seis se comporta ligeramente diferente: ¿Pueden estos datos responder a mis preguntas? termina con una línea de marcador que debes reemplazar con tus propias preguntas, una por línea. Si dejas el marcador, el agente infiere las preguntas que aparentan responder los datos, lo dice claramente y califica esas en su lugar.

Paso 4: Resolver el Aviso Cuando los Prompts Discrepan

Si agregas un prompt de revisión mientras la instrucción de construcción sigue en el cuadro, el prompt pide dos cosas opuestas - construir primero y revisar antes de construir algo. Aparece un aviso sobre el editor que dice exactamente eso:

El aviso cuando el prompt pide cosas opuestas

  • Eliminar la instrucción de construcción borra el texto pre-llenado de construcción y mantiene todo lo que escribiste o agregaste - un clic y el prompt queda como una revisión pura.
  • Mantener ambos descarta el aviso y envía el prompt tal cual, si realmente quieres mezclar ambos.

Haz clic en Eliminar la instrucción de construcción. El cuadro ahora contiene solo el resumen de revisión:

El prompt después de eliminar la instrucción de construcción

Una última protección para conocer: un cuadro de prompt completamente vacío se niega a iniciar. No hay valor predeterminado - el trabajo siempre se ejecuta con texto visible.

Un prompt vacío no puede iniciar

Haz clic en Iniciar. El trabajo se nombra Revisión de datos - [fecha], y puedes salir de la página - llegará un correo cuando termine.

Paso 5: Leer la Revisión

La revisión llega en la conversación del trabajo. En el extracto universitario, la revisión finalizada trabajó archivo por archivo - qué es una fila en cada archivo, hasta dónde llega cada columna, qué uniones se mantienen y qué población sobrevive - y terminó con un veredicto:

El veredicto de preparación en la revisión finalizada

Aquí cómo leer cada parte, con lo que esta ejecución encontró realmente:

Los hechos se exponen con totales. No "la mayoría de estudiantes entregaron", sino "25,820 de 32,593 inscripciones tienen al menos una calificación válida". Cada cifra nombra el archivo y la columna de donde viene, para que cualquier afirmación pueda verificarse.

Los chequeos fallidos se mantienen a propósito. Una unión que no coincide con nada, una columna de peso completamente cero, un archivo ausente - estos aparecen en la revisión como resultados. En este extracto la revisión reportó, por ejemplo, que las evaluaciones de un módulo tienen peso cero, y que no se suministró archivo de clickstream, lo que descarta cualquier análisis de compromiso - declarado claramente en lugar de ignorado silenciosamente.

El veredicto es una de cuatro palabras. Listo, listo con restricciones, bloqueado o no factible - seguido de lo que los datos pueden soportar honestamente y lo que no. Esta ejecución regresó listo con restricciones: el análisis de resultado y retirada es viable para la mayoría de la población; las métricas ponderadas por nota y análisis de compromiso no, y la revisión explica por qué.

Las decisiones vuelven a ti, las que bloquean primero. Cuando hay dos interpretaciones defendibles, la revisión no elige una, sino que escribe la elección en una lista numerada de decisiones. Esta vez surgieron siete, incluyendo:

  • Existen registros de exámenes para solo dos de los siete módulos - ¿restringir, sustituir con trabajo en curso o excluir exámenes?
  • 6,750 de 32,593 inscripciones no tienen entregas - ¿validarlas como cero, tratarlas como cohorte separada o excluirlas?
  • Un grupo demográfico está etiquetado como 10-20 donde todos los demás dicen 10-20% - ¿estandarizarlo o tratarlo como categoría distinta?

Responde las decisiones en la conversación y la revisión continúa desde allí - o, una vez satisfecho, inicia un trabajo de informe sobre los mismos archivos con las opciones escritas en el prompt.

Documentación Relacionada

Soporte

Si encuentras problemas:

  • Correo: support@mindzie.com
  • Incluye: el nombre del trabajo, los archivos que subiste y el comportamiento esperado vs real