Vérifier les données avant de construire

Lorsque quelqu'un vous remet un extrait que personne n'a encore modélisé, la décision la plus risquée est de commencer à construire. Ce tutoriel montre comment lancer plutôt une revue des données : un Job IA qui examine les fichiers bruts et vous dit ce qu'ils peuvent réellement supporter, quelles jointures tiennent, qui est effectivement représenté, et quelles décisions vous devez prendre - le tout avant toute modélisation.

Une revue des données commence à partir du même écran qu'un job de rapport. La différence réside entièrement dans l'invite : au lieu de demander à l'agent de construire un journal d'événements, vous lui demandez de vérifier les fichiers d'abord.

L'exemple utilise un extrait réel et public d'une université - six tables liées couvrant 32 593 inscriptions aux cours, leurs enregistrements, évaluations et notes - donc chaque capture d'écran et chiffre de cette page provient d'une exécution réelle.

Crédit des données exemple : les fichiers utilisés ici proviennent de l'Open University Learning Analytics Dataset (OULAD), publié sous licence CC BY 4.0. Vous pouvez substituer n'importe quel extrait multi-fichier à vous.

Quand faire une revue d'abord

Lancez une revue des données lorsque :

  • L'extrait vous est inconnu : nouveau client, nouveau système, nouvelle exportation
  • Plusieurs fichiers arrivent en même temps et personne n'a confirmé leurs jointures
  • Vous êtes sur le point de promettre une analyse et voulez savoir si les données la portent
  • Un rapport est étrange et vous soupçonnez les données, pas la question

Le rôle de la revue est de vous apporter des faits et des décisions, non de répondre aux questions à votre place. Attendez-vous à des chiffres indiqués sur des totaux, des vérifications échouées signalées volontairement, et une liste de décisions qui nomme ce que vous seul pouvez trancher.

Étape 1 : Télécharger l’extrait

Démarrez un nouveau AI Job, choisissez Rapport d'analyse IA à partir de fichiers CSV, et téléchargez l’extrait. Un .zip de CSV est décompressé automatiquement - l’extrait universitaire en six tables arrive en un zip et apparaît comme six fichiers :

Une archive zip de six CSV, décompressée à l'import

Cliquez sur Suivant : Type de rapport.

Étape 2 : Supprimer l’instruction de construction pré-remplie

La boîte d’invite s’ouvre pré-remplie avec une instruction pour construire un journal d'événements à partir des fichiers, qui se termine par "Then:" :

La boîte d’invite s’ouvre pré-remplie

C’est la bonne valeur par défaut pour un rapport - et l’exact opposé de ce qu’une revue cherche à faire. Pour une revue, ce texte doit disparaître. Vous pouvez simplement tout sélectionner dans la boîte et supprimer, ou laisser une invite de bibliothèque s’en charger, comme à l’étape suivante.

L'agent reçoit exactement la liste des fichiers que vous avez téléchargés plus ce que contient cette boîte - donc une fois l'instruction de construction supprimée, rien n’indique à l'agent de modéliser quoi que ce soit.

Étape 3 : Choisir une invite de revue dans la bibliothèque

Le premier groupe de la bibliothèque d’invites est Revue / préparation des données - six invites, chacune visant une question différente que vous pourriez avoir :

Le groupe Revue / préparation des données

Invite Utilisez-la quand vous avez besoin de
Revue complète de préparation des données Ce que sont ces fichiers, ce qui se lie, quelle population subsiste, et ce que vous devez décider d’abord.
Que contiennent réellement ces fichiers ? Granularité des lignes, profil des colonnes, structure cachée dans le texte libre, et format des dates.
Peut-on joindre ces fichiers ? Test de chaque clé candidate, échecs conservés, et vérification sémantique de tout ce que vous acceptez.
Revoir un journal d’audit ou de modifications Marqueurs, nature réelle de chaque écriture, chargements en masse, et cycle de vie des enregistrements.
Qui est effectivement représenté ? Population à chaque niveau, qui disparaît, et si la perte est systématique.
Ces données peuvent-elles répondre à mes questions ? Évaluer chaque question donnée par rapport à ce que les fichiers peuvent réellement supporter.

Cliquez sur Aperçu pour lire une invite complète, et + Ajouter pour la mettre dans la boîte. Pour un premier regard sur un extrait inconnu, Revue complète de préparation des données est le choix le plus large, et c’est celui que ce tutoriel exécute.

Une des six invite se comporte un peu différemment : Ces données peuvent-elles répondre à mes questions ? termine par une ligne de modèle que vous devez remplacer par vos propres questions, une par ligne. Si vous laissez la ligne de modèle, l’agent déduit les questions que les données semblent destinées à répondre, le mentionne clairement, et évalue celles-ci à la place.

Étape 4 : Résoudre l’avertissement lorsque les invites sont conflictuelles

Si vous ajoutez une invite de revue alors que l’instruction de construction est encore dans la boîte, l’invite demande maintenant deux choses opposées - construire d’abord, et revoir avant toute construction. Un avertissement apparaît au-dessus de l’éditeur et dit exactement cela :

Avertissement quand l’invite demande des choses opposées

  • Supprimer l’instruction de construction efface le texte pré-rempli de construction et conserve tout ce que vous avez écrit ou ajouté - un clic et l’invite devient une revue pure.
  • Conserver les deux ferme l’avertissement et envoie l’invite telle quelle, si vraiment vous voulez mélanger les deux.

Cliquez sur Supprimer l’instruction de construction. La boîte ne contient plus que le résumé de revue :

L'invite après suppression de l'instruction de construction

Une autre garde à connaître : une boîte d’invite complètement vide refuse de démarrer. Il n’y a pas de valeur par défaut - le job s’exécute toujours sur un texte que vous pouvez voir.

Une boîte d'invite vide ne peut pas démarrer

Cliquez sur Démarrer. Le job s'appelle Revue des données - [date], et vous pouvez quitter la page - un courriel arrive quand c’est fini.

Étape 5 : Lire la revue

La revue arrive dans la conversation du job. Sur l’extrait universitaire, la revue terminée a parcouru les fichiers dans l’ordre - ce que représente une ligne dans chaque fichier, où s’arrêtent les colonnes, quelles jointures tiennent, et quelle population subsiste - et s’est terminée par un verdict :

Le verdict de préparation dans la revue terminée

Voici comment lire chaque partie, avec ce que cette exécution a réellement trouvé :

Les faits sont donnés avec des totaux. Pas "la plupart des étudiants ont soumis" mais "25 820 des 32 593 inscriptions ont au moins une note valide". Chaque chiffre indique le fichier et la colonne d’origine, pour que toute affirmation soit vérifiable.

Les vérifications échouées sont volontairement conservées. Une jointure sans correspondance, une colonne de poids toute nulle, un fichier absent - tout cela apparaît dans la revue comme résultat. Sur cet extrait, la revue a par exemple signalé qu'une unité d’enseignement a toutes ses évaluations avec poids zéro, et qu’aucun fichier de clickstream n’était fourni, ce qui exclut toute analyse d’engagement - présenté clairement plutôt que silencieusement ignoré.

Le verdict est un des quatre mots. Prêt, prêt avec contraintes, bloqué, ou non faisable - suivi de ce que les données peuvent honnêtement supporter et ce qu'elles ne peuvent pas. Cette exécution est revenue prêt avec contraintes : l’analyse des résultats et des retraits est possible pour la plupart de la population ; les métriques pondérées par la note et l’analyse d’engagement ne le sont pas, la revue expliquant pourquoi.

Les décisions vous reviennent, en commençant par les obstacles majeurs. Lorsque deux interprétations défendables existent, la revue ne choisit pas - elle écrit le choix dans une liste numérotée de décisions. Cette exécution en a soulevé sept, dont :

  • Des enregistrements d’examens existent pour seulement deux des sept modules - restreindre, substituer avec des devoirs, ou exclure les examens ?
  • 6 750 des 32 593 inscriptions n’ont aucune soumission - les noter zéro, les traiter comme une cohorte distincte, ou les exclure ?
  • Une tranche démographique est étiquetée 10-20 alors que toutes les autres sont 10-20% - la standardiser, ou la traiter comme une catégorie distincte ?

Répondez aux décisions dans la conversation et la revue continue - ou, une fois satisfait, lancez un job de rapport sur les mêmes fichiers avec les choix écrits dans l’invite.

Documentation associée

Support

En cas de problème :

  • Email : support@mindzie.com
  • Inclure : le nom du job, les fichiers téléchargés, et le comportement attendu vs réel