Comprendre le traitement par lots basé sur des fichiers

Support DQE
Support DQE
  • Mise à jour

Le traitement par lots basé sur des fichiers DQE vous permet de valider, standardiser, enrichir, nettoyer ou dédupliquer de grands volumes de données à partir de fichiers CSV échangés via un serveur SFTP sécurisé.

Cet article explique le fonctionnement du traitement par lots basé sur des fichiers, de la préparation du fichier à la récupération du fichier de sortie.

À qui s'adresse cet article

Consultez cet article si vous avez besoin de comprendre comment DQE traite les fichiers de données via un flux de traitement par lots.

Cela s'applique lorsque vos données sont traitées via un échange de fichiers, notamment pour les cas d'usage liés à Standalone, Salesforce, Microsoft Dynamics, ou des projets de traitement de fichiers dédiés.

Remarque : cet article traite du traitement par lots basé sur des fichiers via SFTP. Il ne s'applique pas aux appels API en temps réel.

Ce que fait le traitement par lots basé sur des fichiers

Le traitement par lots basé sur des fichiers permet à DQE de traiter automatiquement un jeu de données. Selon votre configuration, DQE peut appliquer un ou plusieurs services de qualité de données à votre fichier.

Le traitement type peut inclure :

  • la standardisation d'adresses postales ;
  • la déduplication ;
  • l'enrichissement de données ;
  • la détection de déménagement ;
  • le nettoyage de données ;
  • la standardisation de champs ;
  • un traitement spécifique configuré pour votre projet.

Fonctionnement du processus

Un traitement par lots basé sur des fichiers suit généralement les étapes suivantes :

  1. Vous préparez un fichier CSV selon le format attendu.
  2. Vous déposez le fichier dans le dossier d'entrée SFTP dédié.
  3. DQE vérifie le format du fichier et traite les enregistrements selon la configuration convenue.
  4. DQE génère un fichier de sortie contenant les données d'origine ainsi que des colonnes de résultats DQE supplémentaires.
  5. Vous récupérez le fichier traité depuis le dossier de sortie SFTP.

Flux de traitement

CSV file
   ↓
SFTP /IN
   ↓
DQE processing chain
   ↓
Data quality services
(RNVP, phone, email, B2B, deduplication, etc.)
   ↓
Processed CSV file
   ↓
SFTP /OUT

Fichier d'entrée

Le fichier d'entrée est le fichier CSV que vous fournissez à DQE pour traitement. Sa structure doit correspondre aux spécifications définies pour votre projet.

En général, le fichier doit :

  • utiliser le format CSV ;
  • utiliser l'encodage UTF-8 sans signature ;
  • utiliser un point-virgule (;) comme séparateur ;
  • inclure une ligne d'en-tête ;
  • inclure une ligne par enregistrement ;
  • conserver l'ordre de colonnes attendu ;
  • inclure un identifiant unique pour chaque enregistrement.

Les colonnes exactement requises dépendent des services inclus dans votre configuration de traitement.

Transfert de fichiers via SFTP

Les fichiers sont échangés via un serveur SFTP sécurisé. Selon votre configuration, la plateforme SFTP peut être hébergée par DQE ou par votre organisation après validation par DQE.

Pour un flux SFTP standard hébergé par DQE :

  • les fichiers d'entrée sont déposés dans le dossier /IN ;
  • les fichiers traités sont récupérés depuis le dossier /OUT.

Les informations de connexion sont fournies séparément lors de la mise en place du projet.

Fichier de sortie

Après traitement, DQE renvoie un fichier CSV de sortie. Ce fichier contient généralement les données d'origine ainsi que des colonnes DQE supplémentaires.

Ces colonnes supplémentaires vous aident à comprendre :

  • quels enregistrements ont été traités avec succès ;
  • quelles valeurs ont été standardisées ou corrigées ;
  • quels enregistrements nécessitent une vérification ;
  • quels codes d'erreur ou de qualité ont été renvoyés ;
  • quelles données d'enrichissement ont été ajoutées.

Les colonnes de sortie exactes dépendent des services DQE activés pour votre projet.

Traitement manuel et automatisé

Le traitement par lots basé sur des fichiers peut être géré comme un traitement ponctuel ou comme un traitement récurrent automatisé.

Avec le traitement automatisé, le flux de dépôt et de récupération reste similaire :

  1. Vous déposez les fichiers dans le dossier d'entrée.
  2. La chaîne de traitement DQE récupère et traite les fichiers automatiquement.
  3. DQE dépose les fichiers traités dans le dossier de sortie.
  4. Vous récupérez les fichiers traités.

Bonnes pratiques

  • Conservez toujours le fichier d'origine jusqu'à ce que le fichier traité ait été validé.
  • Utilisez un identifiant unique pour chaque enregistrement afin de pouvoir faire correspondre les résultats aux données source.
  • Ne modifiez pas les noms de colonnes ou l'ordre des colonnes attendus sans valider ce changement avec DQE.
  • Vérifiez les fichiers rejetés et les journaux lorsqu'un fichier n'est pas traité comme prévu.
  • Vérifiez les colonnes de sortie DQE avant de mettre à jour les données de production.

Étapes suivantes

  • Comprendre les colonnes de sortie DQE
  • Préparer votre fichier d'entrée pour le traitement par lots basé sur des fichiers
  • Déposer et récupérer des fichiers par lots via SFTP
  • Comprendre les dossiers de traitement par lots automatisé

Cet article vous a-t-il été utile ?

Utilisateurs qui ont trouvé cela utile : 0 sur 0