Dateibasierte Stapelverarbeitung verstehen

Support DQE
Support DQE
  • Aktualisiert

Mit der dateibasierten Stapelverarbeitung von DQE können Sie große Datenmengen aus CSV-Dateien, die über einen sicheren SFTP-Server ausgetauscht werden, validieren, standardisieren, anreichern, bereinigen oder deduplizieren.

Dieser Artikel erklärt, wie die dateibasierte Stapelverarbeitung funktioniert, von der Dateivorbereitung bis zum Abruf der Ausgabedatei.

An wen sich dieser Artikel richtet

Nutzen Sie diesen Artikel, wenn Sie verstehen möchten, wie DQE Datendateien über einen Stapelverarbeitungs-Workflow verarbeitet.

Dies gilt, wenn Ihre Daten über einen dateibasierten Austausch verarbeitet werden, insbesondere für Anwendungsfälle im Zusammenhang mit Standalone, Salesforce, Microsoft Dynamics oder speziellen Dateiverarbeitungsprojekten.

Hinweis: Dieser Artikel behandelt die dateibasierte Stapelverarbeitung über SFTP. Er gilt nicht für Echtzeit-API-Aufrufe.

Was die dateibasierte Stapelverarbeitung leistet

Die dateibasierte Stapelverarbeitung ermöglicht es DQE, einen Datensatz automatisch zu verarbeiten. Je nach Ihrer Konfiguration kann DQE einen oder mehrere Datenqualitätsdienste auf Ihre Datei anwenden.

Eine typische Verarbeitung kann Folgendes umfassen:

  • Standardisierung von Postadressen;
  • Deduplizierung;
  • Datenanreicherung;
  • Umzugserkennung;
  • Datenbereinigung;
  • Feldstandardisierung;
  • spezifische, für Ihr Projekt konfigurierte Verarbeitung.

Wie der Prozess funktioniert

Ein dateibasierter Stapelprozess folgt in der Regel diesen Schritten:

  1. Sie bereiten eine CSV-Datei im erwarteten Format vor.
  2. Sie laden die Datei in den dafür vorgesehenen SFTP-Eingangsordner hoch.
  3. DQE prüft das Dateiformat und verarbeitet die Datensätze gemäß der vereinbarten Konfiguration.
  4. DQE erstellt eine Ausgabedatei, die die Originaldaten sowie zusätzliche DQE-Ergebnisspalten enthält.
  5. Sie rufen die verarbeitete Datei aus dem SFTP-Ausgangsordner ab.

Verarbeitungsablauf

CSV-Datei
   ↓
SFTP /IN
   ↓
DQE-Verarbeitungskette
   ↓
Datenqualitätsdienste
(RNVP, Telefon, E-Mail, B2B, Deduplizierung usw.)
   ↓
Verarbeitete CSV-Datei
   ↓
SFTP /OUT

Eingabedatei

Die Eingabedatei ist die CSV-Datei, die Sie DQE zur Verarbeitung bereitstellen. Ihre Struktur muss den für Ihr Projekt definierten Spezifikationen entsprechen.

Im Allgemeinen muss die Datei:

  • im CSV-Format vorliegen;
  • UTF-8-Kodierung ohne Signatur verwenden;
  • ein Semikolon (;) als Trennzeichen verwenden;
  • eine Kopfzeile enthalten;
  • eine Zeile pro Datensatz enthalten;
  • die erwartete Spaltenreihenfolge einhalten;
  • eine eindeutige Kennung für jeden Datensatz enthalten.

Die genau erforderlichen Spalten hängen von den in Ihrer Verarbeitungskonfiguration enthaltenen Diensten ab.

Dateiübertragung per SFTP

Dateien werden über einen sicheren SFTP-Server ausgetauscht. Je nach Ihrer Konfiguration kann die SFTP-Plattform von DQE oder nach Validierung durch DQE von Ihrer Organisation gehostet werden.

Für einen standardmäßigen, von DQE gehosteten SFTP-Workflow:

  • Eingabedateien werden in den Ordner /IN hochgeladen;
  • verarbeitete Dateien werden aus dem Ordner /OUT abgerufen.

Verbindungsdetails werden separat während der Projekteinrichtung bereitgestellt.

Ausgabedatei

Nach der Verarbeitung liefert DQE eine CSV-Ausgabedatei zurück. Diese Datei enthält in der Regel die Originaldaten sowie zusätzliche DQE-Spalten.

Diese zusätzlichen Spalten helfen Ihnen zu verstehen:

  • welche Datensätze erfolgreich verarbeitet wurden;
  • welche Werte standardisiert oder korrigiert wurden;
  • welche Datensätze überprüft werden müssen;
  • welche Fehler- oder Qualitätscodes zurückgegeben wurden;
  • welche Anreicherungsdaten hinzugefügt wurden.

Die genauen Ausgabespalten hängen von den für Ihr Projekt aktivierten DQE-Diensten ab.

Manuelle und automatisierte Verarbeitung

Die dateibasierte Stapelverarbeitung kann als einmaliger Vorgang oder als automatisierter, wiederkehrender Vorgang durchgeführt werden.

Bei der automatisierten Verarbeitung bleibt der Upload- und Abrufworkflow ähnlich:

  1. Sie legen Dateien im Eingangsordner ab.
  2. Die DQE-Verarbeitungskette ruft die Dateien automatisch ab und verarbeitet sie.
  3. DQE legt die verarbeiteten Dateien im Ausgangsordner ab.
  4. Sie rufen die verarbeiteten Dateien ab.

Bewährte Praktiken

  • Bewahren Sie die Originaldatei immer auf, bis die verarbeitete Datei validiert wurde.
  • Verwenden Sie für jeden Datensatz eine eindeutige Kennung, damit die Ergebnisse mit den Quelldaten abgeglichen werden können.
  • Ändern Sie die erwarteten Spaltennamen oder die Spaltenreihenfolge nicht, ohne die Änderung mit DQE zu validieren.
  • Überprüfen Sie abgelehnte Dateien und Protokolle, wenn eine Datei nicht wie erwartet verarbeitet wird.
  • Überprüfen Sie die DQE-Ausgabespalten, bevor Sie Produktionsdaten aktualisieren.

Nächste Schritte

  • DQE-Ausgabespalten verstehen
  • Bereiten Sie Ihre Eingabedatei für die dateibasierte Stapelverarbeitung vor
  • Laden Sie Stapeldateien per SFTP hoch und rufen Sie sie ab
  • Verstehen Sie die Ordner für die automatisierte Stapelverarbeitung

War dieser Beitrag hilfreich?

0 von 0 fanden dies hilfreich