GI LogoGI Logo
  • Anmelden
Digitale Bibliothek
    • Gesamter Bestand

      • Bereiche & Sammlungen
      • Titel
      • Autor
      • Erscheinungsdatum
      • Schlagwort
    • Diese Sammlung

      • Titel
      • Autor
      • Erscheinungsdatum
      • Schlagwort
Digital Bibliothek der Gesellschaft für Informatik e.V.
GI-DL
    • English
    • Deutsch
  • Deutsch 
    • English
    • Deutsch
Dokumentanzeige 
  •   Startseite
  • Fachbereiche
  • Datenbanken und Informationssysteme (DBIS)
  • Datenbank Spektrum
  • Datenbank Spektrum 21(3) - November 2021
  • Dokumentanzeige
JavaScript is disabled for your browser. Some features of this site may not work without it.
  •   Startseite
  • Fachbereiche
  • Datenbanken und Informationssysteme (DBIS)
  • Datenbank Spektrum
  • Datenbank Spektrum 21(3) - November 2021
  • Dokumentanzeige

Collecting and visualizing data lineage of Spark jobs

Autor(en):
Schoenenwald, Alexander [DBLP] ;
Kern, Simon [DBLP] ;
Viehhauser, Josef [DBLP] ;
Schildgen, Johannes [DBLP]
Zusammenfassung
Metadata management constitutes a key prerequisite for enterprises as they engage in data analytics and governance. Today, however, the context of data is often only manually documented by subject matter experts, and lacks completeness and reliability due to the complex nature of data pipelines. Thus, collecting data lineage—describing the origin, structure, and dependencies of data—in an automated fashion increases quality of provided metadata and reduces manual effort, making it critical for the development and operation of data pipelines. In our practice report, we propose an end-to-end solution that digests lineage via (Py‑)Spark execution plans. We build upon the open-source component Spline , allowing us to reliably consume lineage metadata and identify interdependencies. We map the digested data into an expandable data model, enabling us to extract graph structures for both coarse- and fine-grained data lineage. Lastly, our solution visualizes the extracted data lineage via a modern web app, and integrates with BMW Group’s soon-to-be open-sourced Cloud Data Hub.
  • Vollständige Referenz
  • BibTeX
Schoenenwald, A., Kern, S., Viehhauser, J. & Schildgen, J., (2021). Collecting and visualizing data lineage of Spark jobs.   Datenbank-Spektrum: Vol. 21, No. 3. Springer. (S. 179-189). DOI: 10.1007/s13222-021-00387-7
@article{mci/Schoenenwald2021,
author = {Schoenenwald, Alexander AND Kern, Simon AND Viehhauser, Josef AND Schildgen, Johannes},
title = {Collecting and visualizing data lineage of Spark jobs},
journal = {Datenbank-Spektrum},
volume = {21},
number = {3},
year = {2021},
,
pages = { 179-189 } ,
doi = { 10.1007/s13222-021-00387-7 }
}

Sollte hier kein Volltext (PDF) verlinkt sein, dann kann es sein, dass dieser aus verschiedenen Gruenden (z.B. Lizenzen oder Copyright) nur in einer anderen Digital Library verfuegbar ist. Versuchen Sie in diesem Fall einen Zugriff ueber die verlinkte DOI: 10.1007/s13222-021-00387-7

Haben Sie fehlerhafte Angaben entdeckt? Sagen Sie uns Bescheid: Feedback abschicken

Mehr Information

DOI: 10.1007/s13222-021-00387-7
ISSN: 1610-1995
Datum: 2021
Typ: Text/Journal Article

Keywords

  • Amazon Web Service
  • Data Engineering
  • Data Lake
  • Data Provenance
  • Metadata
Sammlungen
  • Datenbank Spektrum 21(3) - November 2021 [12]

Zur Langanzeige


Über uns | FAQ | Hilfe | Impressum | Datenschutz

Gesellschaft für Informatik e.V. (GI), Kontakt: Geschäftsstelle der GI
Diese Digital Library basiert auf DSpace.

 

 


Über uns | FAQ | Hilfe | Impressum | Datenschutz

Gesellschaft für Informatik e.V. (GI), Kontakt: Geschäftsstelle der GI
Diese Digital Library basiert auf DSpace.