Die Ermittlung der Datenherkunft war noch nie so einfach

Python-Datenherkunft (Gudu SQLFlow Lite-Version für Python)

Das Python Data Lineage-Paket (auch bekannt als Gudu SQLFlow Lite-Version für Python) ist ein Toolset zur Analyse von SQL-Anweisungen und gespeicherten Prozeduren verschiedener Datenbanken, um komplexe Datenherkunft  Beziehungen und visualisieren Sie sie.

Gudu SQLFlow Lite-Version für Python Ermöglicht Python-Entwicklern die schnelle Integration von Datenherkunftsanalyse- und Visualisierungsfunktionen in ihre eigenen Python-Anwendungen. Datenwissenschaftler können die Funktion auch in ihrer täglichen Arbeit nutzen, um die Datenherkunft anhand komplexer SQL-Skripte, die üblicherweise in ETL-Jobs zur Datentransformation auf einer riesigen Datenplattform verwendet werden, schnell zu ermitteln.

Die Gudu SQLFlow Lite-Version für Python ist für die nicht-kommerzielle Nutzung kostenlos und kann komplexe SQL-Anweisungen mit einer Länge von bis zu 10 KB verarbeiten, einschließlich der Unterstützung gespeicherter Prozeduren. Sie unterstützt SQL-Dialekte von mehr als 20 großen Datenbankanbietern wie Oracle, DB2, Snowflake, Redshift, Postgres usw.

Die Gudu SQLFlow Lite-Version für Python enthält eine Java-Bibliothek zur Analyse komplexer SQL-Anweisungen und gespeicherter Prozeduren zum Abrufen von Datenherkunftsbeziehungen, eine Python-Datei das jpype verwendet, um die APIs in der Java-Bibliothek aufzurufen, und eine JavaScript-Bibliothek zur Visualisierung von Datenherkunftsbeziehungen.

Die Gudu SQLFlow Lite-Version für Python kann auch automatisch Tabellen- und Spaltenbeschränkungen sowie Beziehungen zwischen Tabellen und Feldern extrahieren aus Aus der Datenbank exportierte DDL-Skripte und erstellen Sie ein ER-Diagramm.

Datenherkunft automatisch visualisieren

Durch Ausführen dieses Befehls:
python dlineage.py /t oracle /f test.sql /graph

Wir können die in der folgenden Oracle SQL-Anweisung enthaltenen Datenherkunftsbeziehungen automatisch abrufen.

CREATE VIEW vsal AS SELECT a.deptno "Department", a.num_emp / b.total_count "Employees", a.sal_sum / b.total_sal "Salary" FROM (SELECT deptno, Count() num_emp, SUM(sal) sal_sum FROM scott.emp WHERE city = 'NYC' GROUP BY deptno) a, (SELECT Count() total_count, SUM(sal) total_sal FROM scott.emp WHERE city = 'NYC') b ; INSERT ALL WHEN ottl < 100000 THEN INTO small_orders VALUES(oid, ottl, sid, cid) WHEN ottl > 100000 and ottl < 200000 THEN INTO medium_orders VALUES(oid, ottl, sid, cid) WHEN ottl > 200000 THEN into large_orders VALUES(oid, ottl, sid, cid) WHEN ottl > 290000 THEN INTO special_orders SELECT o.order_id oid, o.customer_id cid, o.order_total ottl, o.sales_rep_id sid, c.credit_limit cl, c.cust_email cem FROM orders o, customers c WHERE o.customer_id = c.customer_id;

Und visualisieren Sie es so:

Funktionen des Python-Datenherkunftspakets:

  • Generieren Sie interaktive Visualisierungen der Datenherkunft
  • Erstellen Sie eine Datenherkunft in JSON/CSV/GRAPHML
  • Unterstützt SQL von mehr als 20 großen Datenbankanbietern

So funktioniert das Python-Datenherkunftstool


Jetzt sind alle oben genannten Komponenten in einem einzigen Repository auf GitHub zusammengefasst und Sie erhalten es kostenlos, indem Sie es einfach klonen.

git clone https://github.com/sqlparser/python_data_lineage.git

– Es ist keine Datenbankverbindung erforderlich.
– Es ist keine Internetverbindung erforderlich.

Sie benötigen nur ein JDK und einen Python-Interpreter, um dieses Python-Datenherkunftspaket lokal auszuführen.