データリネージ知識ベース

データ系統 これは、データが元のソースからSQLコードによって適用されるすべての変換を経て、データを利用するテーブル、ビュー、レポートに至るまでの経路を文書化したものです。これは、すべてのデータチームが日々直面する2つの質問に答えるものです。 「この数字はどこから来たのですか?」「この列を変更すると、何が壊れますか?」 このナレッジベースは、このトピックに関して公開するすべてのもの(概念、20の特定のデータベースの実践ガイド、およびドキュメント)を整理したデータリネージガイドインデックスです。 Gudu SQLFlowこのサイトのすべての例の背後にあるSQL系統追跡ツール。

39SQL方言、それぞれ専用のパーサー
20データベース固有の系統ガイド
列レベルテーブルレベルだけでなく、より詳細な粒度
静的分析、テーブルデータは読み込まない

下記のリンク先ページはそれぞれ独立しているので、ご自身の問題に合ったページに直接アクセスできます。説明を読むよりも、まずは履歴を確認したい場合は、ツール自体を使用するのが最も手っ取り早い方法です。

30秒で試してみましょう: 任意の SQL クエリを貼り付ける 無料オンラインSQL系統可視化ツール インタラクティブな列レベルの系統図を取得できます。無料版はブラウザ上で動作するため、インストールは不要です。

概念から始めましょう

このデータ系統ガイドの中核を成すのは、以下の4ページです。初めての方は、順番にお読みください。各ページは前のページよりもさらに深いレベルへと解説しています。

  • データリネージとは? 基礎編:平易な言葉で定義し、リネージが他のメタデータとどのように異なるか、SQL解析が最も正確な構築方法である理由、そしてプロベナンスとインパクト分析の具体的な例を紹介します。この用語が初めて聞く場合や、関係者に説明する必要がある場合は、まずここから始めてください。
  • 列レベルのデータリネージ テーブルレベルの系統図だけでは不十分な理由。テーブルレベルでは 収益報告 から構築されています 注文; 列レベルでは、どのソース列がフィードしているかが正確にわかります レポート収益合計 そして、どの関数、結合、フィルターがそれらを通して機能するかについても説明します。このページでは、直接的な系譜と間接的な(影響)系譜の違いについても解説しています。これは、ほとんどのツールでは完全に無視されている区別です。
  • データリネージの例 実際のSQLと、それによって生成される図を用いた6つの実践的なシナリオ:スキーマ変更の影響分析、ダッシュボード番号の誤りの根本原因特定、コンプライアンス文書作成、移行マッピングなど。リネージ出力が実際にどのようなものかを最速で理解する方法です。
  • 最高のデータ リネージ ツール 市場に出回っている10種類の選択肢(オープンソースのパーサー、カタログ優先プラットフォーム、専門的な系統追跡エンジン)を公平に比較し、それぞれのカテゴリーの真価と弱点を明らかにします。評価を行う前に、ぜひお読みください。

データベースごとのデータ系統ガイド

系統は方言に依存しないものではありません。Snowflakeはマイニング可能なクエリ履歴を公開します。SQL ServerはT-SQLストアドプロシージャと動的SQL内に変換ロジックを隠蔽します。Teradataの系統は通常、その過程で最も重要になります。 移行中に。以下の各ガイドでは、SQL がどこにあるか、どのように抽出するか、どの方言機能がその系統の特定を困難にしているかなど、特定のエンジンに関する詳細を説明しています。

カテゴリデータベースガイド
クラウドデータウェアハウススノーフレーク, BigQuery, 赤方偏移, データブリックス, アズール SQL
従来のRDBMSオラクル, SQLサーバー, MySQL, PostgreSQL, IBM DB2
MPPと分析テラデータ, ネテッツァ, グリーンプラム, ヴェルティカ, SAP HANA, クリックハウス, DuckDB
ビッグデータとクエリエンジンハイブ, Spark SQL, トリノ&プレスト

どのガイドがどの項目について最も詳しく解説しているか、いくつかポイントを挙げます。

  • ストアドプロシージャと動的SQL: SQL Server および Oracle のガイドを参照してください。SQLFlow には、T-SQL および PL/SQL 専用のプロシージャ パーサーがあり、プロシージャ パラメータと一時テーブルを介した履歴の追跡、動的 SQL の解決、プロシージャ間の呼び出しのコール グラフのレンダリングを行います。
  • クエリ履歴からの系統情報: SnowflakeとRedshiftのガイドを参照してください。どちらのエンジンも実行されたSQLを記録し、SQLFlowはSnowflakeのクエリ履歴とRedshiftのクエリログをネイティブに取り込むため、履歴は実際に実行された内容を反映します。
  • 移行マッピング: TeradataとNetezzaのガイドでは、通常、レガシーデータウェアハウスをクラウドプラットフォームに移行する前に、その完全な依存関係グラフをマッピングすることが作業内容となっています。
  • フェデレーションクエリ: Trino & Presto ガイドでは、1 つの記述が複数のカタログからの引用である場合の系譜について説明しています。

これらの 20 のエンジンには専用のガイドがありますが、これらはサブセットです。SQLFlow は、Flink SQL、Sybase、Informix、Power Query (M)、Salesforce SOQL を含む合計 39 のデータベースとクエリ エンジン用の方言固有のパーサーを出荷しています。まだガイドがない方言の場合は、 SQLデータリネージツールの概要 全39件をリストしています。

Gudu SQLFlow 製品ドキュメント

系譜について読むだけでなく、実際に系譜を作成する準備ができたら、これらのページでは製品のエディションと、それぞれの展開方法について説明しています。

ページ対象範囲
SQLデータリネージツール(概要)中心となるページ:SQLFlowのエンドツーエンドの動作原理、サポートされている39種類の方言、ストアドプロシージャとdbtの分析、そしてすべてのデプロイメントオプションを1か所にまとめています。
SQLFlow クラウドSaaS版はsqlflow.gudusoft.comでご利用いただけます。ブラウザにSQLを貼り付ける無料プラン、プレミアムプランは月額$49.99です。
SQLFlow オンプレミスDockerまたはKubernetes上でセルフホスト可能。完全なエアギャップネットワークにも対応。選択したデータベースタイプごとに月額$500、または一括払い$4,800。最大2台のサーバーにインストール可能。SQLテキストはインフラストラクチャから外部に送信されることはありません。
SQLFlow REST APIパイプライン、CIチェック、および内部プラットフォーム内での系統抽出を自動化するために、JSON over HTTPエンドポイントとして系統分析を提供します。

エンタープライズ展開では、100以上のデータベースと100万以上の列からなる環境をバッチスキャンし、増分スキャンで永続的なリネージリポジトリを保持し、DataHub、Microsoft Purview、およびOpenMetadataにエクスポートします。各エディションのリファレンスドキュメントは以下にあります。 docs.gudusoft.com、現在の計画は 価格ページ.

どのページから始めればいいですか?

あなたの状況ここから始めてください
系譜学初心者なので、基本を知りたいですデータリネージとは何ですか?次に、例のページ
チーム向けのツールを評価する最高のデータ リネージ ツールすると、データベースのガイド
監査またはコンプライアンスのために履歴が必要列レベルのデータリネージ 規制当局は列の粒度を期待している
倉庫移転の計画あなたのガイド ソース エンジン(Oracle、Teradata、Netezza、DB2)
自社製品に系譜を組み込むSQLFlow REST API

最新記事

新しいガイドや既存ガイドの更新情報(最新順)を掲載しています。方言対応範囲や製品機能は定期的に変更されるため、最近更新されたページは必ずご確認ください。

  • データリネージ: データの旅を理解する
    ビッグデータ時代において、組織は意思決定プロセスを推進するためにますますデータに依存するようになっています。このデータは信頼性が高く、正確で、一貫性があることが不可欠です。そこで登場するのがデータリネージです。データリネージとは、…
  • データ フロー図: 概念、記号、種類、およびヒント
    データフロー図:概念、記号、種類、ヒント データフロー図とは? データフロー図を描く理由とは? データフロー図の記号とは? データフローのルールとは? データフロー図とデータフロー図の違いとは?
  • データ ガバナンスを成功させるための 6 つの重要な要素
    成功するデータガバナンスの6つの重要な要素 優れたデータおよび分析ガバナンスは、より迅速かつ賢明な意思決定を可能にします。最高データ責任者(CDO)を含むデータおよび分析のリーダーは、ビジネス戦略と企業目標を達成するために、データおよび分析資産が適切に管理されていることを確認する必要があります。
  • データ ガバナンスがどの組織にとっても必須である理由は何ですか?
    データガバナンスが組織にとって必須である理由とは? データガバナンスとは何か? ビッグデータガバナンスが直面する問題とは? データガバナンスが組織にとって必須である理由とは? データガバナンスのメリットとは? もしあなたが…
  • 現在および長期的なデータ ガバナンスのメリット トップ 5
    ビッグデータ関連技術の継続的な成熟に伴い、資産としてのデータは企業や機関からますます注目を集めています。データ資産を効果的に活用するためには、…
  • データ ガバナンスの究極のガイド | Gudu SQLFlow
    データガバナンス究極ガイド データガバナンスとは? データガバナンスの目的とは? データガバナンスの方法とは? データガバナンスプロジェクトの範囲とは? これらの質問への答えをお探しなら…

読むのはやめて、自分のSQLをトレースしてみましょう

クエリを貼り付けるだけで、数秒でインタラクティブな列レベルの系統図を取得できます。

よくある質問

データリネージとは、簡単に言うとどういうものですか?

データリネージとは、データの出所、変換方法、最終目的地を記録したものです。SQL環境では、どのソーステーブルと列が各ターゲットテーブル、ビュー、レポートにデータを提供し、その過程でどの結合、フィルタ、計算が適用されるかをマッピングすることを意味します。 完全定義ガイド この点について詳しく解説しています。

テーブルレベルの系統とカラムレベルの系統の違いは何ですか?

テーブルレベルの系統図は、どのテーブルがどのテーブルにデータを供給しているかを示します。列レベルの系統図は、出力列ごとに、その列にデータを供給している正確なソース列と適用された変換を示します。列レベルの系統図こそが、影響分析や監査の回答を概算ではなく正確なものにするのです。

特定のデータベースのデータリネージを取得するにはどうすればよいですか?

上記のデータベース別表からエンジンを選択してください。実際のワークフローはどこでも同じです。SQL(貼り付けたクエリ、アップロードされたファイル、JDBC経由のライブメタデータ、dbtマニフェスト、またはデータウェアハウスのクエリ履歴)を収集し、SQLFlowに方言固有のパーサーで解析させ、結果として得られる列レベルの図を探索するか、JSON、CSV、またはPNGとしてエクスポートします。

データリネージを取得するには、データカタログが必要ですか?

いいえ。DataHub、Collibra、Atlanなどのカタログプラットフォームは、組織全体のメタデータ、所有権、および検出を整理するのに優れていますが、そのデータリネージの品質は、それらにデータを提供するSQL分析エンジンに依存します。SQLFlowはスタンドアロンで使用することも、既に実行中のカタログ内のリネージエンジンとして使用することもできます。SQLFlowは、DataHub、Microsoft Purview、およびOpenMetadataにエクスポートできます。

パーサーベースの系統推定はどの程度正確なのか?

パーサーベースの系統は、パーサーの精度に依存します。SQLFlow は、 汎用SQLパーサーこれは、2000年代半ばから商用開発されているSQLコンパイラのフロントエンドで、方言ごとに約13,600個のSQLテストフィクスチャで検証されています。分析は静的であるため、実行時ログベースのアプローチでは見逃されるコードパス内のロジックを捉えることができ、テーブルの行を読み取ることはありません。

SQLデータリネージを無料で試せる方法はありますか?

はい。 SQLFlow クラウド 無料プランがあり、任意のSQL文を貼り付けるだけで、ブラウザ上でインタラクティブな列レベルの系統図を取得できます。インストールは不要です。

読むのをやめて、なぞり始めよう

無料のビジュアライザーにクエリを貼り付けるだけで、数秒で列レベルの系譜を確認できます。または、お客様の資産全体をスキャンすることについてご相談ください。