{"id":6747,"date":"2026-07-12T02:05:41","date_gmt":"2026-07-12T10:05:41","guid":{"rendered":"https:\/\/www.gudusoft.com\/what-is-data-lineage\/"},"modified":"2026-07-13T19:01:49","modified_gmt":"2026-07-14T03:01:49","slug":"what-is-data-lineage","status":"publish","type":"page","link":"https:\/\/www.gudusoft.com\/fr\/quest-ce-que-la-lignee-de-donnees\/","title":{"rendered":"Qu\u2019est-ce que la tra\u00e7abilit\u00e9 des donn\u00e9es\u00a0? D\u00e9finition, exemples et fonctionnement"},"content":{"rendered":"<p>Qu&#039;est-ce que la lign\u00e9e de donn\u00e9es ? <strong>Lign\u00e9e de donn\u00e9es<\/strong> Il s&#039;agit du chemin document\u00e9 que suivent les donn\u00e9es depuis leurs sources d&#039;origine jusqu&#039;\u00e0 leurs destinations finales, incluant chaque table, vue, t\u00e2che et transformation rencontr\u00e9e en cours de route. Il r\u00e9pond \u00e0 deux questions que se posent toutes les \u00e9quipes de donn\u00e9es\u00a0: <em>\u00ab D\u2019o\u00f9 vient cette valeur ? \u00bb<\/em> (provenance) et <em>\u00ab Qu\u2019est-ce qui en d\u00e9pend en aval ? \u00bb<\/em> (Analyse d&#039;impact). Dans les syst\u00e8mes bas\u00e9s sur SQL, la tra\u00e7abilit\u00e9 est g\u00e9n\u00e9ralement extraite automatiquement par l&#039;analyse du code SQL qui d\u00e9place et restructure les donn\u00e9es.<\/p>\n\n\n\n<div class=\"gd-stats\"><div class=\"gd-stat\"><b>39<\/b><span>dialectes SQL, chacun un analyseur syntaxique d\u00e9di\u00e9<\/span><\/div><div class=\"gd-stat\"><b>Niveau de colonne<\/b><span>granularit\u00e9, et pas seulement au niveau des tables<\/span><\/div><div class=\"gd-stat\"><b>Direct + indirect<\/b><span>relations de lignage<\/span><\/div><div class=\"gd-stat\"><b>Statique<\/b><span>l&#039;analyse ne lit jamais les donn\u00e9es du tableau<\/span><\/div><\/div>\n\n\n\n<p>Cette page propose une d\u00e9finition pratique \u00e0 destination des praticiens\u00a0: ce que la tra\u00e7abilit\u00e9 enregistre concr\u00e8tement, la diff\u00e9rence entre la granularit\u00e9 au niveau de la table et au niveau de la colonne, les relations directes et indirectes, les trois m\u00e9thodes de construction de la tra\u00e7abilit\u00e9 et les personnes qui en ont r\u00e9ellement besoin. Les exemples utilisent SQL, car c\u2019est dans la plupart des entrep\u00f4ts de donn\u00e9es que r\u00e9side la logique de transformation.<\/p>\n\n\n\n<div class=\"wp-block-group gd-callout is-layout-constrained\"><div class=\"wp-block-group__inner-container\">\n\n<p><strong>Consultez la lign\u00e9e au lieu de lire \u00e0 son sujet\u00a0:<\/strong> collez n&#039;importe quelle requ\u00eate SQL dans le <a href=\"https:\/\/sqlflow.gudusoft.com\/?utm_source=gudusoft&amp;utm_medium=website&amp;utm_campaign=what-is-data-lineage\" target=\"_blank\" rel=\"noreferrer noopener\">Visualiseur de lignage SQLFlow gratuit<\/a> et obtenez en quelques secondes un diagramme de lignage interactif au niveau des colonnes.<\/p>\n\n<\/div><\/div>\n\n\n\n<h2 class=\"wp-block-heading\">L&#039;analyse de la lign\u00e9e r\u00e9pond \u00e0 deux questions\u00a0: provenance et analyse d&#039;impact<\/h2>\n\n\n\n<p>La tra\u00e7abilit\u00e9 des donn\u00e9es est un graphique unique qui se lit dans les deux sens. Lisez-le. <strong>en amont<\/strong> On obtient ainsi la tra\u00e7abilit\u00e9\u00a0: \u00e0 partir d\u2019un chiffre dans un rapport, on remonte le fil de chaque vue, jointure et calcul jusqu\u2019aux colonnes sources brutes dont il est issu. C\u2019est cette tra\u00e7abilit\u00e9 qui int\u00e9resse les auditeurs, les organismes de r\u00e9glementation et toute personne cherchant \u00e0 corriger une erreur de calcul.<\/p>\n\n\n\n<p>Lisez-le <strong>en aval<\/strong> Vous obtenez ainsi une analyse d&#039;impact\u00a0: \u00e0 partir d&#039;une colonne que vous souhaitez renommer, retyper ou supprimer, l&#039;analyse recense toutes les tables, vues, proc\u00e9dures et rapports qui seraient affect\u00e9s. C&#039;est cette approche qui int\u00e9resse les ing\u00e9nieurs avant une modification de sch\u00e9ma ou une migration, car l&#039;alternative consiste \u00e0 analyser des milliers de scripts au hasard.<\/p>\n\n\n\n<p>Ces termes sont parfois utilis\u00e9s de mani\u00e8re impr\u00e9cise. \u00c0 proprement parler, <em>provenance<\/em> est la trace inverse, <em>analyse d&#039;impact<\/em> est la trace directe, et <em>lign\u00e9e de donn\u00e9es<\/em> est le graphe de d\u00e9pendance sous-jacent qui rend les deux parcours possibles.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Un exemple concret<\/h2>\n\n\n\n<p>Prenons l&#039;exemple d&#039;un relev\u00e9 d&#039;entrep\u00f4t de donn\u00e9es classique\u00a0:<\/p>\n\n\n\n<pre class=\"wp-block-code\"><code>INSERT INTO monthly_revenue (month, total) SELECT DATE_TRUNC(&#039;month&#039;, o.order_date) AS month, SUM(o.amount) AS total FROM orders o JOIN customers c ON o.customer_id = c.id WHERE c.region = &#039;EMEA&#039; GROUP BY DATE_TRUNC(&#039;month&#039;, o.order_date);<\/code><\/pre>\n\n\n\n<p>La filiation extraite de cette seule d\u00e9claration pr\u00e9sente d\u00e9j\u00e0 deux types de relations distincts\u00a0:<\/p>\n\n\n\n<ul><li><strong>lign\u00e9e directe<\/strong> \u2014 les donn\u00e9es sont effectivement achemin\u00e9es vers la sortie\u00a0: <code>commandes.date_de_commande<\/code> alimentation <code>revenu_mensuel.mois<\/code> \u00e0 travers <code>DATE_TRUNC<\/code>, et <code>commandes.montant<\/code> alimentation <code>revenu_mensuel.total<\/code> \u00e0 travers <code>SOMME<\/code>.<\/li>\n<li><strong>lign\u00e9e indirecte<\/strong> \u2014 des colonnes qui n&#039;apparaissent jamais dans le r\u00e9sultat final, mais qui le fa\u00e7onnent\u00a0: <code>clients.r\u00e9gion<\/code> filtre les lignes, et <code>commandes.identifiant_client<\/code> joint \u00e0 <code>clients.id<\/code> d\u00e9termine quelles lignes correspondent. Modifiez le comportement <code>r\u00e9gion<\/code> est peupl\u00e9 et chaque nombre dans <code>revenu_mensuel<\/code> changements, m\u00eame si <code>r\u00e9gion<\/code> n&#039;appara\u00eet nulle part dans le r\u00e9sultat.<\/li><\/ul>\n\n\n\n<p>Un pipeline r\u00e9el se compose de milliers d&#039;instructions de ce type, organis\u00e9es en couches \u00e0 travers des vues, des proc\u00e9dures stock\u00e9es et des mod\u00e8les dbt. Les outils de tra\u00e7abilit\u00e9 existent car aucun humain ne peut m\u00e9moriser ce graphe. Pour des exemples concrets, notamment la tra\u00e7abilit\u00e9 multi-sauts et des proc\u00e9dures stock\u00e9es, consultez notre documentation. <a href=\"https:\/\/www.gudusoft.com\/fr\/exemples-de-lignees-de-donnees\/\">exemples de tra\u00e7abilit\u00e9 des donn\u00e9es<\/a> visite guid\u00e9e.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Lign\u00e9e au niveau du tableau vs lign\u00e9e au niveau de la colonne<\/h2>\n\n\n\n<p>La lign\u00e9e se d\u00e9cline en deux niveaux de granularit\u00e9, et la diff\u00e9rence d\u00e9termine ce que vous pouvez r\u00e9ellement faire avec.<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table><thead><tr><th><\/th><th>Lign\u00e9e au niveau de la table<\/th><th>Lign\u00e9e au niveau de la colonne<\/th><\/tr><\/thead><tbody>\n<tr><td>Ce qu&#039;il enregistre<\/td><td><code>revenu_mensuel<\/code> est construit \u00e0 partir de <code>ordres<\/code> et <code>clients<\/code><\/td><td><code>revenu_mensuel.total<\/code> = <code>SOMME(commandes.montant)<\/code>, filtr\u00e9 par <code>clients.r\u00e9gion<\/code>, a rejoint le <code>identifiant_client = identifiant<\/code><\/td><\/tr>\n<tr><td>Analyse d&#039;impact<\/td><td>Approximatif\u00a0: signale tous les consommateurs de la table, y compris ceux dont la colonne modifi\u00e9e n\u2019est jamais affect\u00e9e.<\/td><td>Pr\u00e9cis : signale uniquement les consommateurs que la colonne alimente r\u00e9ellement.<\/td><\/tr>\n<tr><td>R\u00e9ponses d&#039;audit<\/td><td>\u00ab Ce rapport utilise ces tableaux \u00bb<\/td><td>\u00ab Ce chiffre est calcul\u00e9 \u00e0 partir pr\u00e9cis\u00e9ment de ces champs sources, via ces transformations. \u00bb<\/td><\/tr>\n<tr><td>Source typique<\/td><td>M\u00e9tadonn\u00e9es de l&#039;orchestrateur de t\u00e2ches, journaux de requ\u00eates<\/td><td>Analyser le SQL lui-m\u00eame<\/td><\/tr>\n<\/tbody><\/table><\/figure>\n\n\n\n<p>L&#039;analyse de la lign\u00e9e au niveau des tables est peu co\u00fbteuse \u00e0 collecter et utile pour une premi\u00e8re cartographie d&#039;un pipeline. Mais la plupart des questions pertinentes concernent les colonnes\u00a0: quels rapports utilisent <code>e-mail<\/code>Les champs sources qui alimentent ce chiffre r\u00e9glement\u00e9 correspondent \u00e0 tout \u00e9l\u00e9ment en aval lisant la colonne que nous souhaitons supprimer. Cela n\u00e9cessite de r\u00e9soudre chaque colonne de sortie via des jointures, des sous-requ\u00eates, des CTE, des vues, etc. <code>S\u00c9LECTIONNER *<\/code> Extension\u00a0: traitement par analyseur syntaxique, et non extraction de logs. Les m\u00e9canismes sont expliqu\u00e9s en d\u00e9tail dans notre guide. <a href=\"https:\/\/www.gudusoft.com\/fr\/lignee-de-donnees-au-niveau-des-colonnes\/\">tra\u00e7abilit\u00e9 des donn\u00e9es au niveau des colonnes<\/a>.<\/p>\n\n\n\n<div class=\"wp-block-group gd-panel-navy is-layout-constrained\"><div class=\"wp-block-group__inner-container\">\n\n<h2 class=\"wp-block-heading\">Comment construire la tra\u00e7abilit\u00e9 des donn\u00e9es\u00a0: trois approches<\/h2>\n\n\n\n<p>Tous les outils de g\u00e9n\u00e9alogie disponibles sur le march\u00e9 utilisent une combinaison de trois techniques.<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table><thead><tr><th>Approche<\/th><th>Comment \u00e7a marche<\/th><th>Fort en<\/th><th>Faible en<\/th><\/tr><\/thead><tbody>\n<tr><td>Analyse SQL statique<\/td><td>Analyser le code SQL (vues, proc\u00e9dures, scripts ETL, mod\u00e8les dbt) et d\u00e9duire le graphe de d\u00e9pendances \u00e0 partir de la syntaxe et de la s\u00e9mantique.<\/td><td>Pr\u00e9cision au niveau des colonnes\u00a0; couvre tous les chemins d\u2019ex\u00e9cution, y compris ceux qui n\u2019ont pas \u00e9t\u00e9 ex\u00e9cut\u00e9s r\u00e9cemment\u00a0; ne n\u00e9cessite aucun acc\u00e8s aux donn\u00e9es.<\/td><td>N\u00e9cessite un analyseur syntaxique capable de comprendre chaque dialecte SQL\u00a0; les transformations non-SQL (Python, Spark DataFrames) ne sont pas concern\u00e9es.<\/td><\/tr>\n<tr><td>Bas\u00e9 sur l&#039;ex\u00e9cution \/ les journaux de requ\u00eates<\/td><td>Observez ce qui a r\u00e9ellement \u00e9t\u00e9 ex\u00e9cut\u00e9\u00a0: l\u2019historique des requ\u00eates d\u2019entrep\u00f4t de donn\u00e9es, les \u00e9v\u00e9nements de l\u2019orchestrateur (mod\u00e8le OpenLineage\/Marquez).<\/td><td>Capture des ex\u00e9cutions r\u00e9elles de t\u00e2ches h\u00e9t\u00e9rog\u00e8nes, y compris celles non SQL ; v\u00e9rit\u00e9 de r\u00e9f\u00e9rence pour \u00ab ce qui a \u00e9t\u00e9 ex\u00e9cut\u00e9 et quand \u00bb<\/td><td>Seules les requ\u00eates ex\u00e9cut\u00e9es pendant la p\u00e9riode d&#039;observation sont visibles\u00a0; la granularit\u00e9 est souvent au niveau de la table\u00a0; les journaux contiennent toujours du code SQL qui doit \u00eatre analys\u00e9 pour en extraire les d\u00e9tails des colonnes.<\/td><\/tr>\n<tr><td>Documentation manuelle<\/td><td>Les analystes consignent les correspondances dans des feuilles de calcul ou un catalogue \u00e0 la main.<\/td><td>Contexte m\u00e9tier et d\u00e9finitions qu&#039;aucun analyseur syntaxique ne peut d\u00e9duire<\/td><td>P\u00e9rissable d\u00e8s le lendemain de sa r\u00e9daction ; sujet aux erreurs \u00e0 toute \u00e9chelle r\u00e9elle.<\/td><\/tr>\n<\/tbody><\/table><\/figure>\n\n\n\n<p>Ces m\u00e9thodes sont compl\u00e9mentaires, non concurrentes\u00a0: l\u2019historique d\u2019ex\u00e9cution indique les op\u00e9rations ex\u00e9cut\u00e9es, la curation manuelle apporte du sens m\u00e9tier et l\u2019analyse statique SQL fournit la cartographie logique au niveau des colonnes. La plupart des transformations d\u2019entrep\u00f4t de donn\u00e9es \u00e9tant effectu\u00e9es en SQL, l\u2019analyse statique repr\u00e9sente la part la plus importante du travail, et sa qualit\u00e9 d\u00e9pend directement de celle de son analyseur syntaxique. <a href=\"https:\/\/www.gudusoft.com\/fr\/outil-de-lignee-de-donnees-sql\/\">Gudu SQLFlow<\/a> Cette approche repose sur 39 analyseurs syntaxiques sp\u00e9cifiques \u00e0 chaque dialecte (Snowflake, BigQuery, Oracle, SQL Server, Teradata et 34 autres), construits sur un compilateur SQL frontal d\u00e9velopp\u00e9 depuis le milieu des ann\u00e9es 2000 et valid\u00e9 \u00e0 l&#039;aide d&#039;environ 13\u00a0600 jeux de tests par dialecte. Cette profondeur lui permet de g\u00e9rer le SQL qui pose probl\u00e8me aux analyseurs plus simples\u00a0: proc\u00e9dures stock\u00e9es Oracle PL\/SQL et T-SQL, SQL dynamique assembl\u00e9 \u00e0 l&#039;ex\u00e9cution, tables temporaires et piles de vues.<\/p>\n\n<\/div><\/div>\n\n\n\n<h2 class=\"wp-block-heading\">\u00c0 quoi sert la tra\u00e7abilit\u00e9 des donn\u00e9es\u00a0?<\/h2>\n\n\n\n<p>En pratique, quatre cas d&#039;utilisation expliquent la quasi-totalit\u00e9 de l&#039;adoption de la lign\u00e9e\u00a0:<\/p>\n\n\n\n<ul><li><strong>Conformit\u00e9 r\u00e9glementaire.<\/strong> La norme BCBS 239 exige des banques qu&#039;elles d\u00e9montrent comment les indicateurs de risque sont agr\u00e9g\u00e9s \u00e0 partir des donn\u00e9es sources\u00a0; les obligations de cartographie des donn\u00e9es du RGPD imposent de savoir dans quels syst\u00e8mes et tables d\u00e9riv\u00e9es les donn\u00e9es personnelles sont achemin\u00e9es. La tra\u00e7abilit\u00e9 au niveau des colonnes est l&#039;\u00e9l\u00e9ment qui r\u00e9pond \u00e0 ces deux exigences\u00a0: \u00ab\u00a0ces champs sources pr\u00e9cis, \u00e0 travers ces transformations\u00a0\u00bb.<\/li>\n<li><strong>Gouvernance des donn\u00e9es.<\/strong> Les catalogues et glossaires deviennent obsol\u00e8tes lorsque la tra\u00e7abilit\u00e9 est g\u00e9r\u00e9e manuellement. L&#039;extraction automatique de la tra\u00e7abilit\u00e9 permet de maintenir la carte des d\u00e9pendances \u00e0 jour en fonction des modifications du code et peut alimenter directement les plateformes de catalogues\u00a0; SQLFlow, par exemple, fournit des adaptateurs d&#039;exportation pour DataHub, Microsoft Purview et OpenMetadata.<\/li>\n<li><strong>D\u00e9bogage et analyse des causes profondes.<\/strong> Lorsqu&#039;un tableau de bord affiche un chiffre erron\u00e9, la tra\u00e7abilit\u00e9 transforme \u00ab rechercher chaque script mentionnant ce tableau \u00bb en \u00ab remonter \u00e0 partir de cette colonne \u00bb. Des heures au lieu de jours.<\/li>\n<li><strong>Migration et modernisation.<\/strong> Avant de passer d&#039;Oracle ou Teradata \u00e0 Snowflake, BigQuery ou Databricks, le graphe de d\u00e9pendances vous indique ce qui doit \u00eatre d\u00e9plac\u00e9 ensemble, dans quel ordre et quels objets ne sont plus utilis\u00e9s et peuvent \u00eatre supprim\u00e9s plut\u00f4t que migr\u00e9s.<\/li><\/ul>\n\n\n\n<p><strong class=\"gd-lead-in\">Une heuristique utile :<\/strong> Si votre \u00e9quipe a d\u00e9j\u00e0 retard\u00e9 une modification de sch\u00e9ma parce que personne n&#039;\u00e9tait s\u00fbr des probl\u00e8mes qu&#039;elle engendrerait, vous avez d\u00e9j\u00e0 besoin de la tra\u00e7abilit\u00e9 \u2014 vous la calculez simplement manuellement, lentement et avec des erreurs.<\/p>\n\n\n\n<div class=\"wp-block-group gd-panel-navy gd-cta is-layout-constrained\"><div class=\"wp-block-group__inner-container\">\n\n<h2 class=\"wp-block-heading\">Tracez votre propre requ\u00eate SQL, et pas seulement l&#039;exemple.<\/h2>\n\n\n<p>Collez une requ\u00eate et obtenez en quelques secondes un diagramme de lignage interactif au niveau des colonnes.<\/p>\n\n\n<div class=\"wp-block-buttons is-content-justification-center is-layout-flex wp-container-3\">\n<div class=\"wp-block-button\"><a class=\"wp-block-button__link wp-element-button\" href=\"https:\/\/sqlflow.gudusoft.com\/?utm_source=gudusoft&amp;utm_medium=website&amp;utm_campaign=what-is-data-lineage\" target=\"_blank\" rel=\"noreferrer noopener\">Essayez SQLFlow gratuitement<\/a><\/div>\n\n\n<div class=\"wp-block-button is-style-outline\"><a class=\"wp-block-button__link wp-element-button\" href=\"https:\/\/www.gudusoft.com\/fr\/outil-de-lignee-de-donnees-sql\/\">Consultez l&#039;outil de lign\u00e9e<\/a><\/div>\n<\/div>\n\n<\/div><\/div>\n\n\n\n<h2 class=\"wp-block-heading\">Foire aux questions<\/h2>\n\n\n\n<h3 class=\"wp-block-heading\">Qu&#039;est-ce que la tra\u00e7abilit\u00e9 des donn\u00e9es en termes simples\u00a0?<\/h3>\n\n\n<p>Il s&#039;agit de la cartographie de vos donn\u00e9es\u00a0: leurs sources et leurs destinations, les transformations qui s&#039;op\u00e8rent entre chaque tableau ou rapport, et les sources qui alimentent ces derniers. Imaginez un graphe de d\u00e9pendances pour les donn\u00e9es, que l&#039;on peut parcourir en remontant le temps (provenance) et en avan\u00e7ant (analyse d&#039;impact).<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Quelle est la diff\u00e9rence entre la tra\u00e7abilit\u00e9 des donn\u00e9es et la provenance des donn\u00e9es\u00a0?<\/h3>\n\n\n<p>La provenance est la tra\u00e7abilit\u00e9 d&#039;un produit jusqu&#039;\u00e0 ses origines. La lign\u00e9e, quant \u00e0 elle, repr\u00e9sente l&#039;ensemble des d\u00e9pendances, permettant d&#039;\u00e9tablir la provenance dans un sens et d&#039;analyser l&#039;impact dans l&#039;autre. Dans le langage courant, ces termes se recoupent, mais la distinction entre graphe et parcours est essentielle.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Qu&#039;est-ce que la tra\u00e7abilit\u00e9 indirecte des donn\u00e9es\u00a0?<\/h3>\n\n\n<p>La lign\u00e9e indirecte concerne les colonnes qui influencent un r\u00e9sultat sans y appara\u00eetre explicitement \u2014 les colonnes utilis\u00e9es dans <code>O\u00d9<\/code> filtres, <code>REJOINDRE<\/code> conditions, et <code>GROUPER PAR<\/code> Les clauses SQLFlow modifient chaque valeur de sortie\u00a0; par cons\u00e9quent, une analyse d\u2019impact qui les ignore est incompl\u00e8te. SQLFlow mod\u00e9lise la lign\u00e9e indirecte comme un type de relation distinct et activable\u00a0; la plupart des outils de tra\u00e7abilit\u00e9 ne font pas cette distinction.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">La tra\u00e7abilit\u00e9 des donn\u00e9es est-elle requise pour la conformit\u00e9 au RGPD ou \u00e0 la norme BCBS 239\u00a0?<\/h3>\n\n\n<p>Aucun des deux r\u00e9f\u00e9rentiels ne mentionne la \u00ab\u00a0tra\u00e7abilit\u00e9\u00a0\u00bb comme technologie obligatoire, mais tous deux exigent ce qu\u2019elle apporte\u00a0: la norme BCBS 239 demande aux banques de d\u00e9montrer comment les donn\u00e9es de risque sont agr\u00e9g\u00e9es \u00e0 partir de leurs sources, et la cartographie des donn\u00e9es du RGPD requiert de conna\u00eetre le parcours des donn\u00e9es personnelles. La tra\u00e7abilit\u00e9 au niveau des colonnes est la m\u00e9thode standard pour produire ces preuves \u00e0 grande \u00e9chelle.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Comment cr\u00e9er automatiquement la tra\u00e7abilit\u00e9 des donn\u00e9es ?<\/h3>\n\n\n<p>Int\u00e9grez votre code SQL dans un outil d&#039;analyse statique de lignage. SQLFlow vous permet de coller du code SQL, d&#039;importer des fichiers, de vous connecter \u00e0 une base de donn\u00e9es via JDBC, d&#039;importer un manifeste dbt ou d&#039;ing\u00e9rer l&#039;historique des requ\u00eates Snowflake ou les journaux de requ\u00eates Redshift. Il analyse le code et g\u00e9n\u00e8re des diagrammes interactifs au niveau des colonnes, ainsi que des exportations JSON\/CSV et une API REST. Les d\u00e9ploiements en entreprise permettent d&#039;analyser par lots des environnements de plus de 100 bases de donn\u00e9es et plus d&#039;un million de colonnes.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">L&#039;\u00e9tablissement d&#039;une lign\u00e9e n\u00e9cessite-t-il l&#039;acc\u00e8s \u00e0 mes donn\u00e9es r\u00e9elles\u00a0?<\/h3>\n\n\n<p>L&#039;analyse statique ne suffit pas. L&#039;analyse syntaxique du SQL n\u00e9cessite le code et, \u00e9ventuellement, les m\u00e9tadonn\u00e9es du sch\u00e9ma (d\u00e9finitions des tables et des colonnes)\u00a0; jamais les lignes de vos tables. L&#039;\u00e9dition sur site de SQLFlow conserve en outre le texte SQL lui-m\u00eame au sein de votre r\u00e9seau, ce qui la rend id\u00e9ale pour les banques et autres environnements r\u00e9glement\u00e9s.<\/p>\n\n\n\n<div class=\"wp-block-group alignfull gd-band gd-band-navy gd-cta is-layout-constrained\" style=\"padding-top:56px;padding-bottom:56px\"><div class=\"wp-block-group__inner-container\">\n\n<h2 class=\"wp-block-heading\">D\u00e9couvrez la lign\u00e9e cach\u00e9e dans votre SQL<\/h2>\n\n\n<p>Collez une requ\u00eate dans le visualiseur gratuit et obtenez imm\u00e9diatement un diagramme de lignage au niveau des colonnes, ou explorez la version compl\u00e8te <a href=\"https:\/\/www.gudusoft.com\/fr\/outil-de-lignee-de-donnees-sql\/\">Outil de tra\u00e7abilit\u00e9 des donn\u00e9es SQL<\/a> pour la num\u00e9risation de l&#039;ensemble du domaine.<\/p>\n\n\n<div class=\"wp-block-buttons is-layout-flex\">\n<div class=\"wp-block-button\"><a class=\"wp-block-button__link wp-element-button\" href=\"https:\/\/sqlflow.gudusoft.com\/?utm_source=gudusoft&amp;utm_medium=website&amp;utm_campaign=what-is-data-lineage\" target=\"_blank\" rel=\"noreferrer noopener\">Essayez SQLFlow gratuitement<\/a><\/div>\n<\/div>\n\n<\/div><\/div>\n\n\n\n<script type=\"application\/ld+json\">{\n    \"@context\": \"https:\\\/\\\/schema.org\",\n    \"@graph\": [\n        {\n            \"@type\": \"TechArticle\",\n            \"headline\": \"What Is Data Lineage? Definition, Examples, and How It Works\",\n            \"description\": \"A practitioner's definition of data lineage: provenance vs impact analysis, table-level vs column-level granularity, direct vs indirect lineage, and the three ways lineage is built (static SQL analysis, runtime logs, manual documentation).\",\n            \"url\": \"https:\\\/\\\/www.gudusoft.com\\\/what-is-data-lineage\\\/\",\n            \"author\": {\n                \"@type\": \"Organization\",\n                \"name\": \"Gudu Software\",\n                \"url\": \"https:\\\/\\\/www.gudusoft.com\\\/\"\n            },\n            \"publisher\": {\n                \"@type\": \"Organization\",\n                \"name\": \"Gudu Software\",\n                \"url\": \"https:\\\/\\\/www.gudusoft.com\\\/\"\n            }\n        },\n        {\n            \"@type\": \"FAQPage\",\n            \"mainEntity\": [\n                {\n                    \"@type\": \"Question\",\n                    \"name\": \"What is data lineage in simple terms?\",\n                    \"acceptedAnswer\": {\n                        \"@type\": \"Answer\",\n                        \"text\": \"It is the map of where your data comes from and where it goes: which sources feed each table or report, and what transformations happen in between. Think of it as a dependency graph for data, traversable backward (provenance) and forward (impact analysis).\"\n                    }\n                },\n                {\n                    \"@type\": \"Question\",\n                    \"name\": \"What is the difference between data lineage and data provenance?\",\n                    \"acceptedAnswer\": {\n                        \"@type\": \"Answer\",\n                        \"text\": \"Provenance is the backward trace from one output to its origins. Lineage is the whole dependency graph, which supports provenance in one direction and impact analysis in the other. In everyday usage the terms overlap, but the graph-versus-traversal distinction is the precise one.\"\n                    }\n                },\n                {\n                    \"@type\": \"Question\",\n                    \"name\": \"What is indirect data lineage?\",\n                    \"acceptedAnswer\": {\n                        \"@type\": \"Answer\",\n                        \"text\": \"Indirect lineage covers columns that influence a result without appearing in it, such as columns used in WHERE filters, JOIN conditions, and GROUP BY clauses. They change every output value, so impact analysis that ignores them is incomplete. Gudu SQLFlow models indirect lineage as a separate, toggleable relationship type; most lineage tools do not make the distinction.\"\n                    }\n                },\n                {\n                    \"@type\": \"Question\",\n                    \"name\": \"Is data lineage required for GDPR or BCBS 239 compliance?\",\n                    \"acceptedAnswer\": {\n                        \"@type\": \"Answer\",\n                        \"text\": \"Neither framework names lineage as a mandatory technology, but both require what lineage provides: BCBS 239 asks banks to show how risk data is aggregated from its sources, and GDPR data mapping requires knowing where personal data flows. Column-level lineage is the standard way to produce that evidence at scale.\"\n                    }\n                },\n                {\n                    \"@type\": \"Question\",\n                    \"name\": \"How do you create data lineage automatically?\",\n                    \"acceptedAnswer\": {\n                        \"@type\": \"Answer\",\n                        \"text\": \"Feed your SQL to a static-analysis lineage tool. With Gudu SQLFlow you can paste SQL, upload files, connect a database over JDBC, import a dbt manifest, or ingest Snowflake query history or Redshift query logs; it parses the code and produces interactive column-level diagrams plus JSON\\\/CSV exports and a REST API. Enterprise deployments batch-scan estates of 100+ databases and over a million columns.\"\n                    }\n                },\n                {\n                    \"@type\": \"Question\",\n                    \"name\": \"Does building lineage require access to my actual data?\",\n                    \"acceptedAnswer\": {\n                        \"@type\": \"Answer\",\n                        \"text\": \"Not with static analysis. Parsing SQL requires the code and, optionally, schema metadata (table and column definitions), never the rows in your tables. SQLFlow's On-Premise edition additionally keeps the SQL text itself inside your network, which is why it fits banks and other regulated environments.\"\n                    }\n                }\n            ]\n        }\n    ]\n}<\/script>","protected":false},"excerpt":{"rendered":"<p>What is data lineage? Data lineage is the documented path data takes from its original sources to its final destinations, including every table, view, job, and transformation it passes through along the way. It answers two questions every data team asks: &#8220;Where did this value come from?&#8221; (provenance) and &#8220;What depends on it downstream?&#8221; (impact analysis). In SQL-based systems, lineage is usually extracted automatically by parsing the SQL code that moves and reshapes the data. 39SQL dialects, each a dedicated parser Column-levelgranularity, not just table-level Direct + indirectlineage relationships Staticanalysis, never reads table data This page is a working definition\u2026<\/p>","protected":false},"author":1,"featured_media":0,"parent":0,"menu_order":0,"comment_status":"closed","ping_status":"closed","template":"","meta":[],"blocksy_meta":{"styles_descriptor":{"styles":{"desktop":"","tablet":"","mobile":""},"google_fonts":[],"version":5}},"_links":{"self":[{"href":"https:\/\/www.gudusoft.com\/fr\/wp-json\/wp\/v2\/pages\/6747"}],"collection":[{"href":"https:\/\/www.gudusoft.com\/fr\/wp-json\/wp\/v2\/pages"}],"about":[{"href":"https:\/\/www.gudusoft.com\/fr\/wp-json\/wp\/v2\/types\/page"}],"author":[{"embeddable":true,"href":"https:\/\/www.gudusoft.com\/fr\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/www.gudusoft.com\/fr\/wp-json\/wp\/v2\/comments?post=6747"}],"version-history":[{"count":1,"href":"https:\/\/www.gudusoft.com\/fr\/wp-json\/wp\/v2\/pages\/6747\/revisions"}],"predecessor-version":[{"id":6821,"href":"https:\/\/www.gudusoft.com\/fr\/wp-json\/wp\/v2\/pages\/6747\/revisions\/6821"}],"wp:attachment":[{"href":"https:\/\/www.gudusoft.com\/fr\/wp-json\/wp\/v2\/media?parent=6747"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}