Outil de traçabilité des données SQL : Traçabilité automatisée au niveau des colonnes

Gudu SQLFlow est automatisé Outil de traçabilité des données SQLFournissez-lui votre code SQL (requêtes, procédures stockées, projets dbt ou une base de données entière) et il génère une interface interactive. traçabilité des données au niveau des colonnes Un diagramme qui indique précisément la provenance et la destination de chaque donnée. Aucun agent à installer, aucun mappage manuel, aucun tableur.

39Les dialectes SQL, chacun avec un analyseur syntaxique dédié
Niveau de colonnepas seulement une filiation de table en table
13,000+des fixtures de régression SQL réelles
Zéroaccès à vos données — analyse statique uniquement

Essayez en 30 secondes : collez n'importe quelle requête SQL dans le Visualiseur de lignées SQL en ligne gratuit Observez alors l'apparition du diagramme de lignage au niveau des colonnes. Aucune inscription n'est requise pour les exemples publics.

Qu'est-ce que la traçabilité des données SQL ?

La traçabilité des données SQL est la représentation graphique du parcours et des transformations des données au sein de votre code SQL : quelles tables et colonnes sources alimentent chaque table, vue ou rapport cible, et quelles opérations sont effectuées sur les données tout au long de ce parcours (jointures, filtres, agrégations, conversions et appels de fonctions). La traçabilité répond à deux questions que se posent quotidiennement toutes les équipes de données : « D’où vient ce nombre ? » (provenance) et « Qu’est-ce qui va se casser si je modifie cette colonne ? » (analyse d'impact).

La plupart des transformations de données dans un entrepôt de données s'effectuent en SQL (vues, procédures stockées, scripts ETL, modèles dbt, requêtes planifiées). L'analyse statique de ce code SQL est donc la méthode la plus précise et la moins intrusive pour établir la traçabilité des données. SQLFlow réalise précisément cela : il effectue une analyse statique de votre code SQL, sans jamais avoir besoin d'accéder à vos données, et capture les informations que les approches basées sur les journaux d'exécution ne détectent pas.

Comment fonctionne SQLFlow

  1. Ingestion SQL. Collez du SQL, téléchargez des fichiers, connectez-vous à une base de données via JDBC pour extraire des définitions DDL et afficher des définitions, importez un manifeste dbt ou alimentez l'historique des requêtes d'entrepôt (l'historique des requêtes Snowflake et les journaux de requêtes Redshift sont pris en charge nativement).
  2. Analyser et décortiquer. SQLFlow est construit sur le Analyseur SQL général (GSP)GSP est un compilateur SQL commercial, développé depuis le milieu des années 2000 et validé sur plus de 13 000 jeux de données SQL par dialecte. Il construit un modèle sémantique complet de votre requête SQL, résolvant chaque référence de colonne via les CTE, les sous-requêtes, les vues et l'expansion en étoile. Son analyseur de flux de données extrait ensuite les relations source-cible au niveau de la colonne.
  3. Visualisez et exportez. Le résultat est un diagramme interactif que vous pouvez explorer en détail, suivre en amont et en aval de n'importe quelle colonne, et exporter au format JSON, CSV ou PNG — ou interroger par programmation via l'API REST.

Traçabilité au niveau des colonnes, et pas seulement au niveau des tables

La lignée au niveau de la table vous indique que rapport_revenus est construit à partir de ordres et clientsLa lignée au niveau des colonnes vous indique que rapport_revenu.total est calculé comme SOMME(commandes.montant) filtré par statut des commandes, a rejoint le clients.id — et ça clients.email n'y joue aucun rôle. C'est cette différence qui rend la filiation exploitable :

  • Analyse d'impact avant une modification de schéma : identifier tous les rapports en aval qu'une colonne alimente réellement, au lieu de tous les rapports qui ne font que consulter la même table.
  • Analyse des causes profondes d'un nombre erroné : remonter d'une colonne de sortie à ses véritables sources en passant par chaque transformation.
  • Conformité et audit : prouver exactement quels champs sources alimentent une sortie réglementée — le niveau de granularité attendu par les cadres de cartographie des données tels que BCBS 239 et le RGPD.

SQLFlow sépare en outre lignée directe depuis lignée indirecte (d'impact)Une colonne utilisée dans un clause, REJOINDRE condition, ou GROUPER PAR Ces données n'apparaissent jamais dans le résultat final, mais elles l'influencent considérablement. SQLFlow modélise ces relations comme un type de relation distinct et activable, permettant ainsi de visualiser le flux de données pur ou l'impact complet ; la plupart des outils de traçabilité ne font pas cette distinction.

39 bases de données prises en charge

SQLFlow fournit des analyseurs syntaxiques spécifiques à chaque dialecte — et non une grammaire ANSI générique — pour 39 bases de données et moteurs de requêtes :

Catégoriebases de données
Entrepôts de données cloudSnowflake, Google BigQuery, Amazon Redshift, Databricks, Azure SQL, Amazon Athena
SGBDR traditionnelOracle, SQL Server, MySQL, PostgreSQL, IBM DB2, Sybase, Informix, SQLite, EDB Postgres
MPP et analysesTeradata, Netezza, Greenplum, Vertica, SAP HANA, ClickHouse, DuckDB, Doris, StarRocks
Moteurs de requêtes et de mégadonnéesHive, Impala, Spark SQL, Presto, Trino, Flink SQL
Autres plateformesCouchbase, Salesforce SOQL, Power Query M, OpenEdge, ODBC, Dameng, GaussDB, OceanBase, MDX

La prise en charge des dialectes s'étend progressivement : EDB Postgres, Dameng, OceanBase et Power Query M ont tous été ajoutés en 2026. Si votre dialecte n'est pas répertorié, Demandez-nousDe nouveaux dialectes sont ajoutés à la demande des clients.

Procédures stockées, SQL dynamique et dbt

Les entrepôts de données réels ne se résument pas à de simples instructions SELECT. SQLFlow analyse les aspects les plus complexes :

  • Procédures stockées : Des grammaires procédurales dédiées pour Oracle PL/SQL et SQL Server T-SQL permettent de suivre la lignée des procédures à travers leurs corps, paramètres et tables temporaires, et de générer une interface interactive. graphe d'appel quelles procédures invoquent lesquelles.
  • SQL dynamique : Le code SQL assemblé à l'intérieur des procédures est résolu et analysé au lieu d'être ignoré — l'un des angles morts les plus courants des outils de traçabilité.
  • Projets de la dette publique : Importez un manifeste dbt et obtenez la traçabilité au niveau des colonnes de vos modèles, réconciliée avec l'entrepôt de données sur lequel il est déployé.
  • Diagrammes ER issus de SQL : SQLFlow déduit les relations de clés primaires/étrangères à partir du DDL et dessine le diagramme entité-relation — utile lorsqu'il n'existe pas de documentation.

Posez vos questions sur votre lignée en anglais simple.

Depuis la version 8.2.3, SQLFlow intègre une requête de traçabilité basée sur l'IA : posez des questions comme « Quels rapports dépendent de l'adresse e-mail des clients ? » ou « Résumer le calcul du revenu total » Les réponses sont directement comparées au graphe de lignage. Elles s'appuient sur le graphe lui-même : chaque tableau et chaque colonne auxquels l'IA fait référence est validé par rapport au lignage analysé avant de vous être communiqués.

Choisissez votre déploiement

ÉditionIdéal pourComment ça marche
SQLFlow CloudLes personnes et les équipes qui souhaitent connaître leur lignée dès maintenantSaaS, niveau gratuit ; collez le code SQL ou connectez les sources dans le navigateur
SQLFlow sur siteBanques, soins de santé et environnements réglementésDocker/Kubernetes au sein de votre réseau — SQL ne quitte jamais votre infrastructure
API RESTAutomatisation du traçage des pipelines et des plateformesSurface d'analyse complète sous forme de points de terminaison JSON sur HTTP
widget JavaScriptIntégrer des diagrammes de lignage dans votre propre produitAPI JS de plus de 30 méthodes, s'intègre à n'importe quelle application web
Bibliothèque JavaIntégration de la lignée dans les applications JVMLe GSP DataFlowAnalyzer en tant que dépendance JAR

Les déploiements d'entreprise s'adaptent aux environnements de plus de 100 bases de données et de plus d'un million de colonnes, avec une analyse incrémentale, un référentiel de lignage persistant et des adaptateurs d'exportation pour DataHub, Microsoft Purview et OpenMetadata — afin que SQLFlow puisse servir de moteur de traçabilité au sein du catalogue que vous utilisez déjà.

Cessez de deviner d'où viennent vos données

Collez une requête et observez l'affichage de sa lignée au niveau des colonnes — gratuit, sans inscription pour les exemples publics.

Quelles équipes utilisent SQLFlow pour

  • Analyse d'impact : Identifiez tous les utilisateurs en aval d'une colonne avant de la renommer, de la retaper ou de la supprimer.
  • Débogage des problèmes de données : Retracer un numéro erroné dans un tableau de bord, en parcourant chaque vue et procédure jusqu'à son origine, ne prend que quelques minutes au lieu de plusieurs jours.
  • Conformité réglementaire : produire une documentation de provenance au niveau des colonnes pour BCBS 239, RGPD, SOX et l'audit interne.
  • Planification des migrations : Cartographiez le véritable graphe de dépendances avant de passer d'Oracle ou Teradata à Snowflake, BigQuery ou Databricks, et vérifiez qu'aucun élément n'est orphelin par la suite.
  • Gouvernance des données : Intégrez des données de traçabilité précises et mises à jour automatiquement dans votre catalogue de données au lieu de les gérer manuellement.

Comment SQLFlow se compare-t-il aux solutions open source ?

Les analyseurs syntaxiques open source s'arrêtent là où le SQL de production devient complexe. Des projets comme SQL Lineage (Python) et sqlglot Ces outils sont performants pour analyser des requêtes individuelles et, pour les instructions SELECT/INSERT simples, ils peuvent suffire. Leurs limites apparaissent cependant avec du code de production réel : procédures stockées et SQL dynamique, syntaxe spécifique à chaque dialecte sur des dizaines de moteurs, expansion en étoile et résolution de vues nécessitant des métadonnées de base de données, traçabilité indirecte via des filtres et des jointures, et visualisation (et non simple extraction) de la traçabilité à l'échelle de milliers de scripts. L'analyseur de SQLFlow est développé commercialement depuis près de vingt ans sur un corpus de régression de plus de 13 000 exemples de requêtes SQL réelles ; c'est cette expertise approfondie du SQL complexe qui justifie son prix. Pour une évaluation, exécutez votre procédure stockée la plus complexe avec les deux outils et comparez les résultats.

Foire aux questions

SQLFlow a-t-il besoin d'accéder à mes données ?

Non. SQLFlow effectue une analyse statique du code SQL et peut lire les métadonnées du schéma (définitions des tables et des colonnes). Il ne lit jamais les lignes de vos tables. Avec l'édition sur site, même votre code SQL reste au sein de votre réseau.

Existe-t-il une version gratuite ?

Oui. SQLFlow Cloud Il existe une version gratuite : collez votre code SQL et obtenez des diagrammes de lignage au niveau des colonnes directement dans votre navigateur. Les versions payantes offrent des options supplémentaires : capacité de traitement plus importante, accès à l’API et fonctionnalités collaboratives.

SQLFlow peut-il analyser les procédures stockées ?

Oui, c'est l'une de ses plus grandes forces. Oracle PL/SQL et SQL Server T-SQL disposent d'analyseurs syntaxiques procéduraux dédiés. SQLFlow retrace la lignée des instructions à travers les paramètres de procédure, les tables temporaires et le SQL dynamique, et dessine le graphe d'appels entre les procédures.

En quoi la traçabilité au niveau des colonnes diffère-t-elle de la traçabilité au niveau des tables ?

La traçabilité au niveau des tables indique quelles tables alimentent quelles autres. La traçabilité au niveau des colonnes indique, pour chaque colonne de sortie, les colonnes sources exactes qui l'alimentent et les transformations appliquées. C'est le niveau des colonnes qui permet d'obtenir des résultats précis, et non approximatifs, lors d'analyses d'impact et d'audits.

SQLFlow prend-il en charge dbt ?

Oui. Importez votre manifeste dbt et SQLFlow génère une traçabilité au niveau des colonnes de vos modèles dbt et peut réconcilier les modèles avec les objets d'entrepôt de données qu'ils créent.

Puis-je exporter la lignée vers DataHub, Purview ou OpenMetadata ?

Oui. Les déploiements en entreprise incluent des adaptateurs d'exportation pour DataHub, Microsoft Purview et OpenMetadata, ainsi que des exportations JSON et CSV et une API REST pour toute personnalisation.

Combien coûte SQLFlow ?

SQLFlow Cloud est gratuit au départ ; les comptes premium coûtent 49,99 £/mois. SQLFlow On-Premise coûte 500 £/mois ou 4 800 £ (paiement unique) par type de base de données sélectionné, et peut être installé sur deux serveurs. Voir tarification pour plus de détails.

Consultez dès maintenant la lignée de votre SQL

Saisissez votre requête dans le visualiseur gratuit ou contactez-nous pour que nous puissions analyser l'ensemble de votre propriété.