SQLFlow On-Premise : Traçabilité des données SQL auto-hébergée

SQLFlow sur site est sur place outil de lignée de donnéesGudu SQLFlow : le moteur complet, déployé avec Docker ou Kubernetes au sein de votre réseau. Il analyse votre code SQL (requêtes, vues, procédures stockées, projets dbt, bases de données complètes) et génère des diagrammes de lignage interactifs au niveau des colonnes, tandis que chaque ligne de SQL reste protégée par votre pare-feu. Fonctionnant en mode totalement isolé du réseau, et grâce à l'analyse statique du code SQL, il n'accède jamais aux lignes de vos tables.

EntreferDocker ou Kubernetes, pas d'accès Internet sortant
39Les dialectes SQL, chacun avec un analyseur syntaxique dédié
ZéroSQL quitte votre infrastructure
100+bases de données par domaine, analyses incrémentales

Vous souhaitez d'abord évaluer le moteur ? L'analyse identique s'exécute dans SQLFlow Cloud, gratuit dans votre navigateur: collez une requête non sensible et examinez le résultat au niveau des colonnes avant de contacter le service des achats.

Pourquoi les équipes soumises à des réglementations ont besoin d'un outil de traçabilité des données sur site

Le texte SQL est sensible même lorsqu'aucune donnée n'y est associée. Votre DDL expose le schéma complet ; vos vues et procédures encodent la logique métier, comme les modèles de risque, tarification règles et filtres anti-fraude ; et le SQL ad hoc intègre fréquemment des valeurs littérales : numéros de compte dans un Dans une requête de débogage, les identifiants des patients sont inclus dans une clause. L'envoi de ces données à un fournisseur SaaS correspond précisément au type de transfert de données tiers que les contrôles de sécurité effectués par les banques, les établissements de santé et les agences gouvernementales visent à empêcher.

Parallèlement, ce sont ces mêmes organisations qui subissent le plus de pression pour produire une traçabilité : la norme BCBS 239 exige des banques qu'elles retracent les données de risque jusqu'à leurs sources, le RGPD exige une cartographie des données précisant quels champs sont suivis et où, et les auditeurs SOX exigent la provenance des données pour les rapports financiers. La solution à cette contradiction consiste à exécuter le moteur de traçabilité là où se trouve déjà le SQL. C'est précisément le rôle de SQLFlow On-Premise : effectuer la même analyse que celle décrite sur notre site. Présentation de l'outil de traçabilité des données SQL, auto-hébergé.

Fonctionnement du déploiement : Docker, Kubernetes, environnement isolé (ou air-gapped)

SQLFlow On-Premise est distribué sous forme de conteneurs. Déployez-le avec Docker sur un hôte unique ou sur votre cluster Kubernetes si votre équipe plateforme utilise cette architecture. La licence couvre l'installation sur deux serveurs ; ainsi, une instance de production et une instance de préproduction ou de reprise après sinistre ne coûtent rien de plus. Des guides d'installation détaillés sont disponibles à l'adresse suivante : docs.gudusoft.com.

Le déploiement fonctionne dans un réseau totalement isolé du réseau physique : le moteur est indépendant du cloud et n’a pas besoin de connexion Internet sortante pour analyser les requêtes SQL. Même dans un environnement de réseau classifié ou une zone de paiement sans accès Internet sortant, SQLFlow reste opérationnel. Les utilisateurs y accèdent via l’interface web interne au réseau, et la même instance expose une API REST pour l’automatisation.

Le point de vue sur la confidentialité : analyse statique uniquement

Le modèle de confidentialité de SQLFlow est simple à expliquer à un auditeur de sécurité car il repose sur deux propriétés essentielles. Premièrement, il s'agit d'un analyseur statique : il calcule la lignée en analysant le code SQL, et non en observant les requêtes à l'exécution ou en échantillonnant les tables. Par conséquent, il ne lit jamais les données des lignes ; aucun chemin d'exécution ne le fait. Deuxièmement, avec l'édition sur site, le texte SQL lui-même ne quitte jamais votre réseau. SQLFlow peut lire, via JDBC, les métadonnées du schéma (définitions des tables, des colonnes et des vues) dont il a besoin pour résoudre les problèmes. SÉLECTIONNER * et consulter les références avec précision.

Comparons cela aux méthodes de traçabilité basées sur les journaux d'exécution, qui sont très efficaces pour capturer ce qui a été réellement exécuté en production, mais qui nécessitent un accès permanent aux journaux de requêtes et ne permettent de visualiser que les requêtes exécutées. L'analyse statique, quant à elle, couvre le code existant, y compris les procédures qui ne s'exécutent qu'en fin de trimestre, et ne requiert que le code SQL lui-même.

Ce que fait le moteur

L'environnement sur site exécute l'intégralité du moteur SQLFlow, le même que celui utilisé par SQLFlow Cloud. Il repose sur le General SQL Parser, un compilateur SQL commercial développé depuis le milieu des années 2000 et validé à l'aide d'environ 13 600 jeux de tests par dialecte.

  • Lignée au niveau de la colonne : pour chaque colonne de sortie, les colonnes sources exactes qui l'alimentent et les fonctions, conversions, sous-requêtes, jointures et opérateurs d'ensembles en cours de route — résolus via des CTE, des vues et l'expansion en étoile.
  • Lignée directe ou indirecte : colonnes utilisées dans , REJOINDRE, et GROUPER PAR Les clauses influencent les résultats sans y figurer explicitement. SQLFlow modélise cette influence comme un type de relation distinct et activable, une distinction que la plupart des outils concurrents ne font pas.
  • 39 analyseurs syntaxiques spécifiques à chaque dialecte : Oracle, SQL Server, Teradata, DB2, Snowflake, BigQuery, Redshift, Databricks, PostgreSQL, Hive et 29 autres — des grammaires dédiées par dialecte, et non un analyseur ANSI générique.
  • Procédures stockées et SQL dynamique : Des analyseurs procéduraux dédiés pour Oracle PL/SQL et SQL Server T-SQL permettent de retracer la lignée à travers les paramètres et les tables temporaires, de résoudre le SQL dynamique et de générer un graphe d'appels interactif des invocations de procédure à procédure.
  • Diagrammes ER issus de DDL : Relations clés primaires/étrangères déduites de votre requête SQL, représentées sous forme de diagramme entité-relation.
  • requête de lignée IA (depuis la v8.2.3) : posez des questions en anglais clair ; chaque tableau et colonne cités par l'IA sont validés par rapport au graphique analysé avant d'être affichés.

La profondeur des procédures stockées est cruciale, notamment dans les environnements privilégiant les solutions sur site. Les systèmes bancaires et de santé traditionnels fonctionnent avec des packages PL/SQL et T-SQL riches en modèles de ce type :

CREATE PROCEDURE dbo.load_regional_summary AS BEGIN DECLARE @sql nvarchar(max) = N'INSERT INTO rpt.daily_summary (region, total_amount) SELECT region, SUM(amount) FROM stg.sales_daily GROUP BY region'; EXEC sp_executesql @sql; END

La lignée réside ici dans une chaîne de caractères qui ne s'exécute qu'à l'exécution. SQLFlow résout le SQL dynamique et établit les connexions. rpt.daily_summary.total_amount retour à stg.ventes_daily.montant; les outils qui ignorent le SQL dynamique ne signalent absolument rien, ce qui, lors d'un audit, est pire qu'une erreur.

Conçu pour les domaines, pas pour les requêtes individuelles.

Les déploiements d'entreprise effectuent des analyses par lots de plus de 100 bases de données et de plus d'un million de colonnes vers un référentiel de lignage persistant. Les analyses incrémentales traitent ensuite uniquement les données modifiées, de sorte que la mise à jour nocturne d'un vaste parc de bases de données n'implique pas de réanalyser l'intégralité des données. Les entrées comprennent les métadonnées de base de données en temps réel via JDBC, les fichiers SQL téléchargés, les manifestes dbt, l'historique des requêtes Snowflake, les journaux de requêtes Redshift et l'extracteur de métadonnées Grabit ; les sorties incluent l'exportation aux formats JSON, CSV et PNG, ainsi que l'API REST.

Si vous utilisez déjà un catalogue de données, SQLFlow ne le remplace pas : il l’alimente. Les plateformes centrées sur le catalogue, telles que DataHub, Microsoft Purview et OpenMetadata, constituent d’excellents systèmes d’enregistrement pour les métadonnées, la propriété et la découverte, mais elles dépendent d’un système en amont pour calculer la traçabilité SQL précise. SQLFlow On-Premise inclut des adaptateurs d’exportation pour ces trois systèmes, ce qui lui permet de servir de moteur de traçabilité pour le catalogue que vos équipes utilisent déjà. Pour une vue d’ensemble de l’articulation des différentes catégories, consultez notre documentation. comparaison des meilleurs outils de traçabilité des données.

Tarification

SQLFlow On-Premise est facturé par type de base de données (les dialectes SQL sélectionnés pour l'analyse), et non par utilisateur ou par ligne analysée. Chaque licence inclut l'installation sur deux serveurs et prend en charge 50 utilisateurs par défaut.

LicenceAbonnementUne seule foisComprend
Licence de base (un type de base de données)$500/mois$4,800Deux serveurs, 50 utilisateurs, moteur complet, API REST, adaptateurs d'exportation de catalogue
Chaque type de base de données supplémentaire+$100/mois+$1,000Ajouté à la même installation

Ainsi, une infrastructure comprenant Oracle, SQL Server et Snowflake coûte $700 par mois ou $6 800 en une seule fois, un montant que vous pouvez inclure dans une demande de budget sans avoir à contacter un commercial. Tous les détails sont disponibles sur le site web. page de tarification.

Sur site vs SQLFlow Cloud

SQLFlow CloudSQLFlow sur site
Là où ça courtSaaS sur sqlflow.gudusoft.comDocker/Kubernetes sur votre réseau, compatible avec l'isolation physique
Où va votre SQLAnalyse effectuée sur des serveurs hébergés par GuduNe quitte jamais votre infrastructure
PrixFormule gratuite ; formule premium $49,99/mois$500/mois ou $4 800 en une seule fois par type de base de données
UtilisateursPar compte50 utilisateurs par défaut
Idéal pourLes personnes et les équipes qui souhaitent connaître leur lignée aujourd'huiLes banques, le secteur de la santé, les administrations publiques et tout domaine soumis aux règles de résidence des données

Les deux éditions utilisent le même analyseur syntaxique et produisent la même lignée. Une approche courante consiste à prototyper sur SQLFlow Cloud Avec du SQL nettoyé, confirmez la qualité des résultats de vos procédures les plus complexes, puis passez à une infrastructure sur site pour l'hébergement.

Gardez le moteur de lignage derrière votre pare-feu.

Indiquez-nous la composition et la taille de votre base de données, et nous définirons le périmètre d'un déploiement — ou bien, testez d'abord le moteur sur des données SQL nettoyées dans l'offre cloud gratuite.

Foire aux questions

SQLFlow On-Premise peut-il fonctionner en mode totalement isolé du réseau ?

Oui. Il se déploie sous forme de conteneurs Docker ou Kubernetes et fonctionne sans connexion Internet sortante ni dépendance au cloud dans le processus d'analyse.

Est-ce que SQLFlow lit jamais les données de mes tables ?

Non. SQLFlow est un analyseur statique : la traçabilité est calculée par l’analyse du code SQL. Il peut lire les métadonnées du schéma (définitions des tables, colonnes et vues) via JDBC, mais il ne lit jamais les données des lignes. En mode local, le texte SQL lui-même reste sur votre réseau.

Combien coûte SQLFlow On-Premise ?

$500/mois ou $4 800 en une seule fois par type de base de données sélectionné, couvrant par défaut l'installation sur deux serveurs et 50 utilisateurs. Chaque type de base de données supplémentaire coûte $100/mois ou $1 000 en une seule fois sur la même installation.

Combien d'utilisateurs une licence prend-elle en charge ?

50 utilisateurs par défaut par licence. Pour les équipes plus importantes, contact Gudu Software pour dimensionner le déploiement.

Quelles bases de données SQLFlow On-Premise peut-il analyser ?

39 dialectes, chacun avec son propre analyseur syntaxique : Oracle, SQL Server, Teradata, DB2, Sybase, Informix, PostgreSQL, MySQL, Snowflake, BigQuery, Redshift, Databricks, Hive, Spark SQL, et bien d’autres. La licence est par type de base de données ; vous ne payez donc que pour les dialectes utilisés dans votre environnement.

Peut-il intégrer l'historique des données à notre catalogue de données existant ?

Oui. Des adaptateurs d'exportation pour DataHub, Microsoft Purview et OpenMetadata sont inclus, ainsi que l'exportation JSON et CSV et une API REST pour les intégrations personnalisées.

Intégrez la traçabilité des données au sein de votre réseau.

Indiquez-nous la composition de votre base de données et la taille de votre parc informatique, et nous définirons le périmètre du déploiement ; ou bien, commencez par consulter les guides d’installation et mettez-le en place vous-même.