SQLFlow On-Premise: Linaje de datos SQL autohospedado

SQLFlow local es un establecimiento en las instalaciones herramienta de linaje de datosEl motor completo Gudu SQLFlow se implementa con Docker o Kubernetes dentro de su propia red. Analiza su código SQL (consultas, vistas, procedimientos almacenados, proyectos dbt, bases de datos completas) y genera diagramas de linaje interactivos a nivel de columna, mientras que cada línea de SQL permanece protegida por su firewall. Se ejecuta de forma totalmente aislada de la red y, dado que funciona mediante análisis estático del código SQL, nunca accede a las filas de sus tablas.

Separado de aireDocker o Kubernetes, sin conexión a internet saliente.
39Dialectos SQL, cada uno con un analizador sintáctico dedicado.
CeroSQL sale de su infraestructura
100+bases de datos por propiedad, escaneos incrementales

¿Quieres evaluar primero el motor? El mismo análisis se ejecuta en SQLFlow Cloud, gratis en tu navegador.: Pegue una consulta no confidencial e inspeccione la salida a nivel de columna antes de hablar con el departamento de compras.

Por qué los equipos regulados necesitan una herramienta de linaje de datos local

El texto SQL es sensible incluso cuando no tiene datos adjuntos. Su DDL expone el esquema completo; sus vistas y procedimientos codifican la lógica empresarial, como los modelos de riesgo, precios reglas y filtros de fraude; y SQL ad hoc frecuentemente incrusta valores literales: números de cuenta en un DÓNDE cláusula, identificadores de pacientes en una consulta de depuración. Enviar ese corpus a un proveedor de SaaS es precisamente el tipo de transferencia de datos a terceros que las revisiones de seguridad en bancos, proveedores de atención médica y agencias gubernamentales existen para evitar.

Al mismo tiempo, esas son las organizaciones que están bajo mayor presión para generar trazabilidad: BCBS 239 espera que los bancos rastreen las cifras de riesgo hasta sus fuentes, el mapeo de datos del RGPD pregunta qué campos fluyen hacia dónde, y los auditores de SOX quieren procedencia para los informes financieros. La solución a la contradicción es ejecutar el motor de trazabilidad donde ya reside el SQL. Para eso sirve SQLFlow On-Premise: el mismo análisis descrito en nuestra Descripción general de la herramienta de linaje de datos SQL, autoalojado.

Cómo funciona el despliegue: Docker, Kubernetes, sin conexión a internet.

SQLFlow On-Premise se distribuye como contenedores. Implemente con Docker en un único host o en su clúster de Kubernetes si así es como su equipo de plataforma ejecuta el software. La licencia cubre la instalación en dos servidores, por lo que una instancia de producción más una instancia de prueba o de recuperación ante desastres no tiene costo adicional. Las guías de instalación paso a paso se mantienen en docs.gudusoft.com.

La implementación funciona en una red totalmente aislada: el motor no depende de la nube y no necesita conexión a internet para analizar SQL. Si su entorno es una red clasificada o una zona de pago sin rutas de salida, SQLFlow seguirá funcionando. Los usuarios acceden a él a través de la interfaz web dentro de la red, y la misma instancia expone una API REST para la automatización.

La postura de privacidad: solo análisis estático

El modelo de privacidad de SQLFlow es sencillo de explicar a un revisor de seguridad porque tiene dos propiedades fundamentales. Primero, es un analizador estático: calcula el linaje analizando el código SQL, no observando las consultas en tiempo de ejecución ni muestreando tablas, por lo que nunca lee los datos de las filas; no existe ninguna ruta de código que lo haga. Segundo, con la edición On-Premise, el texto SQL en sí nunca sale de su red. Lo que SQLFlow lee opcionalmente a través de JDBC son los metadatos del esquema (definiciones de tablas, columnas y vistas), que necesita para resolver. SELECCIONAR * y consultar las referencias con precisión.

Compárese esto con los enfoques de linaje basados en registros de ejecución, que son realmente buenos para capturar lo que se ejecutó en producción, pero requieren acceso continuo a los registros de consultas y solo pueden ver las consultas que se ejecutaron. El análisis estático abarca el código existente, incluidos los procedimientos que solo se ejecutan al final del trimestre, y solo necesita el propio SQL.

Lo que hace el motor

La versión local ejecuta el motor SQLFlow completo, el mismo que se encuentra en SQLFlow Cloud. Está basado en el analizador SQL general, un compilador SQL comercial desarrollado desde mediados de la década de 2000 y validado con aproximadamente 13 600 conjuntos de pruebas por dialecto.

  • Linaje a nivel de columna: Para cada columna de salida, se especifican las columnas de origen exactas que la alimentan, así como las funciones, conversiones, subconsultas, uniones y operadores de conjuntos que se utilizan en el proceso, resueltos mediante CTEs, vistas y expansión en estrella.
  • Linaje directo versus indirecto: columnas utilizadas en DÓNDE, UNIRSE, y AGRUPACIÓN POR Las cláusulas dan forma a los resultados sin aparecer en ellos. SQLFlow modela esta influencia como un tipo de relación independiente y configurable, una distinción que la mayoría de las herramientas de la competencia no hacen.
  • 39 analizadores sintácticos específicos para cada dialecto: Oracle, SQL Server, Teradata, DB2, Snowflake, BigQuery, Redshift, Databricks, PostgreSQL, Hive y 29 más: gramáticas específicas para cada dialecto, no un analizador ANSI genérico.
  • Procedimientos almacenados y SQL dinámico: Los analizadores procedimentales específicos para Oracle PL/SQL y SQL Server T-SQL rastrean el linaje a través de parámetros y tablas temporales, resuelven SQL dinámico y generan un gráfico de llamadas interactivo de invocaciones de procedimiento a procedimiento.
  • Diagramas ER a partir de DDL: Relaciones de clave primaria/clave externa inferidas a partir de su consulta SQL, representadas como un diagrama entidad-relación.
  • consulta de linaje de IA (desde la versión 8.2.3): formular preguntas en lenguaje sencillo; cada tabla y columna que cita la IA se valida con respecto al gráfico analizado antes de mostrarse.

La profundidad de los procedimientos almacenados es de suma importancia precisamente en los entornos que compran soluciones locales. Los sistemas bancarios y sanitarios heredados se ejecutan en paquetes PL/SQL y T-SQL repletos de patrones como este:

CREATE PROCEDURE dbo.load_regional_summary AS BEGIN DECLARE @sql nvarchar(max) = N'INSERT INTO rpt.daily_summary (region, total_amount) SELECT region, SUM(amount) FROM stg.sales_daily GROUP BY region'; EXEC sp_executesql @sql; END

El linaje aquí reside dentro de una cadena que solo se ejecuta en tiempo de ejecución. SQLFlow resuelve el SQL dinámico y se conecta. rpt.resumen_diario.cantidad_total volver a stg.ventas_diarias.cantidadLas herramientas que omiten el SQL dinámico no informan absolutamente nada, lo cual en una auditoría es peor que un error.

Diseñado para grandes propiedades, no para consultas individuales.

Las implementaciones empresariales escanean por lotes conjuntos de más de 100 bases de datos y más de un millón de columnas en un repositorio de linaje persistente. Los escaneos incrementales procesan solo los cambios, por lo que la actualización diaria de un conjunto grande de datos no implica volver a analizarlo todo. Las entradas incluyen metadatos de bases de datos en tiempo real a través de JDBC, archivos SQL cargados, manifiestos dbt, historial de consultas de Snowflake, registros de consultas de Redshift y el extractor de metadatos Grabit; las salidas incluyen exportaciones en formato JSON, CSV y PNG, además de la API REST.

Si ya utiliza un catálogo de datos, SQLFlow no compite con él: lo alimenta. Las plataformas centradas en catálogos, como DataHub, Microsoft Purview y OpenMetadata, son buenos sistemas de registro para metadatos, propiedad y descubrimiento, pero dependen de un componente previo para calcular el linaje SQL preciso. SQLFlow On-Premise incluye adaptadores de exportación para las tres, por lo que puede funcionar como el motor de linaje detrás del catálogo que sus equipos ya utilizan. Para obtener una visión más amplia de cómo encajan las categorías, consulte nuestra Comparación de las mejores herramientas de linaje de datos.

Precios

SQLFlow On-Premise tiene un precio que varía según el tipo de base de datos (los dialectos SQL que seleccione para el análisis), no por usuario ni por fila analizada. Cada licencia incluye la instalación en dos servidores y admite 50 usuarios de forma predeterminada.

LicenciaSuscripciónUna sola vezIncluye
Licencia básica (un tipo de base de datos)$500/mes$4,800Dos servidores, 50 usuarios, motor completo, API REST, adaptadores de exportación de catálogo
Cada tipo de base de datos adicional+$100/mes+$1,000Añadido a la misma instalación

Así, una infraestructura que abarca Oracle, SQL Server y Snowflake cuesta $700/mes o $6,800 por única vez, una cifra que puede incluir en una solicitud de presupuesto sin una llamada de ventas. Los detalles completos están en el página de precios.

Implementación local frente a SQLFlow Cloud

Nube SQLFlowSQLFlow local
Dónde se correSoftware como servicio (SaaS) en sqlflow.gudusoft.comDocker/Kubernetes en su red, con capacidad de aislamiento físico.
¿Dónde va tu SQL?Analizado en servidores alojados por Gudu.Nunca abandona su infraestructura
PrecioNivel gratuito; premium $49,99/mes$500/mes o $4,800 pago único por tipo de base de datos
UsuariosPor cuenta50 usuarios por defecto
Lo mejor paraPersonas y equipos que desean establecer un linaje hoy en día.Bancos, atención médica, gobierno y cualquier entidad sujeta a normas de residencia de datos.

Ambas ediciones ejecutan el mismo analizador sintáctico y producen el mismo linaje. Un camino común es prototipar en Nube SQLFlow Con SQL depurado, confirme la calidad de la salida en sus procedimientos más complejos y, a continuación, pase a la implementación local para el sector inmobiliario.

Mantén el motor de Lineage detrás de tu firewall.

Díganos qué tipo de base de datos tiene y el tamaño de su infraestructura, y diseñaremos un plan de implementación; o bien, probaremos primero el motor con SQL depurado en el nivel gratuito de la nube.

Preguntas frecuentes

¿Puede SQLFlow On-Premise funcionar de forma totalmente aislada de la red?

Sí. Se implementa como contenedores Docker o Kubernetes y funciona sin conexión a internet saliente ni dependencia de la nube en la ruta de análisis.

¿SQLFlow lee alguna vez los datos de mis tablas?

No. SQLFlow es un analizador estático: el linaje se calcula analizando el código SQL. Opcionalmente, lee los metadatos del esquema (definiciones de tablas, columnas y vistas) a través de JDBC, pero nunca lee los datos de las filas, y en la versión local, el texto SQL permanece dentro de su red.

¿Cuánto cuesta SQLFlow On-Premise?

$500/mes o $4,800 pago único por cada tipo de base de datos seleccionado, que cubre la instalación en dos servidores y 50 usuarios por defecto. Cada tipo de base de datos adicional cuesta +$100/mes o +$1,000 pago único en la misma instalación.

¿Cuántos usuarios admite una licencia?

50 usuarios por defecto por licencia. Para equipos más grandes, contacto Gudu Software para dimensionar la implementación.

¿Qué bases de datos puede analizar SQLFlow On-Premise?

39 dialectos, cada uno con su propio analizador: Oracle, SQL Server, Teradata, DB2, Sybase, Informix, PostgreSQL, MySQL, Snowflake, BigQuery, Redshift, Databricks, Hive, Spark SQL y más. La licencia es por tipo de base de datos, por lo que solo paga por los dialectos que utiliza.

¿Puede incorporar información de linaje a nuestro catálogo de datos existente?

Sí. Se incluyen adaptadores de exportación para DataHub, Microsoft Purview y OpenMetadata, junto con la exportación en formato JSON y CSV y una API REST para integraciones personalizadas.

Incorpore el linaje de datos a su red.

Indíquenos la combinación de bases de datos y el tamaño de su infraestructura, y diseñaremos un plan de implementación; o bien, puede comenzar con las guías de instalación y configurarlo usted mismo.