{"id":5110,"date":"2022-07-14T07:53:44","date_gmt":"2022-07-14T15:53:44","guid":{"rendered":"https:\/\/www.gudusoft.com\/?p=5110"},"modified":"2026-07-12T05:21:06","modified_gmt":"2026-07-12T13:21:06","slug":"best-open-source-data-lineage-tools","status":"publish","type":"post","link":"https:\/\/www.gudusoft.com\/pt\/melhores-ferramentas-de-linhagem-de-dados-de-codigo-aberto\/","title":{"rendered":"5 Melhores Ferramentas de Linhagem de Dados de C\u00f3digo Aberto"},"content":{"rendered":"<h2>5 melhores ferramentas de linhagem de dados de c\u00f3digo aberto para considerar em 2022<\/h2>\n<p>A ess\u00eancia de <a href=\"https:\/\/www.gudusoft.com\/pt\/o-que-e-governanca-de-dados\/\"><strong>governan\u00e7a de dados<\/strong><\/a> \u00e9 ajudar as empresas a criar pol\u00edticas de dados e garantir que as pessoas possam cumpri-las. Essas pol\u00edticas abordam uma s\u00e9rie de processos relacionados a dados, incluindo diretrizes para prote\u00e7\u00e3o, verifica\u00e7\u00e3o e uso de dados. <a href=\"https:\/\/www.gudusoft.com\/pt\/administradores-de-dados\/\"><strong>Administradores de dados<\/strong><\/a> deve solicitar requisitos de dados de usu\u00e1rios empresariais e trabalhar com os membros do conselho de governan\u00e7a de dados para concordar com defini\u00e7\u00f5es comuns de dados, especificar <a href=\"https:\/\/www.gudusoft.com\/pt\/como-melhorar-a-qualidade-dos-dados\/\"><strong>qualidade dos dados<\/strong><\/a> m\u00e9tricas, articular pol\u00edticas relevantes e desenvolver m\u00e9todos para medir a conformidade.<\/p>\n<figure id=\"attachment_5114\" aria-describedby=\"caption-attachment-5114\" style=\"width: 909px\" class=\"wp-caption alignnone\"><img decoding=\"async\" loading=\"lazy\" class=\"size-full wp-image-5114\" src=\"https:\/\/www.gudusoft.com\/wp-content\/uploads\/2022\/07\/Best_Open_Source_Data_Lineage_Tools.png\" alt=\"Melhores ferramentas de linhagem de dados de c\u00f3digo aberto\" width=\"909\" height=\"521\" srcset=\"https:\/\/www.gudusoft.com\/wp-content\/uploads\/2022\/07\/Best_Open_Source_Data_Lineage_Tools.png 909w, https:\/\/www.gudusoft.com\/wp-content\/uploads\/2022\/07\/Best_Open_Source_Data_Lineage_Tools-300x172.png 300w, https:\/\/www.gudusoft.com\/wp-content\/uploads\/2022\/07\/Best_Open_Source_Data_Lineage_Tools-768x440.png 768w, https:\/\/www.gudusoft.com\/wp-content\/uploads\/2022\/07\/Best_Open_Source_Data_Lineage_Tools-200x115.png 200w, https:\/\/www.gudusoft.com\/wp-content\/uploads\/2022\/07\/Best_Open_Source_Data_Lineage_Tools-400x229.png 400w, https:\/\/www.gudusoft.com\/wp-content\/uploads\/2022\/07\/Best_Open_Source_Data_Lineage_Tools-600x344.png 600w, https:\/\/www.gudusoft.com\/wp-content\/uploads\/2022\/07\/Best_Open_Source_Data_Lineage_Tools-800x459.png 800w\" sizes=\"(max-width: 909px) 100vw, 909px\" \/><figcaption id=\"caption-attachment-5114\" class=\"wp-caption-text\">Melhores ferramentas de linhagem de dados de c\u00f3digo aberto<\/figcaption><\/figure>\n<p>No entanto, construir uma ponte entre a defini\u00e7\u00e3o de pol\u00edticas de governan\u00e7a de dados e sua implementa\u00e7\u00e3o costuma ser um desafio formid\u00e1vel. O objetivo dessas estrat\u00e9gias \u00e9 controlar e monitorar a qualidade dos ativos de dados em todos os fluxos de trabalho de neg\u00f3cios, mas os gestores de dados, que t\u00eam responsabilidades essenciais na gest\u00e3o da qualidade dos dados, muitas vezes n\u00e3o s\u00e3o devidamente treinados ou qualificados. \u00c9 a\u00ed que entra a... <a href=\"https:\/\/www.dpriver.com\/blog\/2022\/05\/11\/best-data-lineage-tools\/\"><strong>ferramenta de linhagem de dados<\/strong><\/a> entra. Neste artigo, vamos apresentar<strong> 5 melhores ferramentas de c\u00f3digo aberto para linhagem de dados<\/strong> que podem ser encontrados no mercado de 2022.<\/p>\n<h3>Melhores ferramentas de linhagem de dados de c\u00f3digo aberto \u2013 1. Tokern<\/h3>\n<p><strong>Vis\u00e3o geral do Tokern:<\/strong><\/p>\n<p>Tokern foi desenvolvido para a nuvem. <strong><a href=\"https:\/\/www.gudusoft.com\/pt\/o-que-e-um-data-warehouse\/\">armaz\u00e9ns de dados<\/a><\/strong> e <strong><a href=\"https:\/\/www.gudusoft.com\/pt\/o-que-e-um-data-lake\/\">lagos de dados<\/a><\/strong>, and takes a dedicated approach to enabling you to obtain column-level data lineage from databases and data warehouses hosted on Google BigQuery, AWS Redshift, and Snowflake. In addition, more resources such as SparkSQL, AWS Athena, and Presto are in development. Tokenn has considerable integration capabilities because it works well with most of the open source data catalogs and ETL frameworks.<\/p>\n<p><strong>Caracter\u00edsticas da linhagem de dados Tokern: <\/strong><\/p>\n<p>O Token foi lan\u00e7ado h\u00e1 algum tempo e leva em considera\u00e7\u00e3o os mais recentes padr\u00f5es de engenharia e design de dados. Um exemplo disso \u00e9 que, al\u00e9m de construir <a href=\"https:\/\/www.gudusoft.com\/pt\/whats-data-lineage-why-important\/\"><strong>linhagem de dados<\/strong><\/a> A partir do DBCAT (diret\u00f3rio de dados), o Tokern tamb\u00e9m permite criar a linhagem de dados com base no hist\u00f3rico de consultas ou em scripts ETL, tornando-o ideal para integra\u00e7\u00e3o com ferramentas de BI e ETL. O Tokern armazena o cat\u00e1logo de dados e a linhagem em um banco de dados PostgreSQL. Os usu\u00e1rios podem acessar esse banco de dados para an\u00e1lises adicionais usando SQL ou integr\u00e1-lo a outros mecanismos de visualiza\u00e7\u00e3o e an\u00e1lise.<\/p>\n<p>O mecanismo de visualiza\u00e7\u00e3o Kedro-Viz e a biblioteca de an\u00e1lise de grafos de rede NetworkX s\u00e3o os respons\u00e1veis pelas excelentes capacidades de visualiza\u00e7\u00e3o e an\u00e1lise do Tokenn. Essas bibliotecas ajudam voc\u00ea a rastrear, visualizar e analisar dados de linhagem em n\u00edvel de coluna. Voc\u00ea tamb\u00e9m pode interagir com os dados de linhagem usando o SDK ou a API do Tokenn.<\/p>\n<p>Al\u00e9m de suas capacidades de linhagem de dados de \u00faltima gera\u00e7\u00e3o, o Tokern utiliza o PIICatcher para fornecer detec\u00e7\u00e3o de PII (Informa\u00e7\u00f5es de Identifica\u00e7\u00e3o Pessoal) e PHI (Informa\u00e7\u00f5es Pessoais de Sa\u00fade). A ferramenta integrada combina express\u00f5es regulares com diversas bibliotecas padr\u00e3o de PNL (Processamento de Linguagem Natural) para detec\u00e7\u00e3o de PII, como Spacy e Stanford NER.<\/p>\n<h3>Melhores ferramentas de linhagem de dados de c\u00f3digo aberto \u2013 2. Egeria<\/h3>\n<p><strong>Vis\u00e3o geral da Eg\u00e9ria:<\/strong><\/p>\n<p>Descrito como o primeiro padr\u00e3o de metadados de c\u00f3digo aberto do mundo, o Egeria oferece uma maneira de integrar perfeitamente ferramentas de engenharia de dados para uma visualiza\u00e7\u00e3o confi\u00e1vel e consistente dos metadados. Al\u00e9m de catalogar e pesquisar metadados, o padr\u00e3o permite que os usu\u00e1rios criem solu\u00e7\u00f5es mais avan\u00e7adas para rastreamento de linhagem de dados, verifica\u00e7\u00e3o da qualidade dos dados, identifica\u00e7\u00e3o de informa\u00e7\u00f5es pessoais identific\u00e1veis (PII) e muito mais.<\/p>\n<p>Muitas arquiteturas de engenharia de dados envolvem uma grande quantidade de comunica\u00e7\u00e3o desnecess\u00e1ria entre v\u00e1rias ferramentas de dados. A Egeria se afasta disso e, em vez disso, adota um modelo de raio e roda, onde tudo passa pela Egeria. Dessa forma, os usu\u00e1rios precisam usar apenas uma ferramenta para se comunicar.<\/p>\n<p><strong>Caracter\u00edsticas da linhagem de dados da Egeria:<\/strong><\/p>\n<p>A linhagem de dados no Egeria utiliza padr\u00f5es abertos bem conhecidos para capturar e armazenar uma linhagem de dados chamada OpenLineage. O OpenLineage tamb\u00e9m oferece uma vis\u00e3o mais abrangente dos seus dados, fornecendo um hist\u00f3rico horizontal e vertical dos dados de rastreamento.<\/p>\n<p>A Egeria monitora os eventos do Kafka emitidos pelo sistema de origem para capturar informa\u00e7\u00f5es de linhagem de dados. Ap\u00f3s obter essas informa\u00e7\u00f5es, a Egeria instrui os gerenciadores de linhagem a encontrar e vincular os gr\u00e1ficos de linhagem que a Egeria n\u00e3o consegue identificar. Depois disso, a linhagem est\u00e1 pronta para uso comercial.<\/p>\n<p>As funcionalidades de linhagem de dados do Egeria est\u00e3o bem alinhadas com as funcionalidades de descoberta e gerenciamento de dados, proveni\u00eancia de metadados e outras. Essas funcionalidades, juntamente com o design e a arquitetura de linhagem do Egeria, fazem dele uma ferramenta de governan\u00e7a e linhagem de dados robusta e bem estruturada.<\/p>\n<h3>Melhores ferramentas de c\u00f3digo aberto para linhagem de dados \u2013 3. Paquiderme<\/h3>\n<p><strong>Vis\u00e3o geral dos paquidermes:<\/strong><\/p>\n<p>Assim como o Tokenn que acabamos de mencionar, o Pachyderm \u00e9 outra ferramenta especializada em linhagem de dados. Em vez de se concentrar em data warehouses na nuvem, ele visa permitir que os desenvolvedores criem pipelines de aprendizado de m\u00e1quina de forma independente de linguagem e framework.<\/p>\n<p>Implementou um sistema de controle de vers\u00e3o, como o LakeFS ou o Git, para manter a linhagem dos objetos de dados. As altera\u00e7\u00f5es nesses objetos (como commits) s\u00e3o capturadas e armazenadas pelo Pachyderm para manter um registro de auditoria completo e imut\u00e1vel dos eventos. Os registros de auditoria permitem visualizar e analisar a linhagem dos dados, al\u00e9m de possibilitar a reprodu\u00e7\u00e3o de dados e c\u00f3digo a qualquer momento para fins de depura\u00e7\u00e3o ou conformidade.<\/p>\n<p><strong>Caracter\u00edsticas da linhagem de dados dos paquidermes:<\/strong><\/p>\n<p>Para alcan\u00e7ar um rastreamento de linhagem de dados e versionamento perfeitos, o Pachyderm utiliza um reposit\u00f3rio central que usa armazenamentos de objetos como o AWS S3 em um sistema de arquivos personalizado chamado PFS (Pachyderm File System). O PFS ajuda seu armazenamento de objetos (como o S3) a se tornar a \u00fanica fonte verdadeira de seus dados, com todo o seu hist\u00f3rico.<\/p>\n<p>O Pachyderm tamb\u00e9m imp\u00f5e invari\u00e2ncia na sua fonte de dados, o que permite atribuir IDs globais a eventos de linhagem e objetos de dados. O Pachyderm permite tratar diagramas de linhagem de dados imut\u00e1veis como DAGs (grafos ac\u00edclicos direcionados) na interface do usu\u00e1rio. Ambos os recursos s\u00e3o ben\u00e9ficos ao trabalhar com pipelines de aprendizado de m\u00e1quina, quando se deseja rastrear os resultados at\u00e9 suas entradas.<\/p>\n<p>O Pachyderm integra-se com os bancos de dados, data warehouses e data lakes mais utilizados. Al\u00e9m disso, voc\u00ea pode importar dados de qualquer banco de dados para o Pachyderm usando uma ferramenta de ingest\u00e3o baseada em SQL. No entanto, o Pachyderm possui limita\u00e7\u00f5es como ferramenta de linhagem de dados de uso geral, raz\u00e3o pela qual a maioria dos clientes corporativos do Pachyderm o utiliza para lidar com MLOps, ETL de dados n\u00e3o estruturados e cargas de trabalho de PNL (Processamento de Linguagem Natural).<\/p>\n<h3><strong>Melhores ferramentas de linhagem de dados de c\u00f3digo aberto \u2013 4. OpenLineage<\/strong><\/h3>\n<p><strong>Vis\u00e3o geral do OpenLineage:<\/strong><\/p>\n<p>O OpenLineage foi fundado pela DataKin, empresa respons\u00e1vel por assumir o desenvolvimento do projeto de Marquez ap\u00f3s a WeWork o disponibilizar para uso. A DataKin transferiu o projeto OpenLineage para a Linux Foundation como um projeto sandbox em meados de 2021. Fortemente inspirado pelo onipresente OpenTelemetry no campo da observabilidade de dados, o OpenLineage visa estabelecer um padr\u00e3o aberto para coleta e an\u00e1lise de linhagem de dados.<\/p>\n<p><strong>Funcionalidades do OpenLineage:<\/strong><\/p>\n<p>A integra\u00e7\u00e3o \u00e9 fundamental para o design e a miss\u00e3o do OpenLineage. Ele se integra com a estrutura ETL, o mecanismo de orquestra\u00e7\u00e3o de dados, o diret\u00f3rio de metadados, o mecanismo de qualidade de dados e as ferramentas de linhagem de dados. O OpenLineage usa JSONSchema como defini\u00e7\u00e3o de API e oferece suporte a v\u00e1rias linguagens e frameworks. Egeria \u00e9 uma das ferramentas de dados populares, cuja camada principal de metadados \u00e9 constru\u00edda sobre o OpenLineage.<\/p>\n<p>O Marquez da WeWork tamb\u00e9m \u00e9 fundamental para a arquitetura do OpenLineage, pois fornece a interface do usu\u00e1rio e o reposit\u00f3rio de metadados, e a API de coleta de metadados vem do OpenLineage. O OpenLineage tamb\u00e9m est\u00e1 dispon\u00edvel para voc\u00ea por meio de APIs GraphQL e REST.<\/p>\n<p>O OpenLineage \u00e9 uma op\u00e7\u00e3o atraente porque pode ser facilmente usado com a maioria das plataformas de engenharia de dados existentes e oferece uma ampla gama de recursos interessantes e valiosos para que voc\u00ea possa coletar, rastrear e analisar a linhagem de dados de forma abrangente.<\/p>\n<h3>Melhores ferramentas de linhagem de dados de c\u00f3digo aberto \u2013 5. TrueDat<\/h3>\n<p><strong>Vis\u00e3o geral do TrueDat:<\/strong><\/p>\n<p>Como uma solu\u00e7\u00e3o completa de governan\u00e7a de dados, o TrueDat permite categorizar, pesquisar e rastrear dados em detalhes. Com seus recursos de linhagem de dados, o TrueDat tamb\u00e9m pode ajudar voc\u00ea a visualizar todo o ciclo de vida dos seus dados, fornecendo insights sobre a jornada dos seus dados ao longo do tempo.<\/p>\n<p>O TrueDat foi criado pela BlueTab (uma empresa da IBM) em 2017 e est\u00e1 em desenvolvimento ativo desde ent\u00e3o, com sua vers\u00e3o mais recente, V4.39, lan\u00e7ada em mar\u00e7o de 2022.<\/p>\n<p><strong>Funcionalidades de linhagem de dados TrueDat:<\/strong><\/p>\n<p>O TrueDat permite usar a linhagem de dados para analisar o impacto das altera\u00e7\u00f5es no banco de dados e compreender melhor a l\u00f3gica de neg\u00f3cios dos seus relat\u00f3rios. Ele permite rastrear a linhagem de um objeto de dados com visibilidade pontual. Para an\u00e1lises avan\u00e7adas, voc\u00ea tamb\u00e9m pode aplicar filtros aos objetos de linhagem para examinar partes espec\u00edficas do diagrama de linhagem. Al\u00e9m da representa\u00e7\u00e3o gr\u00e1fica exibida na interface do usu\u00e1rio, voc\u00ea pode baixar as informa\u00e7\u00f5es de linhagem de dados coletadas em um arquivo CSV. Como o TrueDat oferece um excelente conjunto de recursos de governan\u00e7a e linhagem de dados, ele \u00e9 um forte concorrente para solucionar seus problemas de linhagem de dados.<\/p>\n<h3>Conclus\u00e3o<\/h3>\n<p>Obrigado por ler nosso artigo e esperamos que ele possa ajud\u00e1-lo a encontrar o <strong>melhores ferramentas de linhagem de dados de c\u00f3digo aberto<\/strong>. Se voc\u00ea quiser saber mais sobre a linhagem de dados, gostar\u00edamos de aconselh\u00e1-lo a visitar <a href=\"https:\/\/www.gudusoft.com\/pt\/\"><strong>Gudu SQLFlow<\/strong><\/a> para maiores informa\u00e7\u00f5es.<\/p>\n<p>Como um dos\u00a0<strong>melhores ferramentas de linhagem de dados<\/strong>\u00a0dispon\u00edvel no mercado hoje, o Gudu SQLFlow pode n\u00e3o apenas analisar arquivos de script SQL, obter\u00a0<strong>linhagem de dados<\/strong>, e executar exibi\u00e7\u00e3o visual, mas tamb\u00e9m permitir que os usu\u00e1rios forne\u00e7am linhagem de dados em formato CSV e executem exibi\u00e7\u00e3o visual.\u00a0<strong>(Publicado por Ryan em 14 de julho de 2022)<\/strong><\/p>","protected":false},"excerpt":{"rendered":"<p>5 Best Open Source Data Lineage Tools to Consider in 2022 The essence of data governance is to help companies create data policies and ensure that people can comply with those policies. These policies address a range of data-related processes, including guidelines for data protection, verification and use. Data stewards must solicit data requirements from business users and work with data governance council members to agree on common data definitions, specify data quality metrics, articulate relevant policies, and develop methods to measure compliance. However, building a bridge between defining data governance policies and implementing them is often a formidable challenge.\u2026<\/p>","protected":false},"author":27,"featured_media":5118,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":[],"categories":[178],"tags":[286,137,155,55,139,285,136,59,210,288,75,290,289,287,291],"blocksy_meta":{"styles_descriptor":{"styles":{"desktop":"","tablet":"","mobile":""},"google_fonts":[],"version":5}},"_links":{"self":[{"href":"https:\/\/www.gudusoft.com\/pt\/wp-json\/wp\/v2\/posts\/5110"}],"collection":[{"href":"https:\/\/www.gudusoft.com\/pt\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.gudusoft.com\/pt\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.gudusoft.com\/pt\/wp-json\/wp\/v2\/users\/27"}],"replies":[{"embeddable":true,"href":"https:\/\/www.gudusoft.com\/pt\/wp-json\/wp\/v2\/comments?post=5110"}],"version-history":[{"count":12,"href":"https:\/\/www.gudusoft.com\/pt\/wp-json\/wp\/v2\/posts\/5110\/revisions"}],"predecessor-version":[{"id":6800,"href":"https:\/\/www.gudusoft.com\/pt\/wp-json\/wp\/v2\/posts\/5110\/revisions\/6800"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.gudusoft.com\/pt\/wp-json\/wp\/v2\/media\/5118"}],"wp:attachment":[{"href":"https:\/\/www.gudusoft.com\/pt\/wp-json\/wp\/v2\/media?parent=5110"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.gudusoft.com\/pt\/wp-json\/wp\/v2\/categories?post=5110"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.gudusoft.com\/pt\/wp-json\/wp\/v2\/tags?post=5110"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}