5 Melhores Ferramentas de Linhagem de Dados de Código Aberto

5 melhores ferramentas de linhagem de dados de código aberto para considerar em 2022

A essência de governança de dados é ajudar as empresas a criar políticas de dados e garantir que as pessoas possam cumpri-las. Essas políticas abordam uma série de processos relacionados a dados, incluindo diretrizes para proteção, verificação e uso de dados. Administradores de dados deve solicitar requisitos de dados de usuários empresariais e trabalhar com os membros do conselho de governança de dados para concordar com definições comuns de dados, especificar qualidade dos dados métricas, articular políticas relevantes e desenvolver métodos para medir a conformidade.

Melhores ferramentas de linhagem de dados de código aberto
Melhores ferramentas de linhagem de dados de código aberto

No entanto, construir uma ponte entre a definição de políticas de governança de dados e sua implementação costuma ser um desafio formidável. O objetivo dessas estratégias é controlar e monitorar a qualidade dos ativos de dados em todos os fluxos de trabalho de negócios, mas os gestores de dados, que têm responsabilidades essenciais na gestão da qualidade dos dados, muitas vezes não são devidamente treinados ou qualificados. É aí que entra a... ferramenta de linhagem de dados entra. Neste artigo, vamos apresentar 5 melhores ferramentas de código aberto para linhagem de dados que podem ser encontrados no mercado de 2022.

Melhores ferramentas de linhagem de dados de código aberto – 1. Tokern

Visão geral do Tokern:

Tokern foi desenvolvido para a nuvem. armazéns de dados e lagos de dadose adota uma abordagem dedicada para permitir que você obtenha linhagem de dados em nível de coluna A partir de bancos de dados e data warehouses hospedados no Google BigQuery, AWS Redshift e Snowflake. Além disso, mais recursos como SparkSQL, AWS Athena e Presto estão em desenvolvimento. O Tokenn possui consideráveis capacidades de integração, pois funciona bem com a maioria dos catálogos de dados e frameworks ETL de código aberto.

Características da linhagem de dados Tokern:

O Token foi lançado há algum tempo e leva em consideração os mais recentes padrões de engenharia e design de dados. Um exemplo disso é que, além de construir linhagem de dados A partir do DBCAT (diretório de dados), o Tokern também permite criar a linhagem de dados com base no histórico de consultas ou em scripts ETL, tornando-o ideal para integração com ferramentas de BI e ETL. O Tokern armazena o catálogo de dados e a linhagem em um banco de dados PostgreSQL. Os usuários podem acessar esse banco de dados para análises adicionais usando SQL ou integrá-lo a outros mecanismos de visualização e análise.

O mecanismo de visualização Kedro-Viz e a biblioteca de análise de grafos de rede NetworkX são os responsáveis pelas excelentes capacidades de visualização e análise do Tokenn. Essas bibliotecas ajudam você a rastrear, visualizar e analisar dados de linhagem em nível de coluna. Você também pode interagir com os dados de linhagem usando o SDK ou a API do Tokenn.

Além de suas capacidades de linhagem de dados de última geração, o Tokern utiliza o PIICatcher para fornecer detecção de PII (Informações de Identificação Pessoal) e PHI (Informações Pessoais de Saúde). A ferramenta integrada combina expressões regulares com diversas bibliotecas padrão de PNL (Processamento de Linguagem Natural) para detecção de PII, como Spacy e Stanford NER.

Melhores ferramentas de linhagem de dados de código aberto – 2. Egeria

Visão geral da Egéria:

Descrito como o primeiro padrão de metadados de código aberto do mundo, o Egeria oferece uma maneira de integrar perfeitamente ferramentas de engenharia de dados para uma visualização confiável e consistente dos metadados. Além de catalogar e pesquisar metadados, o padrão permite que os usuários criem soluções mais avançadas para rastreamento de linhagem de dados, verificação da qualidade dos dados, identificação de informações pessoais identificáveis (PII) e muito mais.

Muitas arquiteturas de engenharia de dados envolvem uma grande quantidade de comunicação desnecessária entre várias ferramentas de dados. A Egeria se afasta disso e, em vez disso, adota um modelo de raio e roda, onde tudo passa pela Egeria. Dessa forma, os usuários precisam usar apenas uma ferramenta para se comunicar.

Características da linhagem de dados da Egeria:

A linhagem de dados no Egeria utiliza padrões abertos bem conhecidos para capturar e armazenar uma linhagem de dados chamada OpenLineage. O OpenLineage também oferece uma visão mais abrangente dos seus dados, fornecendo um histórico horizontal e vertical dos dados de rastreamento.

A Egeria monitora os eventos do Kafka emitidos pelo sistema de origem para capturar informações de linhagem de dados. Após obter essas informações, a Egeria instrui os gerenciadores de linhagem a encontrar e vincular os gráficos de linhagem que a Egeria não consegue identificar. Depois disso, a linhagem está pronta para uso comercial.

As funcionalidades de linhagem de dados do Egeria estão bem alinhadas com as funcionalidades de descoberta e gerenciamento de dados, proveniência de metadados e outras. Essas funcionalidades, juntamente com o design e a arquitetura de linhagem do Egeria, fazem dele uma ferramenta de governança e linhagem de dados robusta e bem estruturada.

Melhores ferramentas de código aberto para linhagem de dados – 3. Paquiderme

Visão geral dos paquidermes:

Assim como o Tokenn que acabamos de mencionar, o Pachyderm é outra ferramenta especializada em linhagem de dados. Em vez de se concentrar em data warehouses na nuvem, ele visa permitir que os desenvolvedores criem pipelines de aprendizado de máquina de forma independente de linguagem e framework.

Implementou um sistema de controle de versão, como o LakeFS ou o Git, para manter a linhagem dos objetos de dados. As alterações nesses objetos (como commits) são capturadas e armazenadas pelo Pachyderm para manter um registro de auditoria completo e imutável dos eventos. Os registros de auditoria permitem visualizar e analisar a linhagem dos dados, além de possibilitar a reprodução de dados e código a qualquer momento para fins de depuração ou conformidade.

Características da linhagem de dados dos paquidermes:

Para alcançar um rastreamento de linhagem de dados e versionamento perfeitos, o Pachyderm utiliza um repositório central que usa armazenamentos de objetos como o AWS S3 em um sistema de arquivos personalizado chamado PFS (Pachyderm File System). O PFS ajuda seu armazenamento de objetos (como o S3) a se tornar a única fonte verdadeira de seus dados, com todo o seu histórico.

O Pachyderm também impõe invariância na sua fonte de dados, o que permite atribuir IDs globais a eventos de linhagem e objetos de dados. O Pachyderm permite tratar diagramas de linhagem de dados imutáveis como DAGs (grafos acíclicos direcionados) na interface do usuário. Ambos os recursos são benéficos ao trabalhar com pipelines de aprendizado de máquina, quando se deseja rastrear os resultados até suas entradas.

O Pachyderm integra-se com os bancos de dados, data warehouses e data lakes mais utilizados. Além disso, você pode importar dados de qualquer banco de dados para o Pachyderm usando uma ferramenta de ingestão baseada em SQL. No entanto, o Pachyderm possui limitações como ferramenta de linhagem de dados de uso geral, razão pela qual a maioria dos clientes corporativos do Pachyderm o utiliza para lidar com MLOps, ETL de dados não estruturados e cargas de trabalho de PNL (Processamento de Linguagem Natural).

Melhores ferramentas de linhagem de dados de código aberto – 4. OpenLineage

Visão geral do OpenLineage:

O OpenLineage foi fundado pela DataKin, empresa responsável por assumir o desenvolvimento do projeto de Marquez após a WeWork o disponibilizar para uso. A DataKin transferiu o projeto OpenLineage para a Linux Foundation como um projeto sandbox em meados de 2021. Fortemente inspirado pelo onipresente OpenTelemetry no campo da observabilidade de dados, o OpenLineage visa estabelecer um padrão aberto para coleta e análise de linhagem de dados.

Funcionalidades do OpenLineage:

A integração é fundamental para o design e a missão do OpenLineage. Ele se integra com a estrutura ETL, o mecanismo de orquestração de dados, o diretório de metadados, o mecanismo de qualidade de dados e as ferramentas de linhagem de dados. O OpenLineage usa JSONSchema como definição de API e oferece suporte a várias linguagens e frameworks. Egeria é uma das ferramentas de dados populares, cuja camada principal de metadados é construída sobre o OpenLineage.

O Marquez da WeWork também é fundamental para a arquitetura do OpenLineage, pois fornece a interface do usuário e o repositório de metadados, e a API de coleta de metadados vem do OpenLineage. O OpenLineage também está disponível para você por meio de APIs GraphQL e REST.

O OpenLineage é uma opção atraente porque pode ser facilmente usado com a maioria das plataformas de engenharia de dados existentes e oferece uma ampla gama de recursos interessantes e valiosos para que você possa coletar, rastrear e analisar a linhagem de dados de forma abrangente.

Melhores ferramentas de linhagem de dados de código aberto – 5. TrueDat

Visão geral do TrueDat:

Como uma solução completa de governança de dados, o TrueDat permite categorizar, pesquisar e rastrear dados em detalhes. Com seus recursos de linhagem de dados, o TrueDat também pode ajudar você a visualizar todo o ciclo de vida dos seus dados, fornecendo insights sobre a jornada dos seus dados ao longo do tempo.

O TrueDat foi criado pela BlueTab (uma empresa da IBM) em 2017 e está em desenvolvimento ativo desde então, com sua versão mais recente, V4.39, lançada em março de 2022.

Funcionalidades de linhagem de dados TrueDat:

O TrueDat permite usar a linhagem de dados para analisar o impacto das alterações no banco de dados e compreender melhor a lógica de negócios dos seus relatórios. Ele permite rastrear a linhagem de um objeto de dados com visibilidade pontual. Para análises avançadas, você também pode aplicar filtros aos objetos de linhagem para examinar partes específicas do diagrama de linhagem. Além da representação gráfica exibida na interface do usuário, você pode baixar as informações de linhagem de dados coletadas em um arquivo CSV. Como o TrueDat oferece um excelente conjunto de recursos de governança e linhagem de dados, ele é um forte concorrente para solucionar seus problemas de linhagem de dados.

Conclusão

Obrigado por ler nosso artigo e esperamos que ele possa ajudá-lo a encontrar o melhores ferramentas de linhagem de dados de código aberto. Se você quiser saber mais sobre a linhagem de dados, gostaríamos de aconselhá-lo a visitar Gudu SQLFlow para maiores informações.

Como um dos melhores ferramentas de linhagem de dados disponível no mercado hoje, o Gudu SQLFlow pode não apenas analisar arquivos de script SQL, obter linhagem de dados, e executar exibição visual, mas também permitir que os usuários forneçam linhagem de dados em formato CSV e executem exibição visual. (Publicado por Ryan em 14 de julho de 2022)

Responder

O seu endereço de email não será publicado. Campos obrigatórios marcados com *