Lignée de données Amazon Redshift | Gudu SQLFlow
Dans votre environnement d'entrepôt Amazon, utilisez Spectre Redshift d'Amazon Pour interroger directement des données à partir de fichiers sur Amazon S3, les enregistrer dans des bases de données Redshift et utiliser des outils de Business Intelligence tels que Tableau, Power BI, Looker, Qlik et Superset afin de générer des rapports, les données proviennent de votre système source et sont stockées sur Amazon S3. Un outil ETL comme DBT permet ensuite de les transférer et de les stocker dans une base de données Redshift pour une utilisation ultérieure.

Pour avoir une vue d'ensemble du flux de données dans votre système d'entrepôt Amazon, vous avez besoin d'un outil de lignée de données pour vous aider à comprendre comment les données sont arrivées à un emplacement particulier, ainsi que les étapes intermédiaires et les transformations qui se produisent lorsque les données circulent dans le système d'information.
Une façon d'obtenir la lignée des données L'analyse automatique, depuis l'environnement d'entrepôt Amazon, de toutes les requêtes SQL utilisées lors du chargement, de la transformation et de l'analyse des données est une fonctionnalité essentielle. Bonne nouvelle : toutes ces instructions SQL sont stockées dans… journal d'activité des utilisateurs de Redshift et Gudu SQLFlow peut analyser ces fichiers journaux pour découvrir automatiquement la provenance des données.
Journal d'activité utilisateur de Redshift
Le journal d'activité utilisateur est principalement utile pour le dépannage ; ici, nous l'utilisons pour retracer la provenance des données. Il enregistre les informations relatives aux types de requêtes effectuées par les utilisateurs et le système dans la base de données.
Enregistre chaque requête avant son exécution sur la base de données.
| Nom de la colonne | Description |
|---|---|
| temps record | L'heure à laquelle l'événement s'est produit. |
| base de données | Nom de la base de données. |
| utilisateur | Nom d'utilisateur. |
| pid | ID du processus associé à l'instruction. |
| ID de l'utilisateur | ID de l'utilisateur. |
| xid | ID de transaction. |
| requête | Un préfixe LOG : suivi du texte de la requête, y compris les sauts de ligne. |
Vérifiez s'il vous plaît cet article pour savoir comment activer la journalisation.
Exemple de journal d'audit d'activité utilisateur Amazon Redshift
'2018-05-21T06:00:09Z UTC [ db=prod_sales user=duc pid=99753 userid=95 xid=6728324 ]' LOG: create table SumoProdbackUp.organization as (select * from SumoProd.simpleuser) '2018-05-21T06:00:09Z UTC [ db=vendor user=ankit pid=36616 userid=53 xid=2956702 ]' LOG: DELETE FROM SumoProd.employee WHERE id = 38; '2018-05-21T06:20:09Z UTC [ db=dev user=himanshu pid=64458 userid=35 xid=5143208 ]' LOG: drop user testuser3
Analyse automatique de la lignée des données
Gudu SQLFlow Cet outil automatise l'analyse de la traçabilité des données SQL dans les environnements de bases de données, ETL, Business Intelligence, Cloud et Hadoop en analysant les scripts SQL et les procédures stockées. Il peut également analyser les fichiers journaux d'activité des utilisateurs Redshift pour retracer la traçabilité des données et représenter graphiquement tous leurs mouvements.
Voici un extrait d'un schéma de traçabilité des données généré après l'analyse des fichiers journaux d'activité des utilisateurs d'Amazon Redshift :
Conclusion
Merci d'avoir lu notre article et nous espérons qu'il pourra vous aider à mieux comprendre Lignée de données Amazon Redshift. Si vous souhaitez en savoir plus sur Lignée de données Amazon RedshiftNous vous conseillons de visiter notre site web. Gudu SQLFlow Pour plus d'informations. Gudu SQLFlow, en tant qu'outil d'analyse de la lignée des données, permet non seulement d'analyser les fichiers de scripts SQL, d'obtenir la lignée des données et de les visualiser, mais aussi de fournir cette lignée au format CSV et de l'afficher visuellement. Merci encore ! (Modifié par Ryan le 26 avril 2022)