Osnova přednášek:
- Historie OLAP, Datový produkt a role a nástroje datového inženýra a jeho zařazení datově-orientované společnosti, ETL, ELT a backfilling dat. Oddělení úložsiště dat od jejich zpracování. Delta lake - Parquet, ORC. Lakehouse - Delta lake, Iceberg, Hudi
- Data warehouse modeling. Star, Snowflake. Data Vault
- Medailonová architektura a její praktické využití. Čištění, validace a kvalita dat.
- Automatizace pomocí přístupu Data Engineering as Code (dbt).
- Orchestrace. Datové katalogy a správa metadat.
- Loading strategies. Dávkové vs. streamové zpracování dat. Verzování schémat a Change Data Capture (CDC).
- Úvod do analýzy dat. Dimenzionální dotazování. Úvod do DAX.
- Základní Analýza dat v Power BI.
Cvičení:
- Seznámení s vývojovými prostředími (přihlášení do služeb). Práce s Parquet a Lakehouse soubory s pomocí DuckDB
- Převedení Sakila databáze do hvězdy (DBDiagrams, SQL Server)
- Integrace dvou Sakila databázi s pomocí Data Vault
- Čištění a integrace hodnocení filmů (Najít dataset na Kaggle) - PowerM, SQL
Překlopení práce z předchozích hodin do DBT
- Zkusit napsat orchestraci ETL s pomocí Airflow. Vstupní data se umístí na nějaký S3 bucket.
- Vložit metadata do připraveného systému (Open metadata, DuckLake). Automatizace sběru metadat. Příprava zadání pro vlastní projekt.
- Pro jeden příklad zkusit více loading strategies: CDC, full-load, batch, streaming. Seznámení s Power BI a napsání prvních DAX.
- Power BI. Konzultace projektu.
- Odevzdání projektu