Phase 1: Programmierung und Datenmodellierung
- Fortgeschrittene Python-Programmierung: Datenstrukturen, funktionales Programmieren, Performance-Tuning und Fehlerbehandlung.
- Fortgeschrittenes SQL, Normalisierung und relationales Design mit ER-Diagrammen.
- Effektives Arbeiten im Kurs, Einblick in die IT-Branche und der sinnvolle Einsatz von KI als Werkzeug.
Phase 2: Containerisierung und Workflow-Orchestrierung
- Anwendungen mit Docker containerisieren und reproduzierbar betreiben.
- Workflows mit Apache Airflow und Prefect orchestrieren.
- Modulare, testbare Datentransformationen mit dbt erstellen.
Phase 3: Cloud Data Engineering mit AWS
- Grundlagen des Cloud Computings mit AWS und cloud-native Datenpipelines mit Glue, Lambda und S3.
- Arbeiten mit dem Data Warehouse Redshift.
- Identity & Access Management, Kostenoptimierung und Best Practices in Cloud-Architekturen.
Phase 4: Big Data und Real-Time Processing
- Große Datenmengen mit Spark und PySpark verarbeiten.
- Echtzeitlösungen mit Kafka entwickeln und NoSQL-Datenbanken wie MongoDB praktisch einsetzen.
- Die richtige Wahl treffen: wann Batch- und wann Stream-Verarbeitung sinnvoll ist.
Phase 5: Governance, DevOps und Abschlussprojekt
- Data Governance, Metadatenmanagement und Qualitätsframeworks kennenlernen.
- Infrastruktur mit Terraform und GitHub Actions automatisieren.
- Als Abschlussprojekt eine vollständige Datenplattform entwickeln und präsentieren.