Εξέλιξη Κομματιού
Εισαγωγή, Στόχοι και Στρατηγική Μετανάστευσης
- Στόχοι του μαθήματος, ευθυγράμμιση προφίλ συμμετεχόντων και κριτήρια επιτυχίας
- Προσεγγίσεις μεταναστεύσης υψηλού επιπέδου και παρακίνηση κινδύνων
- Ρύθμιση χώρων εργασίας, αποθεκρίων και σετ δεδομένων εργαστηρίου
Ημέρα 1 — Βασικά της Μετανάστευσης και Αρχιτεκτονική
- Έννοιες Lakehouse, επισκόπηση Delta Lake και αρχιτεκτονική Databricks
- Διαφορές SMP έναντι MPP και επιπτώσεις για τη μεταναστεύση
- Σχεδιασμός Medallion (Bronze→Silver→Gold) και επισκόπηση Unity Catalog
Εργαστήριο Ημέρας 1 — Μεταφράζοντας μια Stored Procedure
- Hands-on μεταναστεύση μιας δοκιμαστικής stored procedure σε notebook
- Χαρτογράφηση προσωρινών πινάκων και δακτυλίων (cursors) σε μετασχηματισμούς DataFrame
- Επαλήθευση και σύγκριση με την αρχική έξοδο
Ημέρα 2 — Προηγμένα Delta Lake & Διαρκής Λήψη Δεδομένων
- Συναλλαγές ACID, αρχεία δελτίων, εκδόσεις και ταξίδι στο χρόνο (time travel)
- Auto Loader, μοτίβα MERGE INTO, upserts και εξέλιξη σχήματος (schema evolution)
- OPTIMIZE, VACUUM, Z-ORDER, διαμερισματοποίηση και ρυθμίσεις αποθήκευσης
Εργαστήριο Ημέρας 2 — Διαρκής Λήψη & Βελτιστοποίηση
- Υλοποίηση λήψης μέσω Auto Loader και ροών εργασίας MERGE
- Εφαρμογή OPTIMIZE, Z-ORDER και VACUUM· επαλήθευση αποτελεσμάτων
- Μέτρηση βελτίωσης απόδοσης ανάγνωσης/εγγραφής
Ημέρα 3 — SQL στο Databricks, Απόδοση & Σημειοθεσία (Debugging)
- Αναλυτικά χαρακτηριστικά SQL: συναρτήσεις παραθύρων, συναρτήσεις υψηλότερης τάξης, xửление JSON/πινάκων
- Ανάγνωση του Spark UI, DAGs, shuffles, σταδίων, εργασιών και διάγνωση cuello de botella
- Μοτίμα βελτιστοποίησης ερωτήσεων: broadcast joins, hints, caching και μείωση spills
Εργαστήριο Ημέρας 3 — Αναδιάρθρωση SQL & Βελτιστοποίηση Απόδοσης
- Αναδιαμόρφωση μιας βαριάς διαδικασίας SQL σε βελτιστοποιημένο Spark SQL
- Χρήση trace του Spark UI για ταυτοποίηση και διόρθωση ζητημάτων κλίσης (skew) και shuffle
- Βεντσκορκινγκ πριν/μετά και τεκμηρίωση βημάτων βελτιστοποίησης
Ημέρα 4 — Τακτική PySpark: Αντικατάσταση Διαδικαστικής Λογικής
- Μοντέλο εκτέλεσης Spark: driver, executors, οκνηρή αξιολόγηση (lazy evaluation) και στρατηγικές διαμερισματοποίησης
- Μετασχηματισμός βρόχων και δακτυλίων (cursors) σε διανυσματικές λειτουργίες DataFrame
- Μοναδικότητα (modularization), UDFs/pandas UDFs, widgets και επαναχρησιμοποιήσιμες βιβλιοθήκες
Εργαστήριο Ημέρας 4 — Αναδιαμόρφωση Διαδικαστικών Σεντεσίων
- Αναδιαμόρφωση ενός διαδικαστικού σεντεσίου ETL σε μοναδικά notebooks PySpark
- Εισαγωγή παραμετροποίησης, δοκιμών τύπου μονάδας και επαναχρησιμοποιήσιμων συνάρσεων
- Ανασκόπηση κώδικα και εφαρμογή λίστας ελέγχου καλών πρακτικών
Ημέρα 5 — Ορχήστρωση, Ροή Εργασίας Από Άκρο σε Άκρο & Καλές Πρακτικές
- Databricks Workflows: σχεδιασμός εργασιών, εξαρτήσεις, triggers και διαχείριση σφαλμάτων
- Σχεδιασμός διαρκών ροών Medallion με κανόνες ποιότητας και έλεγχο σχήματος
- Ενσωμάτωση με Git (GitHub/Azure DevOps), CI και στρατηγικές δοκιμών για λογική PySpark
Εργαστήριο Ημέρας 5 — Δημιουργία Πλήρους Ροής από Άκρο σε Άκρο
- Συγκρότηση ροής Bronze→Silver→Gold με ορχήστρωση μέσω Workflows
- Υλοποίηση logging, audit, επαναλήψεων (retries) και αυτόματων ελέγχων
- Εκτέλεση πλήρους ροής, επαλήθευση εξόδων και προετοιμασία σημειώσεων αναπαραγωγής
Λειτουργικοποίηση, Διαχείριση και Έτοιμοτητα Παραγωγής
- Διαχείριση Unity Catalog, καταγωγή δεδομένων (lineage) και καλές πρακτικές ελέγχων πρόσβασης
- Κόστος, μεγέθη σαρών, autoscaling και μοτίπα συγχρονισμού εργασιών
- Λίστες ελέγχου αναπαραγωγής, στρατηγικές αναστροφής (rollback) και δημιουργία runbook
Τελική Ανασκόπηση, Μετάβαση Γνώσης και Επόμενα Βήματα
- Παρουσιάσεις συμμετεχόντων των εργασιών μεταναστεύσης και διδαγμάτων
- Ανάλυση κενών, προτεινόμενες δραστηριότητες follow-up και παράδοση υλικού εκπαίδευσης
- Αναφορές, περαιτέρω διαδρομές μάθησης και επιλογές υποστήριξης
Απαιτήσεις
- Κατανόηση των εννοιών του data engineering
- Εμπειρία με SQL και stored procedures (Synapse / SQL Server)
- Οικειότητα με έννοιες ορχήστρωσης ETL (ADF ή παρόμοια)
Κοινό-Στόχος
- Διοικητικοί υπεύθυνοι τεχνολογίας με εμπειρία σε data engineering
- Μηχανικοί δεδομένων που μεταβαίνουν από την διαδικαστική λογική OLAP σε μοτίβα Lakehouse
- Μηχανικοί πλατφόρμας υπεύθυνοι για την υιοθέτηση του Databricks