Επικοινωνήστε μαζί μας

Εξέλιξη Κομματιού

Εισαγωγή, Στόχοι και Στρατηγική Μετανάστευσης

  • Στόχοι του μαθήματος, ευθυγράμμιση προφίλ συμμετεχόντων και κριτήρια επιτυχίας
  • Προσεγγίσεις μεταναστεύσης υψηλού επιπέδου και παρακίνηση κινδύνων
  • Ρύθμιση χώρων εργασίας, αποθεκρίων και σετ δεδομένων εργαστηρίου

Ημέρα 1 — Βασικά της Μετανάστευσης και Αρχιτεκτονική

  • Έννοιες Lakehouse, επισκόπηση Delta Lake και αρχιτεκτονική Databricks
  • Διαφορές SMP έναντι MPP και επιπτώσεις για τη μεταναστεύση
  • Σχεδιασμός Medallion (Bronze→Silver→Gold) και επισκόπηση Unity Catalog

Εργαστήριο Ημέρας 1 — Μεταφράζοντας μια Stored Procedure

  • Hands-on μεταναστεύση μιας δοκιμαστικής stored procedure σε notebook
  • Χαρτογράφηση προσωρινών πινάκων και δακτυλίων (cursors) σε μετασχηματισμούς DataFrame
  • Επαλήθευση και σύγκριση με την αρχική έξοδο

Ημέρα 2 — Προηγμένα Delta Lake & Διαρκής Λήψη Δεδομένων

  • Συναλλαγές ACID, αρχεία δελτίων, εκδόσεις και ταξίδι στο χρόνο (time travel)
  • Auto Loader, μοτίβα MERGE INTO, upserts και εξέλιξη σχήματος (schema evolution)
  • OPTIMIZE, VACUUM, Z-ORDER, διαμερισματοποίηση και ρυθμίσεις αποθήκευσης

Εργαστήριο Ημέρας 2 — Διαρκής Λήψη & Βελτιστοποίηση

  • Υλοποίηση λήψης μέσω Auto Loader και ροών εργασίας MERGE
  • Εφαρμογή OPTIMIZE, Z-ORDER και VACUUM· επαλήθευση αποτελεσμάτων
  • Μέτρηση βελτίωσης απόδοσης ανάγνωσης/εγγραφής

Ημέρα 3 — SQL στο Databricks, Απόδοση & Σημειοθεσία (Debugging)

  • Αναλυτικά χαρακτηριστικά SQL: συναρτήσεις παραθύρων, συναρτήσεις υψηλότερης τάξης, xửление JSON/πινάκων
  • Ανάγνωση του Spark UI, DAGs, shuffles, σταδίων, εργασιών και διάγνωση cuello de botella
  • Μοτίμα βελτιστοποίησης ερωτήσεων: broadcast joins, hints, caching και μείωση spills

Εργαστήριο Ημέρας 3 — Αναδιάρθρωση SQL & Βελτιστοποίηση Απόδοσης

  • Αναδιαμόρφωση μιας βαριάς διαδικασίας SQL σε βελτιστοποιημένο Spark SQL
  • Χρήση trace του Spark UI για ταυτοποίηση και διόρθωση ζητημάτων κλίσης (skew) και shuffle
  • Βεντσκορκινγκ πριν/μετά και τεκμηρίωση βημάτων βελτιστοποίησης

Ημέρα 4 — Τακτική PySpark: Αντικατάσταση Διαδικαστικής Λογικής

  • Μοντέλο εκτέλεσης Spark: driver, executors, οκνηρή αξιολόγηση (lazy evaluation) και στρατηγικές διαμερισματοποίησης
  • Μετασχηματισμός βρόχων και δακτυλίων (cursors) σε διανυσματικές λειτουργίες DataFrame
  • Μοναδικότητα (modularization), UDFs/pandas UDFs, widgets και επαναχρησιμοποιήσιμες βιβλιοθήκες

Εργαστήριο Ημέρας 4 — Αναδιαμόρφωση Διαδικαστικών Σεντεσίων

  • Αναδιαμόρφωση ενός διαδικαστικού σεντεσίου ETL σε μοναδικά notebooks PySpark
  • Εισαγωγή παραμετροποίησης, δοκιμών τύπου μονάδας και επαναχρησιμοποιήσιμων συνάρσεων
  • Ανασκόπηση κώδικα και εφαρμογή λίστας ελέγχου καλών πρακτικών

Ημέρα 5 — Ορχήστρωση, Ροή Εργασίας Από Άκρο σε Άκρο & Καλές Πρακτικές

  • Databricks Workflows: σχεδιασμός εργασιών, εξαρτήσεις, triggers και διαχείριση σφαλμάτων
  • Σχεδιασμός διαρκών ροών Medallion με κανόνες ποιότητας και έλεγχο σχήματος
  • Ενσωμάτωση με Git (GitHub/Azure DevOps), CI και στρατηγικές δοκιμών για λογική PySpark

Εργαστήριο Ημέρας 5 — Δημιουργία Πλήρους Ροής από Άκρο σε Άκρο

  • Συγκρότηση ροής Bronze→Silver→Gold με ορχήστρωση μέσω Workflows
  • Υλοποίηση logging, audit, επαναλήψεων (retries) και αυτόματων ελέγχων
  • Εκτέλεση πλήρους ροής, επαλήθευση εξόδων και προετοιμασία σημειώσεων αναπαραγωγής

Λειτουργικοποίηση, Διαχείριση και Έτοιμοτητα Παραγωγής

  • Διαχείριση Unity Catalog, καταγωγή δεδομένων (lineage) και καλές πρακτικές ελέγχων πρόσβασης
  • Κόστος, μεγέθη σαρών, autoscaling και μοτίπα συγχρονισμού εργασιών
  • Λίστες ελέγχου αναπαραγωγής, στρατηγικές αναστροφής (rollback) και δημιουργία runbook

Τελική Ανασκόπηση, Μετάβαση Γνώσης και Επόμενα Βήματα

  • Παρουσιάσεις συμμετεχόντων των εργασιών μεταναστεύσης και διδαγμάτων
  • Ανάλυση κενών, προτεινόμενες δραστηριότητες follow-up και παράδοση υλικού εκπαίδευσης
  • Αναφορές, περαιτέρω διαδρομές μάθησης και επιλογές υποστήριξης

Απαιτήσεις

  • Κατανόηση των εννοιών του data engineering
  • Εμπειρία με SQL και stored procedures (Synapse / SQL Server)
  • Οικειότητα με έννοιες ορχήστρωσης ETL (ADF ή παρόμοια)

Κοινό-Στόχος

  • Διοικητικοί υπεύθυνοι τεχνολογίας με εμπειρία σε data engineering
  • Μηχανικοί δεδομένων που μεταβαίνουν από την διαδικαστική λογική OLAP σε μοτίβα Lakehouse
  • Μηχανικοί πλατφόρμας υπεύθυνοι για την υιοθέτηση του Databricks
 35 Ώρες

Αριθμός συμμετέχοντων


Τιμή ανά συμμετέχοντα

Εφεξής Μαθήματα

Σχετικές Κατηγορίες