Επικοινωνήστε μαζί μας

Εξέλιξη Κομματιού

Θεμελιώδεις Έννοιες της Πλατφόρμας Databricks και του Lakehouse

  • Αρχιτεκτονική και συστατικά του Databricks Lakehouse
  • Οργάνωση χώρων εργασίας και καταλόγων

Χώρος Εργασίας και Notebooks στο Databricks

  • Πλοήγηση στον χώρο εργασίας και ανάπτυξη βασισμένη σε notebooks
  • Οργάνωση κώδικα σε επαναχρησιμοποιήσιμα notebooks

Αρχιτεκτονική και Εκτέλεση του Apache Spark

  • Αρχιτεκτονική της εκτέλεσης (runtime) και μοντέλο εκτέλεσης του Spark
  • Εκτέλεση με καθυστέρηση (lazy evaluation) και το DAG (Directed Acyclic Graph) των εργασιών

DataFrames και DataFrame API στο PySpark

  • Αφηρημένες δομές (abstractions) DataFrames και σχήματα (schemas)
  • Βασικές λειτουργίες DataFrames και εκφράσεις στηλών

Μετατροπή SQL σε PySpark DataFrames

  • Μετατροπή βασικών κλαύσεων SQL σε λειτουργίες DataFrame
  • Συναρτήσεις παραθύρου (window functions) και aggregations στο PySpark

Διαβάσιμο και Γράψιμο Δεδομένων στο Databricks

  • Ανάγνωση από κοινές πηγές αρχείων και βάσεων δεδομένων
  • Γράψιμο και partitioning δεδομένων στο Lakehouse

Delta Lake και Διαχείριση Πινάκων

  • Πίνακες Delta και συναλλαγές ACID
  • Time travel και εξέλιξη του schema (schema evolution)

Μοτίβα Καθαρισμού και Μετασχηματισμού Δεδομένων

  • Καθαρισμός δεδομένων και μετατροπή τύπων
  • Δημιουργία επαναχρησιμοποιήσιμης λογικής μετασχηματισμού

Συναρτήσεις που Ορίζονται από τον Χρήστη (UDFs) και Μοντέρνος Κώδικας

  • Python UDFs και pandas UDFs
  • Μοντελοποίηση της διαδραστικής λογικής σε συναρτήσεις

Βελτιστοποίηση Απόδοσης και Ρυθμίσεις

  • Στρατηγικές partitioning και caching
  • Διάγνωσηคอ bottlenecks με τη Spark UI

Θεμελιώδεις Έννοιες του Structured Streaming

  • Μοντέλα επεξεργασίας batch versus streaming
  • Streaming DataFrames και βασικά aggregations

Εργασίες και Ορχήστρωση Ροών Εργασίας στο Databricks

  • Προγραμματισμός notebooks ως εργασιών και tasks
  • Κατασκευή πολυβημάτων workflows με εξαρτήσεις

Unity Catalog και Διακυβέρνηση Δεδομένων

  • Αρχιτεκτονική του Unity Catalog και ονόματα χώρου (namespaces)
  • Έλεγχος πρόσβασης και προέλευση δεδομένων (data lineage)

Δοκιμές, Αποσφαλμάτωση και Πρακτικές Παραγωγής

  • Μοναδιαίες δοκιμές (unit testing) της λογικής PySpark
  • Αποσφαλμάτωση και πρότυπα ποιότητας κώδικα

Παραδείγματα Εφαρμογής σε Χρηματοοικονομικές Υπηρεσίες

  • Κατασκευή μιας end-to-end ETL ροής εργασίας τραπεζικών υπηρεσιών
  • Μετατροπή legacy SQL διαδικασιών σε PySpark

Μετοίκηση Φορτίων SQL σε PySpark

  • Στρατηγική μετοίκησης και μοτίβα σχεδιασμού
  • Incremental μετατροπή existing SQL workflows σε PySpark

Απαιτήσεις

  • Εμπειρία με τον προγραμματισμό Python, συμπεριλαμβανομένων συναρτήσεων και τύπων δεδομένων
  • Κατανόηση της SQL, συμπεριλαμβανομένων των joins, των aggregations και των subqueries
  • Δεν απαιτείται προηγούμενη εμπειρία με το Databricks ή το PySpark

Κοινό-Στόχος

  • Μηχανικοί δεδομένων, αναλυτές δεδομένων και επαγγελματίες του κλάδου
  • Ομάδες που μετοικούν υπάρχουσες ροές εργασίας βασισμένες σε SQL στο Databricks και το PySpark
 35 Ώρες

Αριθμός συμμετέχοντων


Τιμή ανά συμμετέχοντα

Σχόλια (1)

Εφεξής Μαθήματα

Σχετικές Κατηγορίες