Εξέλιξη Κομματιού
Θεμελιώδεις Έννοιες της Πλατφόρμας Databricks και του Lakehouse
- Αρχιτεκτονική και συστατικά του Databricks Lakehouse
- Οργάνωση χώρων εργασίας και καταλόγων
Χώρος Εργασίας και Notebooks στο Databricks
- Πλοήγηση στον χώρο εργασίας και ανάπτυξη βασισμένη σε notebooks
- Οργάνωση κώδικα σε επαναχρησιμοποιήσιμα notebooks
Αρχιτεκτονική και Εκτέλεση του Apache Spark
- Αρχιτεκτονική της εκτέλεσης (runtime) και μοντέλο εκτέλεσης του Spark
- Εκτέλεση με καθυστέρηση (lazy evaluation) και το DAG (Directed Acyclic Graph) των εργασιών
DataFrames και DataFrame API στο PySpark
- Αφηρημένες δομές (abstractions) DataFrames και σχήματα (schemas)
- Βασικές λειτουργίες DataFrames και εκφράσεις στηλών
Μετατροπή SQL σε PySpark DataFrames
- Μετατροπή βασικών κλαύσεων SQL σε λειτουργίες DataFrame
- Συναρτήσεις παραθύρου (window functions) και aggregations στο PySpark
Διαβάσιμο και Γράψιμο Δεδομένων στο Databricks
- Ανάγνωση από κοινές πηγές αρχείων και βάσεων δεδομένων
- Γράψιμο και partitioning δεδομένων στο Lakehouse
Delta Lake και Διαχείριση Πινάκων
- Πίνακες Delta και συναλλαγές ACID
- Time travel και εξέλιξη του schema (schema evolution)
Μοτίβα Καθαρισμού και Μετασχηματισμού Δεδομένων
- Καθαρισμός δεδομένων και μετατροπή τύπων
- Δημιουργία επαναχρησιμοποιήσιμης λογικής μετασχηματισμού
Συναρτήσεις που Ορίζονται από τον Χρήστη (UDFs) και Μοντέρνος Κώδικας
- Python UDFs και pandas UDFs
- Μοντελοποίηση της διαδραστικής λογικής σε συναρτήσεις
Βελτιστοποίηση Απόδοσης και Ρυθμίσεις
- Στρατηγικές partitioning και caching
- Διάγνωσηคอ bottlenecks με τη Spark UI
Θεμελιώδεις Έννοιες του Structured Streaming
- Μοντέλα επεξεργασίας batch versus streaming
- Streaming DataFrames και βασικά aggregations
Εργασίες και Ορχήστρωση Ροών Εργασίας στο Databricks
- Προγραμματισμός notebooks ως εργασιών και tasks
- Κατασκευή πολυβημάτων workflows με εξαρτήσεις
Unity Catalog και Διακυβέρνηση Δεδομένων
- Αρχιτεκτονική του Unity Catalog και ονόματα χώρου (namespaces)
- Έλεγχος πρόσβασης και προέλευση δεδομένων (data lineage)
Δοκιμές, Αποσφαλμάτωση και Πρακτικές Παραγωγής
- Μοναδιαίες δοκιμές (unit testing) της λογικής PySpark
- Αποσφαλμάτωση και πρότυπα ποιότητας κώδικα
Παραδείγματα Εφαρμογής σε Χρηματοοικονομικές Υπηρεσίες
- Κατασκευή μιας end-to-end ETL ροής εργασίας τραπεζικών υπηρεσιών
- Μετατροπή legacy SQL διαδικασιών σε PySpark
Μετοίκηση Φορτίων SQL σε PySpark
- Στρατηγική μετοίκησης και μοτίβα σχεδιασμού
- Incremental μετατροπή existing SQL workflows σε PySpark
Απαιτήσεις
- Εμπειρία με τον προγραμματισμό Python, συμπεριλαμβανομένων συναρτήσεων και τύπων δεδομένων
- Κατανόηση της SQL, συμπεριλαμβανομένων των joins, των aggregations και των subqueries
- Δεν απαιτείται προηγούμενη εμπειρία με το Databricks ή το PySpark
Κοινό-Στόχος
- Μηχανικοί δεδομένων, αναλυτές δεδομένων και επαγγελματίες του κλάδου
- Ομάδες που μετοικούν υπάρχουσες ροές εργασίας βασισμένες σε SQL στο Databricks και το PySpark
Σχόλια (1)
Μου άρεσε το γεγονός ότι ήταν πρακτικό. Ελάφρυνε την εφαρμογή των θεωρητικών γνώσεων με πρακτικά παραδείγματα.
Aurelia-Adriana - Allianz Services Romania
Κομμάτι - Python and Spark for Big Data (PySpark)
Μηχανική Μετάφραση