Επικοινωνήστε μαζί μας

Εξέλιξη Κομματιού

PySpark & Μηχανική Μάθηση 

Ενότητα 1: Big Data & Θεμελιώδεις Αρχές Spark

  • Επισκόπηση του οικοσυστήματος Μεγάλων Δεδομένων και ο ρόλος του Spark σε σύγχρονες πλατφόρμες δεδομένων
  • Κατανόηση της αρχιτεκτονικής του Spark: driver, executors, cluster manager, lazy evaluation, DAG και σχεδιασμός εκτέλεσης
  • Διαφορές μεταξύ των APIs RDD και DataFrame και πότε να χρησιμοποιείτε κάθε προσέγγιση
  • Δημιουργία και ρύθμιση του SparkSession και κατανόηση των βασικών αρχών διαμόρφωσης της εφαρμογής

Ενότητα 2: PySpark DataFrames

  • Ανάγνωση και εγγραφή δεδομένων από επιχειρηματικές πηγές και μορφές (CSV, JSON, Parquet, Delta)
  • Εργασία με PySpark DataFrames: μετασχηματισμοί, ενέργειες, εκφράσεις στηλών, φιλτράρισμα, συνενώσεις και συγκεντρωτικές πράξεις
  • Υλοποίηση προχωρημένων λειτουργιών, όπως συναρτήσεις παραθύρων, διαχείριση χρονοσφραγίδων και εργασία με εμφωλευμένα δεδομένα
  • Εφαρμογή ελέγχων ποιότητας δεδομένων και συγγραφή επαναχρησιμοποιήσιμου και συντηρήσιμου κώδικα PySpark

Ενότητα 3: Αποδοτική Επεξεργασία Μεγάλων Συνόλων Δεδομένων

  • Κατανόηση των βασικών αρχών απόδοσης: στρατηγικές κατάτμησης, συμπεριφορά shuffle, προσωρινή αποθήκευση (caching) και μονιμοποίηση (persistence)
  • Χρήση τεχνικών βελτιστοποίησης, συμπεριλαμβανομένων των broadcast joins και ανάλυσης σχεδίων εκτέλεσης
  • Αποδοτική επεξεργασία μεγάλων συνόλων δεδομένων και βέλτιστες πρακτικές για κλιμακώσιμες ροές εργασίας δεδομένων
  • Κατανόηση της εξέλιξης σχημάτων και των σύγχρονων μορφών αποθήκευσης που χρησιμοποιούνται σε επιχειρηματικά περιβάλλοντα

Ενότητα 4: Μηχανική Χαρακτηριστικών σε Κλίμακα

  • Εκτέλεση μηχανικής χαρακτηριστικών με το Spark MLlib: διαχείριση ελλείπουσων τιμών, κωδικοποίηση κατηγορικών μεταβλητών και κλιμάκωση χαρακτηριστικών
  • Σχεδίαση επαναχρησιμοποιήσιμων βημάτων προεπεξεργασίας και προετοιμασία συνόλων δεδομένων για σωληνώσεις Μηχανικής Μάθησης
  • Εισαγωγή στην επιλογή χαρακτηριστικών και τη διαχείριση μη ισορροπημένων συνόλων δεδομένων

Ενότητα 5: Μηχανική Μάθηση με το Spark MLlib

  • Κατανόηση της αρχιτεκτονικής του MLlib και του μοτίβου Estimator/Transformer
  • Εκπαίδευση μοντέλων παλινδρόμησης και ταξινόμησης σε κλίμακα (Γραμμική Παλινδρόμηση, Λογιστική Παλινδρόμηση, Δέντρα Απόφασης, Τυχαίο Δάσος)
  • Σύγκριση μοντέλων και ερμηνεία αποτελεσμάτων σε κατανεμημένες ροές εργασίας Μηχανικής Μάθησης

Ενότητα 6: Ολοκληρωμένες Σωληνώσεις ML

  • Δημιουργία ολοκληρωμένων σωληνώσεων Μηχανικής Μάθησης που συνδυάζουν προεπεξεργασία, μηχανική χαρακτηριστικών και μοντελοποίηση
  • Εφαρμογή στρατηγικών διαχωρισμού σε train/validation/test
  • Εκτέλεση διασταυρούμενης επικύρωσης (cross-validation) και ρύθμισης υπερπαραμέτρων με χρήση αναζήτησης πλέγματος (grid search) και τυχαίας αναζήτησης (random search)
  • Δόμηση αναπαραγώγιμων πειραμάτων Μηχανικής Μάθησης

Ενότητα 7: Αξιολόγηση Μοντέλων & Πρακτική Λήψη Αποφάσεων ML

  • Εφαρμογή κατάλληλων μετρικών αξιολόγησης για προβλήματα παλινδρόμησης και ταξινόμησης
  • Αναγνώριση υπερπροσαρμογής (overfitting) και υποπροσαρμογής (underfitting) και λήψη πρακτικών αποφάσεων επιλογής μοντέλου
  • Ερμηνεία σημαντικότητας χαρακτηριστικών και κατανόηση της συμπεριφοράς του μοντέλου

Ενότητα 8: Παραγωγή & Επιχειρηματικές Πρακτικές

  • Αποθήκευση και φόρτωση μοντέλων στο Spark
  • Υλοποίηση ροών εργασίας ομαδικής πρόβλεψης (batch inference) σε μεγάλα σύνολα δεδομένων
  • Κατανόηση του κύκλου ζωής της Μηχανικής Μάθησης σε επιχειρηματικά περιβάλλοντα
  • Εισαγωγή σε έννοιες versioning, παρακολούθησης πειραμάτων και βασικές στρατηγικές δοκιμών

 

Πρακτικό Αποτέλεσμα

  • Ικανότητα αυτόνομης εργασίας με το PySpark
  • Ικανότητα αποδοτικής επεξεργασίας μεγάλων συνόλων δεδομένων
  • Ικανότητα εκτέλεσης μηχανικής χαρακτηριστικών σε κλίμακα
  • Ικανότητα δημιουργίας κλιμακώσιμων σωληνώσεων Μηχανικής Μάθησης

Απαιτήσεις

Οι συμμετέχοντες θα πρέπει να έχουν το ακόλουθο υπόβαθρο:

Βασικές γνώσεις προγραμματισμού σε Python, συμπεριλαμβανομένης της εργασίας με συναρτήσεις, δομές δεδομένων και βιβλιοθήκες
Θεμελιώδης κατανόηση εννοιών ανάλυσης δεδομένων, όπως σύνολα δεδομένων, μετασχηματισμοί και συγκεντρωτικές πράξεις
Βασικές γνώσεις SQL και εννοιών σχεσιακών δεδομένων
Εισαγωγική κατανόηση των εννοιών της Μηχανικής Μάθησης, όπως σύνολα δεδομένων εκπαίδευσης, χαρακτηριστικά και μετρικές αξιολόγησης
Συνιστάται η εξοικείωση με περιβάλλοντα γραμμής εντολών και βασικές πρακτικές ανάπτυξης λογισμικού

Η εμπειρία με τις βιβλιοθήκες Pandas, NumPy ή παρόμοιες βιβλιοθήκες επεξεργασίας δεδομένων είναι χρήσιμη αλλά όχι υποχρεωτική.

 21 Ώρες

Αριθμός συμμετέχοντων


Τιμή ανά συμμετέχοντα

Σχόλια (1)

Εφεξής Μαθήματα

Σχετικές Κατηγορίες