Επικοινωνήστε μαζί μας

Εξέλιξη Κομματιού

1. Εισαγωγή στη Βαθιά Ενισχυτική Μάθηση

  • Τι είναι η Ενισχυτική Μάθηση;
  • Διαφορά μεταξύ Επιβλεπόμενης, Μη Επιβλεπόμενης και Ενισχυτικής Μάθησης
  • Εφαρμογές της DRL το 2025 (ρομποτική, υγεία, χρηματοοικονομικά, εφοδιαστική αλυσίδα)
  • Κατανόηση του βρόχου αλληλεπίδρασης πράκτορα-περιβάλλοντος

2. Θεμελιώδεις Έννοιες Ενισχυτικής Μάθησης

  • Μαρκοβιανές Διαδικασίες Αποφάσεων (MDP)
  • Συναρτήσεις Κατάστασης, Δράσης, Ανταμοιβής, Πολιτικής και Αξίας
  • Αντιστάθμιση μεταξύ Εξερεύνησης και Εκμετάλλευσης
  • Μέθοδοι Monte Carlo και μάθηση Χρονικής Διαφοράς (TD)

3. Υλοποίηση Βασικών Αλγορίθμων Ενισχυτικής Μάθησης

  • Πινακοποιημένες μέθοδοι: Δυναμικός Προγραμματισμός, Αξιολόγηση Πολιτικής και Επανάληψη
  • Q-Learning και SARSA
  • Εξερεύνηση Epsilon-greedy και στρατηγικές φθίνουσας εξερεύνησης
  • Υλοποίηση περιβαλλόντων ενισχυτικής μάθησης με το OpenAI Gymnasium

4. Μετάβαση στη Βαθιά Ενισχυτική Μάθηση

  • Περιορισμοί των πινακοποιημένων μεθόδων
  • Χρήση νευρωνικών δικτύων για προσέγγιση συναρτήσεων
  • Αρχιτεκτονική και ροή εργασίας του Deep Q-Network (DQN)
  • Experience replay και δίκτυα-στόχοι

5. Προηγμένοι Αλγόριθμοι DRL

  • Double DQN, Dueling DQN και Prioritized Experience Replay
  • Μέθοδοι Policy Gradient: Αλγόριθμος REINFORCE
  • Αρχιτεκτονικές Actor-Critic (A2C, A3C)
  • Proximal Policy Optimization (PPO)
  • Soft Actor-Critic (SAC)

6. Εργασία με Συνεχείς Χώρους Δράσης

  • Προκλήσεις στον συνεχή έλεγχο
  • Χρήση DDPG (Deep Deterministic Policy Gradient)
  • Twin Delayed DDPG (TD3)

7. Πρακτικά Εργαλεία και Πλαίσια

  • Χρήση Stable-Baselines3 και Ray RLlib
  • Καταγραφή και παρακολούθηση με το TensorBoard
  • Ρύθμιση υπερπαραμέτρων για μοντέλα DRL

8. Μηχανική Ανταμοιβών και Σχεδιασμός Περιβάλλοντος

  • Διαμόρφωση ανταμοιβής και εξισορρόπηση ποινών
  • Έννοιες μεταφοράς μάθησης από προσομοίωση σε πραγματικότητα (Sim-to-Real)
  • Δημιουργία προσαρμοσμένου περιβάλλοντος στο Gymnasium

9. Μερικώς Παρατηρήσιμα Περιβάλλοντα και Γενίκευση

  • Διαχείριση ελλιπούς πληροφορίας κατάστασης (POMDPs)
  • Προσεγγίσεις βασισμένες σε μνήμη με χρήση LSTM και RNN
  • Βελτίωση της ευρωστίας και της γενίκευσης του πράκτορα

10. Θεωρία Παιγνίων και Ενισχυτική Μάθηση Πολλαπλών Πρακτόρων

  • Εισαγωγή σε περιβάλλοντα πολλαπλών πρακτόρων
  • Συνεργασία έναντι ανταγωνισμού
  • Εφαρμογές στην αντιπαραθετική εκπαίδευση και τη βελτιστοποίηση στρατηγικής

11. Μελέτες Περιπτώσεων και Πραγματικές Εφαρμογές

  • Προσομοιώσεις αυτόνομης οδήγησης
  • Δυναμική τιμολόγηση και στρατηγικές χρηματοοικονομικών συναλλαγών
  • Ρομποτική και βιομηχανικός αυτοματισμός

12. Επίλυση Προβλημάτων και Βελτιστοποίηση

  • Διάγνωση ασταθούς εκπαίδευσης
  • Διαχείριση αραιότητας ανταμοιβών και υπερπροσαρμογής
  • Κλιμάκωση μοντέλων DRL σε GPU και κατανεμημένα συστήματα

13. Σύνοψη και Επόμενα Βήματα

  • Ανακεφαλαίωση της αρχιτεκτονικής DRL και των βασικών αλγορίθμων
  • Τάσεις της βιομηχανίας και κατευθύνσεις έρευνας (π.χ., RLHF, υβριδικά μοντέλα)
  • Περαιτέρω πόροι και υλικό ανάγνωσης

Απαιτήσεις

  • Άριστη γνώση προγραμματισμού σε Python
  • Κατανόηση Απειροστικού Λογισμού και Γραμμικής Άλγεβρας
  • Βασικές γνώσεις Πιθανοτήτων και Στατιστικής
  • Εμπειρία στην κατασκευή μοντέλων μηχανικής μάθησης με Python και NumPy ή TensorFlow/PyTorch

Κοινό

  • Προγραμματιστές που ενδιαφέρονται για την Τεχνητή Νοημοσύνη και τα ευφυή συστήματα
  • Επιστήμονες Δεδομένων που εξερευνούν πλαίσια ενισχυτικής μάθησης
  • Μηχανικοί Μηχανικής Μάθησης που εργάζονται με αυτόνομα συστήματα
 21 Ώρες

Αριθμός συμμετέχοντων


Τιμή ανά συμμετέχοντα

Σχόλια (3)

Εφεξής Μαθήματα

Σχετικές Κατηγορίες