Επικοινωνήστε μαζί μας

Εξέλιξη Κομματιού

1. Εισαγωγή στη Βαθιά Ενισχυτική Μάθηση

  • Τι είναι η Ενισχυτική Μάθηση;
  • Διαφορά μεταξύ Επιβλεπόμενης, Μη Επιβλεπόμενης και Ενισχυτικής Μάθησης
  • Εφαρμογές της DRL το 2025 (ρομποτική, υγειονομική περίθαλψη, χρηματοοικονομικά, logistics)
  • Κατανόηση του βρόχου αλληλεπίδρασης πράκτορα-περιβάλλοντος

2. Βασικές Αρχές Ενισχυτικής Μάθησης

  • Μαρκοβιανές Διαδικασίες Απόφασης (MDP)
  • Συνάρτησεις Κατάστασης, Δράσης, Ανταμοιβής, Πολιτικής και Αξίας
  • Ανταλλαγή μεταξύ Εξερεύνησης (Exploration) και Εκμετάλλευσης (Exploitation)
  • Μέθοδοι Monte Carlo και Μάθηση Χρονικής Διαφοράς (TD learning)

3. Υλοποίηση Βασικών Αλγορίθμων Ενισχυτικής Μάθησης

  • Μέθοδοι με πίνακες: Δυναμικός Προγραμματισμός, Αξιολόγηση Πολιτικής και Επανάληψη
  • Q-Learning και SARSA
  • Εξερεύνηση epsilon-greedy και στρατηγικές φθίνουσας εξερεύνησης
  • Υλοποίηση περιβαλλόντων Ενισχυτικής Μάθησης με το OpenAI Gymnasium

4. Μετάβαση στη Βαθιά Ενισχυτική Μάθηση

  • Περιορισμοί των μεθόδων με πίνακες
  • Χρήση νευρωνικών δικτύων για προσέγγιση συναρτήσεων
  • Αρχιτεκτονική και ροή εργασίας του Deep Q-Network (DQN)
  • Experience replay και δίκτυα στόχου (target networks)

5. Προηγμένοι Αλγόριθμοι DRL

  • Double DQN, Dueling DQN και Prioritized Experience Replay
  • Μέθοδοι Policy Gradient: αλγόριθμος REINFORCE
  • Αρχιτεκτονικές Actor-Critic (A2C, A3C)
  • Proximal Policy Optimization (PPO)
  • Soft Actor-Critic (SAC)

6. Εργασία με Συνεχείς Χώρους Δράσεων

  • Προκλήσεις στον συνεχή έλεγχο
  • Χρήση του DDPG (Deep Deterministic Policy Gradient)
  • Twin Delayed DDPG (TD3)

7. Πρακτικά Εργαλεία και Πλαίσια

  • Χρήση των Stable-Baselines3 και Ray RLlib
  • Καταγραφή και παρακολούθηση με το TensorBoard
  • Ρύθμιση υπερπαραμέτρων για μοντέλα DRL

8. Μηχανική Ανταμοιβών και Σχεδιασμός Περιβάλλοντος

  • Διαμόρφωση ανταμοιβών (reward shaping) και εξισορρόπηση ποινών
  • Έννοιες μεταφοράς μάθησης από προσομοίωση σε πραγματικό κόσμο (sim-to-real)
  • Δημιουργία προσαρμοσμένων περιβαλλόντων στο Gymnasium

9. Μερικώς Παρατηρήσιμα Περιβάλλοντα και Γενίκευση

  • Διαχείριση ελλιπούς πληροφορίας κατάστασης (POMDPs)
  • Προσεγγίσεις βασισμένες σε μνήμη με χρήση LSTMs και RNNs
  • Βελτίωση της ανθεκτικότητας και της γενίκευσης του πράκτορα

10. Θεωρία Παιγνίων και Ενισχυτική Μάθηση Πολλαπλών Πρακτόρων

  • Εισαγωγή σε περιβάλλοντα πολλαπλών πρακτόρων
  • Συνεργασία έναντι ανταγωνισμού
  • Εφαρμογές στην αντιπαραθετική εκπαίδευση και στη βελτιστοποίηση στρατηγικών

11. Μελέτες Περίπτωσης και Πραγματικές Εφαρμογές

  • Προσομοιώσεις αυτόνομης οδήγησης
  • Δυναμική τιμολόγηση και στρατηγικές χρηματοοικονομικών συναλλαγών
  • Ρομποτική και βιομηχανικός αυτοματισμός

12. Αντιμετώπιση Προβλημάτων και Βελτιστοποίηση

  • Διάγνωση ασταθούς εκπαίδευσης
  • Διαχείριση αραιότητας ανταμοιβών και υπερπροσαρμογής
  • Κλιμάκωση μοντέλων DRL σε GPUs και κατανεμημένα συστήματα

13. Σύνοψη και Επόμενα Βήματα

  • Ανακεφαλαίωση της αρχιτεκτονικής DRL και των βασικών αλγορίθμων
  • Τάσεις του κλάδου και κατευθύνσεις έρευνας (π.χ., RLHF, υβριδικά μοντέλα)
  • Περαιτέρω πηγές και υλικό μελέτης

Απαιτήσεις

  • Επάρκεια στον προγραμματισμό Python
  • Κατανόηση Λογισμού και Γραμμικής Άλγεβρας
  • Βασικές γνώσεις Πιθανοτήτων και Στατιστικής
  • Εμπειρία στην κατασκευή μοντέλων μηχανικής μάθησης με Python και NumPy ή TensorFlow/PyTorch

Κοινό

  • Προγραμματιστές που ενδιαφέρονται για την Τεχνητή Νοημοσύνη και τα ευφυή συστήματα
  • Επιστήμονες δεδομένων που εξερευνούν πλαίσια ενισχυτικής μάθησης
  • Μηχανικοί Μηχανικής Μάθησης που ασχολούνται με αυτόνομα συστήματα
 21 Ώρες

Αριθμός συμμετέχοντων


Τιμή ανά συμμετέχοντα

Σχόλια (3)

Εφεξής Μαθήματα

Σχετικές Κατηγορίες