Επικοινωνήστε μαζί μας

Εξέλιξη Κομματιού

Εισαγωγή στην Εκπαίδευση με Ενίσχυση και Agentic AI

  • Λήψη αποφάσεων υπό αβεβαιότητα και διαδοχικός σχεδιασμός
  • Βασικά συστατικά της RL: πράκτορες, περιβάλλοντα, καταστάσεις και ανταμοιβές
  • Ρόλος της RL σε προσαρμοστικά και agentic συστήματα AI

Διαδικασίες Αποφάσεων Markov (MDPs)

  • Επίσημος ορισμός και ιδιότητες των MDPs
  • Συνάρτηση τιμής, εξισώσεις Bellman και δυναμικός προγραμματισμός
  • Αξιολόγηση, βελτίωση και επανάληψη πολιτικών

Εκπαίδευση με Ενίσχυση χωρίς Μοντέλο (Model-Free)

  • Μάθηση Monte Carlo και χρονικών διαφορών (TD)
  • Q-learning και SARSA
  • Πρακτική: υλοποίηση επιπέδου πίνακα μεθόδων RL σε Python

Βαθιά Εκπαίδευση με Ενίσχυση

  • Συνδυασμός νευρωνικών δικτύων με RL για προσέγγιση συναρτήσεων
  • Βαθιά Δίκτυα Q (DQN) και αναπαράleitung εμπειρίας
  • Αρχιτεκτονικές Actor-Critic και βαθμοί πολιτικής
  • Πρακτική: εκπαίδευση πράκτορα χρησιμοποιώντας DQN και PPO με Stable-Baselines3

Στρατηγικές Εξερεύνησης και Σχηματισμός Ανταμοιβής

  • Ισορροπία εξερεύνησης έναντι εκμετάλλευσης (ε-greedy, UCB, μέθοδοι εντροπίας)
  • Σχεδιασμός συναρτήσεων ανταμοιβής και αποφυγή ανεπιθύμητων συμπεριφορών
  • Σχηματισμός ανταμοιβής και μάθηση με πρόγραμμα (curriculum learning)

Προχωρημένα Θέματα στην RL και Λήψη Αποφάσεων

  • Εκπαίδευση με ενίσχυση πολλών πράκτορων και στρατηγικές συνεργασίας
  • Ιεραρχική εκπαίδευση με ενίσχυση και πλαίσιο επιλογών (options framework)
  • Offline RL και εκμάθηση μιμής (imitation learning) για ασφαλέστερη ανάπτυξη

Περιβάλλοντα Προσομοίωσης και Αξιολόγηση

  • Χρήση OpenAI Gym και προσαρμοσμένων περιβαλλόντων
  • Συνεχής έναντι διακριτού χώρου δράσεων
  • Δείκτες απόδοσης, σταθερότητας και αποδοτικότητας δειγμάτων του πράκτορα

Ενσωμάτωση RL σε Συστήματα Agentic AI

  • Συνδυασμός σκέψης και RL σε υβριδικές αρχιτεκτονικές πράκτορων
  • Ενσωμάτωση εκπαίδευσης με ενίσχυση με πράκτορες χρήσης εργαλείων
  • Λειτουργικές σκέψεις για κλίμακα και ανάπτυξη

Capstone Project

  • Σχεδιασμός και υλοποίηση πράκτορα εκπαίδευσης με ενίσχυση για μια προσομοιωμένη εργασία
  • Ανάλυση απόδοσης εκπαίδευσης και βελτιστοποίηση υπερπαραμέτρων
  • Δημοσίευση προσαρμοστικής συμπεριφοράς και λήψης αποφάσεων σε agentic περιβάλλον

Σύνοψη και Επόμενα Βήματα

Απαιτήσεις

  • Ισχυρή εξοικείωση με προγραμματισμό Python
  • Στερεή κατανόηση των εννοιών μηχανικής μάθησης και βαθιάς μάθησης
  • Εξοικείωση με γραμμική άλγεβρα, πιθανότητες και βασικές μέθοδοι βελτιστοποίησης

Στόχος Κοινότητας

  • Μηχανικοί εκπαίδευσης με ενίσχυση και εφαρμοσμένοι ερευνητές AI
  • Αναπτύκτορες ρομποτικής και αυτοματοποίησης
  • Ομάδα μηχανικών που εργάζεται σε προσαρμοστικά και agentic συστήματα AI
 28 Ώρες

Αριθμός συμμετέχοντων


Τιμή ανά συμμετέχοντα

Σχόλια (3)

Εφεξής Μαθήματα

Σχετικές Κατηγορίες