Εξέλιξη Κομματιού
1. Εισαγωγή στη Βαθιά Ενισχυτική Μάθηση
- Τι είναι η Ενισχυτική Μάθηση;
- Διαφορά μεταξύ Επιβλεπόμενης, Μη Επιβλεπόμενης και Ενισχυτικής Μάθησης
- Εφαρμογές της DRL το 2025 (ρομποτική, υγεία, χρηματοοικονομικά, εφοδιαστική αλυσίδα)
- Κατανόηση του βρόχου αλληλεπίδρασης πράκτορα-περιβάλλοντος
2. Θεμελιώδεις Έννοιες Ενισχυτικής Μάθησης
- Μαρκοβιανές Διαδικασίες Αποφάσεων (MDP)
- Συναρτήσεις Κατάστασης, Δράσης, Ανταμοιβής, Πολιτικής και Αξίας
- Αντιστάθμιση μεταξύ Εξερεύνησης και Εκμετάλλευσης
- Μέθοδοι Monte Carlo και μάθηση Χρονικής Διαφοράς (TD)
3. Υλοποίηση Βασικών Αλγορίθμων Ενισχυτικής Μάθησης
- Πινακοποιημένες μέθοδοι: Δυναμικός Προγραμματισμός, Αξιολόγηση Πολιτικής και Επανάληψη
- Q-Learning και SARSA
- Εξερεύνηση Epsilon-greedy και στρατηγικές φθίνουσας εξερεύνησης
- Υλοποίηση περιβαλλόντων ενισχυτικής μάθησης με το OpenAI Gymnasium
4. Μετάβαση στη Βαθιά Ενισχυτική Μάθηση
- Περιορισμοί των πινακοποιημένων μεθόδων
- Χρήση νευρωνικών δικτύων για προσέγγιση συναρτήσεων
- Αρχιτεκτονική και ροή εργασίας του Deep Q-Network (DQN)
- Experience replay και δίκτυα-στόχοι
5. Προηγμένοι Αλγόριθμοι DRL
- Double DQN, Dueling DQN και Prioritized Experience Replay
- Μέθοδοι Policy Gradient: Αλγόριθμος REINFORCE
- Αρχιτεκτονικές Actor-Critic (A2C, A3C)
- Proximal Policy Optimization (PPO)
- Soft Actor-Critic (SAC)
6. Εργασία με Συνεχείς Χώρους Δράσης
- Προκλήσεις στον συνεχή έλεγχο
- Χρήση DDPG (Deep Deterministic Policy Gradient)
- Twin Delayed DDPG (TD3)
7. Πρακτικά Εργαλεία και Πλαίσια
- Χρήση Stable-Baselines3 και Ray RLlib
- Καταγραφή και παρακολούθηση με το TensorBoard
- Ρύθμιση υπερπαραμέτρων για μοντέλα DRL
8. Μηχανική Ανταμοιβών και Σχεδιασμός Περιβάλλοντος
- Διαμόρφωση ανταμοιβής και εξισορρόπηση ποινών
- Έννοιες μεταφοράς μάθησης από προσομοίωση σε πραγματικότητα (Sim-to-Real)
- Δημιουργία προσαρμοσμένου περιβάλλοντος στο Gymnasium
9. Μερικώς Παρατηρήσιμα Περιβάλλοντα και Γενίκευση
- Διαχείριση ελλιπούς πληροφορίας κατάστασης (POMDPs)
- Προσεγγίσεις βασισμένες σε μνήμη με χρήση LSTM και RNN
- Βελτίωση της ευρωστίας και της γενίκευσης του πράκτορα
10. Θεωρία Παιγνίων και Ενισχυτική Μάθηση Πολλαπλών Πρακτόρων
- Εισαγωγή σε περιβάλλοντα πολλαπλών πρακτόρων
- Συνεργασία έναντι ανταγωνισμού
- Εφαρμογές στην αντιπαραθετική εκπαίδευση και τη βελτιστοποίηση στρατηγικής
11. Μελέτες Περιπτώσεων και Πραγματικές Εφαρμογές
- Προσομοιώσεις αυτόνομης οδήγησης
- Δυναμική τιμολόγηση και στρατηγικές χρηματοοικονομικών συναλλαγών
- Ρομποτική και βιομηχανικός αυτοματισμός
12. Επίλυση Προβλημάτων και Βελτιστοποίηση
- Διάγνωση ασταθούς εκπαίδευσης
- Διαχείριση αραιότητας ανταμοιβών και υπερπροσαρμογής
- Κλιμάκωση μοντέλων DRL σε GPU και κατανεμημένα συστήματα
13. Σύνοψη και Επόμενα Βήματα
- Ανακεφαλαίωση της αρχιτεκτονικής DRL και των βασικών αλγορίθμων
- Τάσεις της βιομηχανίας και κατευθύνσεις έρευνας (π.χ., RLHF, υβριδικά μοντέλα)
- Περαιτέρω πόροι και υλικό ανάγνωσης
Απαιτήσεις
- Άριστη γνώση προγραμματισμού σε Python
- Κατανόηση Απειροστικού Λογισμού και Γραμμικής Άλγεβρας
- Βασικές γνώσεις Πιθανοτήτων και Στατιστικής
- Εμπειρία στην κατασκευή μοντέλων μηχανικής μάθησης με Python και NumPy ή TensorFlow/PyTorch
Κοινό
- Προγραμματιστές που ενδιαφέρονται για την Τεχνητή Νοημοσύνη και τα ευφυή συστήματα
- Επιστήμονες Δεδομένων που εξερευνούν πλαίσια ενισχυτικής μάθησης
- Μηχανικοί Μηχανικής Μάθησης που εργάζονται με αυτόνομα συστήματα
Σχόλια (3)
Μου άρεσαν πολύ τα τελικά όπου είχαμε την ευκαιρία να παίξουμε με το CHAT GPT. Η αίθουσα δεν ήταν κατά κάποιον τρόπο η καλύτερη γι' αυτό - αντί να υπάρχει μια μεγάλη τράπεζα, δυο μικρές θα βοήθησαν και θα μπορούσαμε να σχηματίσουμε μικρότερους ομάδες για διαδικασίες υποστήριξης.
Nola - Laramie County Community College
Κομμάτι - Artificial Intelligence (AI) Overview
Μηχανική Μετάφραση
Εργασία από τη βάση με εστιασμένο τρόπο και μετάβαση στην εφαρμογή περιπτώσεων στο ίδιο χρονικό διάστημα
Maggie Webb - Department of Jobs, Regions, and Precincts
Κομμάτι - Artificial Neural Networks, Machine Learning, Deep Thinking
Μηχανική Μετάφραση
Ότι χρησιμοποιούσε πραγματικά δεδομένα επιχειρήσεων. Ο καθηγητής είχε μια πολύ καλή προσέγγιση, κάνοντας τους εκπαιδευόμενους να συμμετέχουν και να ανταγωνίζονται
Jimena Esquivel - Zaklad Uslugowy Hakoman Andrzej Cybulski
Κομμάτι - Applied AI from Scratch in Python
Μηχανική Μετάφραση