Εξέλιξη Κομματιού
1. Εισαγωγή στη Βαθιά Ενισχυτική Μάθηση
- Τι είναι η Ενισχυτική Μάθηση;
- Διαφορά μεταξύ Επιβλεπόμενης, Μη Επιβλεπόμενης και Ενισχυτικής Μάθησης
- Εφαρμογές της DRL το 2025 (ρομποτική, υγειονομική περίθαλψη, χρηματοοικονομικά, logistics)
- Κατανόηση του βρόχου αλληλεπίδρασης πράκτορα-περιβάλλοντος
2. Βασικές Αρχές Ενισχυτικής Μάθησης
- Μαρκοβιανές Διαδικασίες Απόφασης (MDP)
- Συνάρτησεις Κατάστασης, Δράσης, Ανταμοιβής, Πολιτικής και Αξίας
- Ανταλλαγή μεταξύ Εξερεύνησης (Exploration) και Εκμετάλλευσης (Exploitation)
- Μέθοδοι Monte Carlo και Μάθηση Χρονικής Διαφοράς (TD learning)
3. Υλοποίηση Βασικών Αλγορίθμων Ενισχυτικής Μάθησης
- Μέθοδοι με πίνακες: Δυναμικός Προγραμματισμός, Αξιολόγηση Πολιτικής και Επανάληψη
- Q-Learning και SARSA
- Εξερεύνηση epsilon-greedy και στρατηγικές φθίνουσας εξερεύνησης
- Υλοποίηση περιβαλλόντων Ενισχυτικής Μάθησης με το OpenAI Gymnasium
4. Μετάβαση στη Βαθιά Ενισχυτική Μάθηση
- Περιορισμοί των μεθόδων με πίνακες
- Χρήση νευρωνικών δικτύων για προσέγγιση συναρτήσεων
- Αρχιτεκτονική και ροή εργασίας του Deep Q-Network (DQN)
- Experience replay και δίκτυα στόχου (target networks)
5. Προηγμένοι Αλγόριθμοι DRL
- Double DQN, Dueling DQN και Prioritized Experience Replay
- Μέθοδοι Policy Gradient: αλγόριθμος REINFORCE
- Αρχιτεκτονικές Actor-Critic (A2C, A3C)
- Proximal Policy Optimization (PPO)
- Soft Actor-Critic (SAC)
6. Εργασία με Συνεχείς Χώρους Δράσεων
- Προκλήσεις στον συνεχή έλεγχο
- Χρήση του DDPG (Deep Deterministic Policy Gradient)
- Twin Delayed DDPG (TD3)
7. Πρακτικά Εργαλεία και Πλαίσια
- Χρήση των Stable-Baselines3 και Ray RLlib
- Καταγραφή και παρακολούθηση με το TensorBoard
- Ρύθμιση υπερπαραμέτρων για μοντέλα DRL
8. Μηχανική Ανταμοιβών και Σχεδιασμός Περιβάλλοντος
- Διαμόρφωση ανταμοιβών (reward shaping) και εξισορρόπηση ποινών
- Έννοιες μεταφοράς μάθησης από προσομοίωση σε πραγματικό κόσμο (sim-to-real)
- Δημιουργία προσαρμοσμένων περιβαλλόντων στο Gymnasium
9. Μερικώς Παρατηρήσιμα Περιβάλλοντα και Γενίκευση
- Διαχείριση ελλιπούς πληροφορίας κατάστασης (POMDPs)
- Προσεγγίσεις βασισμένες σε μνήμη με χρήση LSTMs και RNNs
- Βελτίωση της ανθεκτικότητας και της γενίκευσης του πράκτορα
10. Θεωρία Παιγνίων και Ενισχυτική Μάθηση Πολλαπλών Πρακτόρων
- Εισαγωγή σε περιβάλλοντα πολλαπλών πρακτόρων
- Συνεργασία έναντι ανταγωνισμού
- Εφαρμογές στην αντιπαραθετική εκπαίδευση και στη βελτιστοποίηση στρατηγικών
11. Μελέτες Περίπτωσης και Πραγματικές Εφαρμογές
- Προσομοιώσεις αυτόνομης οδήγησης
- Δυναμική τιμολόγηση και στρατηγικές χρηματοοικονομικών συναλλαγών
- Ρομποτική και βιομηχανικός αυτοματισμός
12. Αντιμετώπιση Προβλημάτων και Βελτιστοποίηση
- Διάγνωση ασταθούς εκπαίδευσης
- Διαχείριση αραιότητας ανταμοιβών και υπερπροσαρμογής
- Κλιμάκωση μοντέλων DRL σε GPUs και κατανεμημένα συστήματα
13. Σύνοψη και Επόμενα Βήματα
- Ανακεφαλαίωση της αρχιτεκτονικής DRL και των βασικών αλγορίθμων
- Τάσεις του κλάδου και κατευθύνσεις έρευνας (π.χ., RLHF, υβριδικά μοντέλα)
- Περαιτέρω πηγές και υλικό μελέτης
Απαιτήσεις
- Επάρκεια στον προγραμματισμό Python
- Κατανόηση Λογισμού και Γραμμικής Άλγεβρας
- Βασικές γνώσεις Πιθανοτήτων και Στατιστικής
- Εμπειρία στην κατασκευή μοντέλων μηχανικής μάθησης με Python και NumPy ή TensorFlow/PyTorch
Κοινό
- Προγραμματιστές που ενδιαφέρονται για την Τεχνητή Νοημοσύνη και τα ευφυή συστήματα
- Επιστήμονες δεδομένων που εξερευνούν πλαίσια ενισχυτικής μάθησης
- Μηχανικοί Μηχανικής Μάθησης που ασχολούνται με αυτόνομα συστήματα
Σχόλια (3)
Μου άρεσαν πολύ τα τελικά όπου είχαμε την ευκαιρία να παίξουμε με το CHAT GPT. Η αίθουσα δεν ήταν κατά κάποιον τρόπο η καλύτερη γι' αυτό - αντί να υπάρχει μια μεγάλη τράπεζα, δυο μικρές θα βοήθησαν και θα μπορούσαμε να σχηματίσουμε μικρότερους ομάδες για διαδικασίες υποστήριξης.
Nola - Laramie County Community College
Κομμάτι - Artificial Intelligence (AI) Overview
Μηχανική Μετάφραση
Εργασία από τη βάση με εστιασμένο τρόπο και μετάβαση στην εφαρμογή περιπτώσεων στο ίδιο χρονικό διάστημα
Maggie Webb - Department of Jobs, Regions, and Precincts
Κομμάτι - Artificial Neural Networks, Machine Learning, Deep Thinking
Μηχανική Μετάφραση
Ότι χρησιμοποιούσε πραγματικά δεδομένα επιχειρήσεων. Ο καθηγητής είχε μια πολύ καλή προσέγγιση, κάνοντας τους εκπαιδευόμενους να συμμετέχουν και να ανταγωνίζονται
Jimena Esquivel - Zaklad Uslugowy Hakoman Andrzej Cybulski
Κομμάτι - Applied AI from Scratch in Python
Μηχανική Μετάφραση