Ευχαριστούμε που στάλθηκε η αποσαφήνισή σας! Ένα μέλος της ομάδου μας θα επικοινωνήσει μαζί σας σύντομα.
Ευχαριστούμε για την εκδήλωση κράτησης! Ένας από τους συνεργάτες μας θα επικοινωνήσει μαζί σας σύντομα.
Διάρκεια 14 Ώρες
Εξέλιξη Κομματιού
Θεμέλια Παραγωγής Tencent Hunyuan
- Επισκόπηση σεναρίων παροχής μοντέλου Tencent Hunyuan
- Χαρακτηριστικά παραγωγής μεγάλων μοντέλων και MoE
- Συχνά σημεία τριβής υστέρησης, ροής εργασιών, και κόστους
- Ορισμός στόχων επιπέδου υπηρεσίας για φορτία συμπερασμάτων
Αρχιτεκτονική εφαρμογής και ροή παροχής
- Βασικά στοιχεία του στοίβας παραγωγικού συμπεράσματος
- Επιλογή μεταξύ μοντέλων εφαρμογής container, on-premise, και cloud
- Βασικές αρχές φόρτωσης μοντέλου, διαδρομή αιτήματος, και κατανομή GPU
- Σχεδιασμός για αξιοπιστία και απλότητα λειτουργίας
Βελτιστοποίηση υστέρησης στην πράξη
- Χρήση βελτιστοποιημένων μηχανισμών συμπερασμάτων όπως TensorRT όπου εφαρμόζεται
- Έννοιες KV-cache και πρακτική ρύθμιση cache
- Μείωση υστέρησης εκκίνησης, προθέρμανσης, και απόκρισης
- Μέτρηση χρόνου για το πρώτο token και ταχύτητας δημιουργίας token
Ροή εργασιών, Ομαδοποίηση, και Αποδοτικότητα GPU
- Στρατηγικές συνεχούς ομαδοποίησης και ομαδοποίησης αιτημάτων
- Διαχείριση συναγωνισμού και συμπεριφοράς ουράς
- Βελτίωση εκμετάλλευσης GPU χωρίς να βλάψει την εμπειρία χρήστη
- Αντιμετώπιση μακρών πλαισίων και μεικτών φορτίων αιτημάτων
Ποσοστοποίηση και Έλεγχος Κόστους
- Γιατί η ποσοστοποίηση είναι σημαντική για την παραγωγική παροχή
- Πρακτικές ισορροπίες FP16, INT8, και άλλες κοινές επιλογές ακρίβειας
- Ισορροπία ποιότητας μοντέλου, υστέρησης, και κόστους υποδομής
- Δημιουργία ενός απλού checklist βελτιστοποίησης κόστους
Λειτουργίες, Παρακολούθηση, και Ανασκόπηση Ετοιμότητας
- Εκκινήσεις αυτοματισμού για υπηρεσίες συμπερασμάτων
- Παρακολούθηση υστέρησης, ροής εργασιών, χρήσης cache, και υγείας GPU
- Βασικές αρχές καταγραφής, ειδοποιήσεων, και απόκρισης σε περιστατικά
- Ανασκόπηση μιας αναφοράς εφαρμογής και δημιουργίας σχεδίου βελτίωσης
Απαιτήσεις
- Βασική κατανόηση της ανάπτυξης ροών εργασιών και συμπερασμάτων μοντέλων γλώσσας μεγάλων διαστάσεων
- Εμπειρία με container, cloud ή on-premise υποδομή, και υπηρεσίες βάσει API
- Γνώση της Python ή των εργασιών μηχανικών συστημάτων
Κοινό-στόχος
- Μηχανικοί ML που αναπτύσσουν LLMs σε παραγωγικό περιβάλλον
- Πλατφόρμες μηχανικών υπεύθυνες για τις υπηρεσίες συμπερασμάτων βάσει GPU
- Αρχιτέκτονες λύσεων σχεδιασμού πλατφορμών παροχής AI κλιμακώσιμων