Επικοινωνήστε μαζί μας

Εξέλιξη Κομματιού

Θεμέλια Παραγωγής Tencent Hunyuan

  • Επισκόπηση σεναρίων παροχής μοντέλου Tencent Hunyuan
  • Χαρακτηριστικά παραγωγής μεγάλων μοντέλων και MoE
  • Συχνά σημεία τριβής υστέρησης, ροής εργασιών, και κόστους
  • Ορισμός στόχων επιπέδου υπηρεσίας για φορτία συμπερασμάτων

Αρχιτεκτονική εφαρμογής και ροή παροχής

  • Βασικά στοιχεία του στοίβας παραγωγικού συμπεράσματος
  • Επιλογή μεταξύ μοντέλων εφαρμογής container, on-premise, και cloud
  • Βασικές αρχές φόρτωσης μοντέλου, διαδρομή αιτήματος, και κατανομή GPU
  • Σχεδιασμός για αξιοπιστία και απλότητα λειτουργίας

Βελτιστοποίηση υστέρησης στην πράξη

  • Χρήση βελτιστοποιημένων μηχανισμών συμπερασμάτων όπως TensorRT όπου εφαρμόζεται
  • Έννοιες KV-cache και πρακτική ρύθμιση cache
  • Μείωση υστέρησης εκκίνησης, προθέρμανσης, και απόκρισης
  • Μέτρηση χρόνου για το πρώτο token και ταχύτητας δημιουργίας token

Ροή εργασιών, Ομαδοποίηση, και Αποδοτικότητα GPU

  • Στρατηγικές συνεχούς ομαδοποίησης και ομαδοποίησης αιτημάτων
  • Διαχείριση συναγωνισμού και συμπεριφοράς ουράς
  • Βελτίωση εκμετάλλευσης GPU χωρίς να βλάψει την εμπειρία χρήστη
  • Αντιμετώπιση μακρών πλαισίων και μεικτών φορτίων αιτημάτων

Ποσοστοποίηση και Έλεγχος Κόστους

  • Γιατί η ποσοστοποίηση είναι σημαντική για την παραγωγική παροχή
  • Πρακτικές ισορροπίες FP16, INT8, και άλλες κοινές επιλογές ακρίβειας
  • Ισορροπία ποιότητας μοντέλου, υστέρησης, και κόστους υποδομής
  • Δημιουργία ενός απλού checklist βελτιστοποίησης κόστους

Λειτουργίες, Παρακολούθηση, και Ανασκόπηση Ετοιμότητας

  • Εκκινήσεις αυτοματισμού για υπηρεσίες συμπερασμάτων
  • Παρακολούθηση υστέρησης, ροής εργασιών, χρήσης cache, και υγείας GPU
  • Βασικές αρχές καταγραφής, ειδοποιήσεων, και απόκρισης σε περιστατικά
  • Ανασκόπηση μιας αναφοράς εφαρμογής και δημιουργίας σχεδίου βελτίωσης

Απαιτήσεις

  • Βασική κατανόηση της ανάπτυξης ροών εργασιών και συμπερασμάτων μοντέλων γλώσσας μεγάλων διαστάσεων
  • Εμπειρία με container, cloud ή on-premise υποδομή, και υπηρεσίες βάσει API
  • Γνώση της Python ή των εργασιών μηχανικών συστημάτων

Κοινό-στόχος

  • Μηχανικοί ML που αναπτύσσουν LLMs σε παραγωγικό περιβάλλον
  • Πλατφόρμες μηχανικών υπεύθυνες για τις υπηρεσίες συμπερασμάτων βάσει GPU
  • Αρχιτέκτονες λύσεων σχεδιασμού πλατφορμών παροχής AI κλιμακώσιμων
 14 Ώρες

Αριθμός συμμετέχοντων


Τιμή ανά συμμετέχοντα

Εφεξής Μαθήματα

Σχετικές Κατηγορίες