Ευχαριστούμε που στάλθηκε η αποσαφήνισή σας! Ένα μέλος της ομάδου μας θα επικοινωνήσει μαζί σας σύντομα.
Ευχαριστούμε για την εκδήλωση κράτησης! Ένας από τους συνεργάτες μας θα επικοινωνήσει μαζί σας σύντομα.
Διάρκεια 14 Ώρες
Εξέλιξη Κομματιού
Επισκόπηση Τεχνολογιών Αναγνώρισης Ομιλίας
- Ιστορία και εξέλιξη της αναγνώρισης ομιλίας
- Ακουστικά μοντέλα, γλωσσικά μοντέλα και αποκωδικοποίηση
- Σύγχρονες αρχιτεκτονικές: RNN, transformers και Whisper
Βασικές Αρχές Προεπεξεργασίας Ήχου και Μεταγραφής
- Χειρισμός μορφών ήχου και ρυθμών δειγματοληψίας
- Καθαρισμός, περικοπή και κατάτμηση ήχου
- Δημιουργία κειμένου από ήχο: πραγματικός χρόνος έναντι ομαδικής επεξεργασίας
Πρακτική Εξάσκηση με το Whisper και Άλλα API
- Εγκατάσταση και χρήση του OpenAI Whisper
- Κλήση cloud API (Google, Azure) για μεταγραφή
- Σύγκριση απόδοσης, καθυστέρησης και κόστους
Γλώσσα, Προφορές και Προσαρμογή ανά Τομέα
- Εργασία με πολλαπλές γλώσσες και προφορές
- Προσαρμοσμένα λεξιλόγια και ανοχή σε θόρυβο
- Χειρισμός νομικής, ιατρικής ή τεχνικής γλώσσας
Μορφοποίηση Εξόδου και Ενσωμάτωση
- Προσθήκη χρονοσφραγίδων, σημείων στίξης και ετικετών ομιλητών
- Εξαγωγή σε μορφές κειμένου, SRT ή JSON
- Ενσωμάτωση μεταγραφών σε εφαρμογές ή βάσεις δεδομένων
Εργαστήρια Υλοποίησης Περιπτώσεων Χρήσης
- Μεταγραφή συσκέψεων, συνεντεύξεων ή podcasts
- Συστήματα εντολών φωνής-σε-κείμενο
- Υπότιτλοι πραγματικού χρόνου για ροές βίντεο/ήχου
Αξιολόγηση, Περιορισμοί και Ηθική
- Μετρικές ακρίβειας και συγκριτική αξιολόγηση μοντέλων
- Μεροληψία και δικαιοσύνη στα μοντέλα ομιλίας
- Ζητήματα απορρήτου και συμμόρφωσης
Σύνοψη και Επόμενα Βήματα
Απαιτήσεις
- Κατανόηση γενικών εννοιών τεχνητής νοημοσύνης και μηχανικής μάθησης
- Εξοικείωση με μορφές αρχείων ήχου ή πολυμέσων και εργαλεία
Κοινό
- Επιστήμονες δεδομένων και μηχανικοί τεχνητής νοημοσύνης που εργάζονται με δεδομένα φωνής
- Προγραμματιστές λογισμικού που δημιουργούν εφαρμογές βασισμένες σε μεταγραφή
- Οργανισμοί που διερευνούν την αναγνώριση ομιλίας για αυτοματοποίηση