Επικοινωνήστε μαζί μας
 Διάρκεια 14 Ώρες

Εξέλιξη Κομματιού

Επισκόπηση Τεχνολογιών Αναγνώρισης Ομιλίας

  • Ιστορία και εξέλιξη της αναγνώρισης ομιλίας
  • Ακουστικά μοντέλα, γλωσσικά μοντέλα και αποκωδικοποίηση
  • Σύγχρονες αρχιτεκτονικές: RNN, transformers και Whisper

Βασικές Αρχές Προεπεξεργασίας Ήχου και Μεταγραφής

  • Χειρισμός μορφών ήχου και ρυθμών δειγματοληψίας
  • Καθαρισμός, περικοπή και κατάτμηση ήχου
  • Δημιουργία κειμένου από ήχο: πραγματικός χρόνος έναντι ομαδικής επεξεργασίας

Πρακτική Εξάσκηση με το Whisper και Άλλα API

  • Εγκατάσταση και χρήση του OpenAI Whisper
  • Κλήση cloud API (Google, Azure) για μεταγραφή
  • Σύγκριση απόδοσης, καθυστέρησης και κόστους

Γλώσσα, Προφορές και Προσαρμογή ανά Τομέα

  • Εργασία με πολλαπλές γλώσσες και προφορές
  • Προσαρμοσμένα λεξιλόγια και ανοχή σε θόρυβο
  • Χειρισμός νομικής, ιατρικής ή τεχνικής γλώσσας

Μορφοποίηση Εξόδου και Ενσωμάτωση

  • Προσθήκη χρονοσφραγίδων, σημείων στίξης και ετικετών ομιλητών
  • Εξαγωγή σε μορφές κειμένου, SRT ή JSON
  • Ενσωμάτωση μεταγραφών σε εφαρμογές ή βάσεις δεδομένων

Εργαστήρια Υλοποίησης Περιπτώσεων Χρήσης

  • Μεταγραφή συσκέψεων, συνεντεύξεων ή podcasts
  • Συστήματα εντολών φωνής-σε-κείμενο
  • Υπότιτλοι πραγματικού χρόνου για ροές βίντεο/ήχου

Αξιολόγηση, Περιορισμοί και Ηθική

  • Μετρικές ακρίβειας και συγκριτική αξιολόγηση μοντέλων
  • Μεροληψία και δικαιοσύνη στα μοντέλα ομιλίας
  • Ζητήματα απορρήτου και συμμόρφωσης

Σύνοψη και Επόμενα Βήματα

Απαιτήσεις

  • Κατανόηση γενικών εννοιών τεχνητής νοημοσύνης και μηχανικής μάθησης
  • Εξοικείωση με μορφές αρχείων ήχου ή πολυμέσων και εργαλεία

Κοινό

  • Επιστήμονες δεδομένων και μηχανικοί τεχνητής νοημοσύνης που εργάζονται με δεδομένα φωνής
  • Προγραμματιστές λογισμικού που δημιουργούν εφαρμογές βασισμένες σε μεταγραφή
  • Οργανισμοί που διερευνούν την αναγνώριση ομιλίας για αυτοματοποίηση

Αριθμός συμμετέχοντων


Τιμή ανά συμμετέχοντα

Εφεξής Μαθήματα

Σχετικές Κατηγορίες