Ενσωμάτωση Μεγάλων Δεδομένων με Talend Κομμάτι εκπαίδευσης
Το Talend Open Studio for Big Data είναι ένα εργαλείο ETL ανοικτού κώδικα για επεξεργασία μεγάλων δεδομένων. Περιλαμβάνει ένα περιβάλλον ανάπτυξης για αλληλεπίδραση με πηγές και προορισμούς Big Data και εκτέλεση εργασιών χωρίς την ανάγκη συγγραφής κώδικα.
Αυτή η εκπαίδευση με εισηγητή (διαδικτυακή ή με φυσική παρουσία) απευθύνεται σε τεχνικό προσωπικό που επιθυμεί να αξιοποιήσει το Talend Open Studio for Big Data για να απλοποιήσει τη διαδικασία ανάγνωσης και επεξεργασίας μεγάλων δεδομένων.
Με την ολοκλήρωση της εκπαίδευσης, οι συμμετέχοντες θα είναι σε θέση:
- Να εγκαθιστούν και να διαμορφώνουν το Talend Open Studio for Big Data.
- Να συνδέονται με συστήματα Big Data όπως Cloudera, HortonWorks, MapR, Amazon EMR και Apache.
- Να κατανοούν και να ρυθμίζουν τα εξαρτήματα και τις συνδέσεις Big Data του Open Studio.
- Να παραμετροποιούν παραμέτρους για αυτόματη παραγωγή κώδικα MapReduce.
- Να χρησιμοποιούν τη διεπαφή drag-and-drop του Open Studio για εκτέλεση εργασιών Hadoop.
- Να δημιουργούν πρωτότυπα αγωγών Big Data.
- Να αυτοματοποιούν έργα ενοποίησης μεγάλων δεδομένων.
Μορφή του Σεμιναρίου
- Διαδραστική διάλεξη και συζήτηση.
- Πολλές ασκήσεις και πρακτική.
- Πρακτική υλοποίηση σε εργαστηριακό περιβάλλον.
Επιλογές Προσαρμογής του Σεμιναρίου
- Για να ζητήσετε προσαρμοσμένη εκπαίδευση για αυτό το σεμινάριο, παρακαλούμε επικοινωνήστε μαζί μας για να το κανονίσουμε.
Εξέλιξη Κομματιού
Εισαγωγή
Επισκόπηση των δυνατοτήτων και της αρχιτεκτονικής του "Open Studio for Big Data"
Εγκατάσταση και ρύθμιση του Open Studio for Big Data
Πλοήγηση στο περιβάλλον χρήστη
Κατανόηση των εξαρτημάτων και συνδέσεων Big Data
Σύνδεση σε σύμπλεγμα Hadoop
Ανάγνωση και εγγραφή δεδομένων
Επεξεργασία δεδομένων με Hive και MapReduce
Ανάλυση των αποτελεσμάτων
Βελτίωση της ποιότητας των μεγάλων δεδομένων
Δημιουργία αγωγού Big Data
Διαχείριση χρηστών, ομάδων, ρόλων και έργων
Ανάπτυξη του Open Studio σε περιβάλλον παραγωγής
Παρακολούθηση του Open Studio
Αντιμετώπιση προβλημάτων
Σύνοψη και Συμπεράσματα
Απαιτήσεις
- Κατανόηση σχεσιακών βάσεων δεδομένων
- Κατανόηση αποθηκών δεδομένων
- Κατανόηση των εννοιών ETL (Extract, Transform, Load)
Κοινό
- Επαγγελματίες Επιχειρηματικής Ευφυΐας
- Επαγγελματίες Βάσεων Δεδομένων
- Προγραμματιστές SQL
- Προγραμματιστές ETL
- Αρχιτέκτονες Λύσεων
- Αρχιτέκτονες Δεδομένων
- Επαγγελματίες Αποθηκών Δεδομένων
- Διαχειριστές και Ολοκληρωτές Συστημάτων
Κομμάτια Εκπαίδευσης χρειάζονται 5+ συμμετέχοντες.
Ενσωμάτωση Μεγάλων Δεδομένων με Talend Κομμάτι εκπαίδευσης - Κράτηση
Ενσωμάτωση Μεγάλων Δεδομένων με Talend Κομμάτι εκπαίδευσης - Ζήτημα Συμβουλευτικής
Ενσωμάτωση Μεγάλων Δεδομένων με Talend - Συμβουλευτική Αίτημα
Σχόλια (1)
Χειροποίητα άσκηση. Η τάξη θα έπρεπε να διαρκέσει 5 ημέρες, αλλά και τις 3 ημέρες βοήθησαν σημαντικά να διευκρινίσω πολλά ερωτήματα που είχα από την εργασία μου με το NiFi.
James - BHG Financial
Κομμάτι - Apache NiFi for Administrators
Μηχανική Μετάφραση
Εφεξής Μαθήματα
Σχετικά Μαθήματα
Προηγμένο Apache Iceberg
21 ΏρεςΑυτή η εκπαίδευση με εισηγητή, που διεξάγεται ζωντανά σε Ελλάδα (online ή δια ζώσης), απευθύνεται σε επαγγελματίες δεδομένων προχωρημένου επιπέδου που επιθυμούν να βελτιστοποιήσουν τις ροές εργασίας επεξεργασίας δεδομένων, να εξασφαλίσουν την ακεραιότητα των δεδομένων και να υλοποιήσουν εύρωστες λύσεις data lakehouse ικανές να αντιμετωπίσουν την πολυπλοκότητα των σύγχρονων εφαρμογών μεγάλων δεδομένων.
Με την ολοκλήρωση αυτής της εκπαίδευσης, οι συμμετέχοντες θα είναι σε θέση:
- Να αποκτήσουν εις βάθος κατανόηση της αρχιτεκτονικής του Iceberg, συμπεριλαμβανομένης της διαχείρισης μεταδεδομένων και της διάταξης αρχείων.
- Να παραμετροποιήσουν το Iceberg για βέλτιστη απόδοση σε διάφορα περιβάλλοντα και να το ενσωματώσουν με πολλαπλές μηχανές επεξεργασίας δεδομένων.
- Να διαχειριστούν πίνακες Iceberg μεγάλης κλίμακας, να πραγματοποιήσουν πολύπλοκες αλλαγές σχήματος και να χειριστούν την εξέλιξη κατατμήσεων.
- Να κατακτήσουν τεχνικές για τη βελτιστοποίηση της απόδοσης ερωτημάτων και της αποδοτικότητας σάρωσης δεδομένων σε μεγάλα σύνολα δεδομένων.
- Να εφαρμόσουν μηχανισμούς για την εξασφάλιση συνέπειας δεδομένων, τη διαχείριση εγγυήσεων συναλλακτικότητας και την αντιμετώπιση αποτυχιών σε κατανεμημένα περιβάλλοντα.
Θεμελιώδεις Αρχές του Apache Iceberg
14 ΏρεςΑυτή η εκπαίδευση με καθοδήγηση εκπαιδευτή, ζωντανά στο Ελλάδα (online ή onsite) απευθύνεται σε επαγγελματίες δεδομένων αρχικού επιπέδου που επιθυμούν να αποκτήσουν τις γνώσεις και τις δεξιότητες που απαιτούνται για την αποτελεσματική χρήση του Apache Iceberg για τη διαχείριση συνόλων δεδομένων μεγάλης κλίμακας, τη διασφάλιση της ακεραιότητας των δεδομένων και τη βελτιστοποίηση των ροών εργασίας επεξεργασίας δεδομένων.
Με την ολοκλήρωση αυτής της εκπαίδευσης, οι συμμετέχοντες θα είναι σε θέση να:
- Αποκτήσουν εμπεριστατωμένη κατανόηση της αρχιτεκτονικής, των χαρακτηριστικών και των πλεονεκτημάτων του Apache Iceberg.
- Μάθουν για τις μορφές πινάκων, τον διαμερισμό, την εξέλιξη σχημάτων και τις δυνατότητες χρονικής περιήγησης.
- Εγκαταστήσουν και παραμετροποιήσουν το Apache Iceberg σε διαφορετικά περιβάλλοντα.
- Δημιουργήσουν, διαχειριστούν και τροποποιήσουν πίνακες Iceberg.
- Κατανοήσουν τη διαδικασία μετεγκατάστασης δεδομένων από άλλες μορφές πινάκων στο Iceberg.
Αναλυτική Μεγάλων Δεδομένων με Google Colab και Apache Spark
14 ΏρεςΑυτή η εκπαίδευση με εισηγητή, ζωντανή (online ή onsite) στο Ελλάδα απευθύνεται σε επιστήμονες δεδομένων και μηχανικούς μεσαίου επιπέδου που επιθυμούν να χρησιμοποιήσουν το Google Colab και το Apache Spark για επεξεργασία και ανάλυση μεγάλων δεδομένων.
Με την ολοκλήρωση αυτής της εκπαίδευσης, οι συμμετέχοντες θα είναι σε θέση να:
- Να ρυθμίσουν ένα περιβάλλον μεγάλων δεδομένων χρησιμοποιώντας το Google Colab και το Spark.
- Να επεξεργάζονται και να αναλύουν αποτελεσματικά μεγάλα σύνολα δεδομένων με το Apache Spark.
- Να οπτικοποιούν μεγάλα δεδομένα σε ένα συνεργατικό περιβάλλον.
- Να ενσωματώνουν το Apache Spark με εργαλεία cloud.
Apache NiFi για Διαχειριστές
21 ΏρεςΤο Apache NiFi είναι μια πλατφόρμα ανοιχτού κώδικα για ενοποίηση δεδομένων και επεξεργασία συμβάντων βασισμένη σε ροές. Επιτρέπει την αυτοματοποιημένη, σε πραγματικό χρόνο δρομολόγηση, μετασχηματισμό και διαμεσολάβηση συστημάτων μεταξύ ετερογενών συστημάτων, με διεπαφή χρήστη μέσω web και λεπτομερή έλεγχο.
Αυτή η ζωντανή εκπαίδευση με εκπαιδευτή (δια ζώσης ή εξ αποστάσεως) απευθύνεται σε διαχειριστές και μηχανικούς μεσαίου επιπέδου που επιθυμούν να αναπτύσσουν, να διαχειρίζονται, να ασφαλίζουν και να βελτιστοποιούν ροές δεδομένων NiFi σε περιβάλλοντα παραγωγής.
Με την ολοκλήρωση αυτής της εκπαίδευσης, οι συμμετέχοντες θα είναι σε θέση:
- Να εγκαθιστούν, να παραμετροποιούν και να συντηρούν συστάδες Apache NiFi.
- Να σχεδιάζουν και να διαχειρίζονται ροές δεδομένων από διάφορες πηγές και προορισμούς.
- Να υλοποιούν αυτοματισμό ροών, δρομολόγηση και λογική μετασχηματισμού.
- Να βελτιστοποιούν την απόδοση, να παρακολουθούν λειτουργίες και να επιλύουν προβλήματα.
Μορφή του Μαθήματος
- Διαδραστική διάλεξη με συζήτηση αρχιτεκτονικής πραγματικού κόσμου.
- Εργαστηριακές ασκήσεις: κατασκευή, ανάπτυξη και διαχείριση ροών.
- Ασκήσεις βασισμένες σε σενάρια σε περιβάλλον ζωντανού εργαστηρίου.
Επιλογές Προσαρμογής Μαθήματος
- Για να ζητήσετε μια προσαρμοσμένη εκπαίδευση για αυτό το μάθημα, παρακαλούμε επικοινωνήστε μαζί μας για να το κανονίσουμε.
PySpark και Μηχανική Μάθηση
21 ΏρεςΑυτή η εκπαίδευση παρέχει μια πρακτική εισαγωγή στη δημιουργία κλιμακώσιμων ροών επεξεργασίας δεδομένων και Μηχανικής Μάθησης χρησιμοποιώντας το PySpark. Οι συμμετέχοντες μαθαίνουν πώς λειτουργεί το Apache Spark μέσα σε σύγχρονα οικοσυστήματα Μεγάλων Δεδομένων και πώς να επεξεργάζονται αποδοτικά μεγάλα σύνολα δεδομένων χρησιμοποιώντας αρχές κατανεμημένου υπολογισμού.
Βασικές αρχές του Apache Spark
21 ΏρεςΑυτή η εκπαίδευση με εισηγητή, ζωντανή σε Ελλάδα (διαδικτυακά ή δια ζώσης) απευθύνεται σε μηχανικούς που επιθυμούν να εγκαταστήσουν και να αναπτύξουν το σύστημα Apache Spark για επεξεργασία πολύ μεγάλου όγκου δεδομένων.
Με την ολοκλήρωση αυτής της εκπαίδευσης, οι συμμετέχοντες θα είναι σε θέση να:
- Εγκαταστήσουν και παραμετροποιήσουν το Apache Spark.
- Επεξεργάζονται και αναλύουν γρήγορα πολύ μεγάλα σύνολα δεδομένων.
- Κατανοήσουν τη διαφορά μεταξύ του Apache Spark και του Hadoop MapReduce και πότε να χρησιμοποιούν το καθένα.
- Ενσωματώσουν το Apache Spark με άλλα εργαλεία μηχανικής μάθησης.
Διαχείριση του Apache Spark
35 ΏρεςΑυτή η εκπαίδευση με εισηγητή, ζωντανά στο Ελλάδα (online ή onsite), απευθύνεται σε διαχειριστές συστημάτων αρχαρίου έως μεσαίου επιπέδου που επιθυμούν να αναπτύξουν, να συντηρήσουν και να βελτιστοποιήσουν συστάδες Spark.
Με την ολοκλήρωση αυτής της εκπαίδευσης, οι συμμετέχοντες θα είναι σε θέση να:
- Εγκαθιστούν και να παραμετροποιούν το Apache Spark σε διάφορα περιβάλλοντα.
- Διαχειρίζονται τους πόρους της συστάδας και να παρακολουθούν τις εφαρμογές Spark.
- Βελτιστοποιούν την απόδοση των συστάδων Spark.
- Εφαρμόζουν μέτρα ασφαλείας και να διασφαλίζουν υψηλή διαθεσιμότητα.
- Εντοπίζουν και να επιλύουν συνήθη προβλήματα του Spark.
Apache Spark στο Cloud
21 ΏρεςΗ καμπύλη μάθησης του Apache Spark αυξάνεται αργά στην αρχή· χρειάζεται μεγάλη προσπάθεια για να επιτευχθούν τα πρώτα αποτελέσματα. Αυτό το μάθημα στοχεύει να ξεπεράσει το αρχικό δύσκολο στάδιο. Μετά την παρακολούθηση, οι συμμετέχοντες θα κατανοήσουν τα βασικά του Apache Spark, θα διακρίνουν σαφώς τα RDD από τα DataFrame, θα μάθουν τα API Python και Scala, θα κατανοήσουν τους εκτελεστές (executors) και τις εργασίες (tasks), κ.λπ. Επίσης, ακολουθώντας τις βέλτιστες πρακτικές, το μάθημα εστιάζει έντονα στην ανάπτυξη στο cloud, στο Databricks και στο AWS. Οι φοιτητές θα κατανοήσουν επίσης τις διαφορές μεταξύ του AWS EMR και του AWS Glue, μιας από τις τελευταίες υπηρεσίες Spark της AWS.
ΑΚΡΟΑΤΗΡΙΟ:
Μηχανικός Δεδομένων, DevOps, Επιστήμονας Δεδομένων
Python και Spark για Μεγάλα Δεδομένα (PySpark)
21 ΏρεςΣε αυτή τη ζωντανή εκπαίδευση με εκπαιδευτή, που διεξάγεται σε Ελλάδα, οι συμμετέχοντες θα μάθουν πώς να συνδυάζουν Python και Spark για την ανάλυση μεγάλων δεδομένων, μέσα από πρακτικές ασκήσεις.
Μέχρι το τέλος αυτής της εκπαίδευσης, οι συμμετέχοντες θα είναι σε θέση:
- Να μάθουν πώς να χρησιμοποιούν το Spark με την Python για την ανάλυση Μεγάλων Δεδομένων.
- Να εργαστούν σε ασκήσεις που προσομοιώνουν πραγματικές περιπτώσεις.
- Να χρησιμοποιήσουν διαφορετικά εργαλεία και τεχνικές για την ανάλυση μεγάλων δεδομένων με το PySpark.
Python, Spark και Hadoop για Μεγάλα Δεδομένα
21 ΏρεςΑυτή η εκπαίδευση με εκπαιδευτή, ζωντανά σε Ελλάδα (online ή onsite) απευθύνεται σε προγραμματιστές που επιθυμούν να χρησιμοποιήσουν και να ενσωματώσουν τα Spark, Hadoop και Python για να επεξεργαστούν, να αναλύσουν και να μετασχηματίσουν μεγάλα και πολύπλοκα σύνολα δεδομένων.
Με την ολοκλήρωση της εκπαίδευσης, οι συμμετέχοντες θα είναι σε θέση να:
- Να ρυθμίσουν το απαραίτητο περιβάλλον για να ξεκινήσουν την επεξεργασία μεγάλων δεδομένων με τα Spark, Hadoop και Python.
- Να κατανοήσουν τα χαρακτηριστικά, τα βασικά στοιχεία και την αρχιτεκτονική των Spark και Hadoop.
- Να μάθουν πώς να ενσωματώνουν τα Spark, Hadoop και Python για επεξεργασία μεγάλων δεδομένων.
- Να εξερευνήσουν τα εργαλεία στο οικοσύστημα του Spark (Spark MlLib, Spark Streaming, Kafka, Sqoop, Kafka και Flume).
- Να δημιουργήσουν συστήματα σύστασης συνεργατικού φιλτραρίσματος παρόμοια με αυτά των Netflix, YouTube, Amazon, Spotify και Google.
- Να χρησιμοποιήσουν το Apache Mahout για κλιμάκωση αλγορίθμων μηχανικής μάθησης.
Stratio: Rocket και Intelligence Modules με PySpark
14 ΏρεςΤο Stratio είναι μια πλατφόρμα με επίκεντρο τα δεδομένα που ενσωματώνει μεγάλα δεδομένα, ΤΝ και διακυβέρνηση σε μία ενιαία λύση. Οι μονάδες Rocket και Intelligence επιτρέπουν ταχεία εξερεύνηση δεδομένων, μετασχηματισμό και προηγμένα αναλυτικά στοιχεία σε επιχειρηματικά περιβάλλοντα.
Αυτή η ζωντανή εκπαίδευση με καθοδήγηση εκπαιδευτή (διαδικτυακή ή δια ζώσης) απευθύνεται σε επαγγελματίες δεδομένων μεσαίου επιπέδου που επιθυμούν να χρησιμοποιήσουν αποτελεσματικά τις μονάδες Rocket και Intelligence του Stratio με PySpark, εστιάζοντας στις δομές επανάληψης, τις συναρτήσεις οριζόμενες από τον χρήστη και την προηγμένη λογική δεδομένων.
Μετά το τέλος αυτής της εκπαίδευσης, οι συμμετέχοντες θα είναι σε θέση να:
- Πλοηγηθούν και να εργαστούν στην πλατφόρμα Stratio χρησιμοποιώντας τις μονάδες Rocket και Intelligence.
- Εφαρμόσουν PySpark στο πλαίσιο της εισαγωγής, του μετασχηματισμού και της ανάλυσης δεδομένων.
- Χρησιμοποιήσουν βρόχους και λογικές συνθήκες για τον έλεγχο ροών εργασίας δεδομένων και εργασιών μηχανικής χαρακτηριστικών.
- Δημιουργήσουν και να διαχειριστούν συναρτήσεις οριζόμενες από τον χρήστη (UDFs) για επαναχρησιμοποιήσιμες λειτουργίες δεδομένων στην PySpark.
Μορφή του Μαθήματος
- Διαδραστική διάλεξη και συζήτηση.
- Πολλές ασκήσεις και πρακτική.
- Πρακτική υλοποίηση σε περιβάλλον ζωντανού εργαστηρίου.
Επιλογές Προσαρμογής Μαθήματος
- Για να ζητήσετε μια προσαρμοσμένη εκπαίδευση για αυτό το μάθημα, παρακαλούμε επικοινωνήστε μαζί μας για να το κανονίσουμε.
Κέντρο Διαχείρισης Talend (TAC)
14 ΏρεςΑυτή η ζωντανή εκπαίδευση με εισηγητή σε Ελλάδα (διαδικτυακά ή δια ζώσης) απευθύνεται σε διαχειριστές συστημάτων, επιστήμονες δεδομένων και αναλυτές επιχειρήσεων που επιθυμούν να εγκαταστήσουν το Κέντρο Διαχείρισης Talend για την ανάπτυξη και διαχείριση των ρόλων και εργασιών του οργανισμού.
Με την ολοκλήρωση αυτής της εκπαίδευσης, οι συμμετέχοντες θα είναι σε θέση να:
- Εγκαταστήσουν και ρυθμίσουν το Κέντρο Διαχείρισης Talend.
- Κατανοήσουν και εφαρμόσουν τις βασικές αρχές διαχείρισης του Talend.
- Δημιουργήσουν, αναπτύξουν και εκτελέσουν επιχειρηματικά έργα ή εργασίες στο Talend.
- Παρακολουθήσουν την ασφάλεια των συνόλων δεδομένων και αναπτύξουν επιχειρηματικές ρουτίνες βασισμένες στο πλαίσιο TAC.
- Αποκτήσουν ευρύτερη κατανόηση των εφαρμογών μεγάλων δεδομένων.
Talend Data Stewardship
14 ΏρεςΑυτή η εκπαίδευση με εισηγητή, ζωντανή σε Ελλάδα (διαδικτυακά ή δια ζώσης), απευθύνεται σε αναλυτές δεδομένων αρχάριου έως μεσαίου επιπέδου που επιθυμούν να εμβαθύνουν τις γνώσεις και τις δεξιότητές τους στη διαχείριση και βελτίωση της ποιότητας δεδομένων με χρήση του Talend Data Stewardship.
Με το τέλος αυτής της εκπαίδευσης, οι συμμετέχοντες θα είναι σε θέση:
- Να αποκτήσουν ολοκληρωμένη κατανόηση του ρόλου της διαχείρισης δεδομένων στη διατήρηση της ποιότητας δεδομένων.
- Να χρησιμοποιούν το Talend Data Stewardship για τη διαχείριση εργασιών ποιότητας δεδομένων.
- Να δημιουργούν, να αναθέτουν και να διαχειρίζονται εργασίες μέσα στο Talend Data Stewardship, συμπεριλαμβανομένης της προσαρμογής ροών εργασίας.
- Να χρησιμοποιούν τις δυνατότητες αναφοράς και παρακολούθησης του εργαλείου για την ιχνηλάτηση της ποιότητας δεδομένων και των προσπαθειών διαχείρισης.
Talend Open Studio for ESB
21 ΏρεςΣε αυτήν την εκπαίδευση με εισηγητή και ζωντανή εξάσκηση Ελλάδα, οι συμμετέχοντες θα μάθουν πώς να χρησιμοποιούν το Talend Open Studio for ESB για να δημιουργούν, να συνδέουν, να διαμεσολαβούν και να διαχειρίζονται υπηρεσίες και τις αλληλεπιδράσεις τους.
Με την ολοκλήρωση αυτής της εκπαίδευσης, οι συμμετέχοντες θα είναι σε θέση να
- Ενσωματώνουν, βελτιώνουν και παραδίδουν τεχνολογίες ESB ως ενιαία πακέτα σε διάφορα περιβάλλοντα ανάπτυξης.
- Κατανοούν και αξιοποιούν τα πιο χρησιμοποιούμενα στοιχεία του Talend Open Studio.
- Ενσωματώνουν οποιαδήποτε εφαρμογή, βάση δεδομένων, API ή υπηρεσίες Web.
- Ενσωματώνουν απρόσκοπτα ετερογενή συστήματα και εφαρμογές.
- Ενσωματώνουν υπάρχουσες βιβλιοθήκες κώδικα Java για την επέκταση έργων.
- Αξιοποιούν στοιχεία και κώδικα από την κοινότητα για την επέκταση έργων.
- Ενσωματώνουν γρήγορα συστήματα, εφαρμογές και πηγές δεδομένων μέσα σε ένα περιβάλλον Eclipse με drag-and-drop.
- Μειώνουν τον χρόνο ανάπτυξης και το κόστος συντήρησης παράγοντας βελτιστοποιημένο, επαναχρησιμοποιήσιμο κώδικα.