Ευχαριστούμε που στάλθηκε η αποσαφήνισή σας! Ένα μέλος της ομάδου μας θα επικοινωνήσει μαζί σας σύντομα.
Ευχαριστούμε για την εκδήλωση κράτησης! Ένας από τους συνεργάτες μας θα επικοινωνήσει μαζί σας σύντομα.
Εξέλιξη Κομματιού
Κάθε συνεδρία είναι 2 ώρες
Ημέρα 1: Συνεδρία 1: Επιχειρηματική Επισκόπηση των Λόγων Χρήσης Επιχειρηματικής Ευφυΐας Μεγάλων Δεδομένων στην Κυβέρνηση
- Μελέτες Περίπτωσης από NIH, DoE
- Ρυθμός υιοθέτησης Μεγάλων Δεδομένων στις κυβερνητικές υπηρεσίες και πώς ευθυγραμμίζουν τη μελλοντική λειτουργία τους γύρω από την Προβλεπτική Αναλυτική Μεγάλων Δεδομένων
- Τομείς εφαρμογής ευρείας κλίμακας σε DoD, NSA, IRS, USDA κ.λπ.
- Διασύνδεση Μεγάλων Δεδομένων με Υπάρχοντα Δεδομένα (Legacy)
- Βασική κατανόηση των ενεργοποιών τεχνολογιών στην προβλεπτική αναλυτική
- Ενοποίηση Δεδομένων και Οπτικοποίηση σε Ταμπλό
- Διαχείριση απάτης
- Δημιουργία επιχειρηματικών κανόνων / κανόνων ανίχνευσης απάτης
- Ανίχνευση και κατάρτιση προφίλ απειλών
- Ανάλυση κόστους-οφέλους για την υλοποίηση Μεγάλων Δεδομένων
Ημέρα 1: Συνεδρία 2: Εισαγωγή στα Μεγάλα Δεδομένα-1
- Κύρια χαρακτηριστικά των Μεγάλων Δεδομένων: όγκος, ποικιλία, ταχύτητα και ακρίβεια. Αρχιτεκτονική MPP για τον όγκο.
- Αποθήκες Δεδομένων – στατικό σχήμα, σύνολα δεδομένων με αργή εξέλιξη
- Βάσεις δεδομένων MPP όπως Greenplum, Exadata, Teradata, Netezza, Vertica κ.λπ.
- Λύσεις βασισμένες σε Hadoop – κανένας περιορισμός στη δομή του συνόλου δεδομένων.
- Τυπικό πρότυπο: HDFS, MapReduce (επεξεργασία), ανάκτηση από το HDFS
- Δέσμη – κατάλληλο για αναλυτικές/μη διαδραστικές λειτουργίες
- Όγκος: CEP ροή δεδομένων
- Τυπικές επιλογές – προϊόντα CEP (π.χ. Infostreams, Apama, MarkLogic κ.λπ.)
- Λιγότερο ώριμα – Storm/S4
- Βάσεις δεδομένων NoSQL – (στήλης και κλειδιού-τιμής): Ιδανικές ως αναλυτικό συμπλήρωμα σε αποθήκες/βάσεις δεδομένων
Ημέρα 1: Συνεδρία 3: Εισαγωγή στα Μεγάλα Δεδομένα-2
Λύσεις NoSQL
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (Ιεραρχικό) - GT.m, Cache
- KV Store (Ταξινομημένο) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- Βάσεις Δεδομένων Αντικειμένων - ZopeDB, DB40, Shoal
- Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Ποικιλίες Δεδομένων: Εισαγωγή στα ζητήματα καθαρισμού δεδομένων στα Μεγάλα Δεδομένα
- RDBMS – στατική δομή/σχήμα, δεν προάγει ευέλικτο, διερευνητικό περιβάλλον.
- NoSQL – ημιδομημένα, αρκετή δομή για αποθήκευση δεδομένων χωρίς ακριβές σχήμα πριν την αποθήκευση
- Ζητήματα καθαρισμού δεδομένων
Ημέρα 1: Συνεδρία 4: Εισαγωγή στα Μεγάλα Δεδομένα-3: Hadoop
- Πότε να επιλέξετε Hadoop;
- ΔΟΜΗΜΕΝΑ – Οι επιχειρηματικές αποθήκες/βάσεις δεδομένων μπορούν να αποθηκεύσουν τεράστια δεδομένα (με κόστος) αλλά επιβάλλουν δομή (δεν είναι κατάλληλο για ενεργητική εξερεύνηση)
- ΗΜΙΔΟΜΗΜΕΝΑ δεδομένα – δύσκολο να τα διαχειριστεί κανείς με παραδοσιακές λύσεις (DW/DB)
- Αποθήκευση δεδομένων = ΤΕΡΑΣΤΙΑ προσπάθεια και στατική ακόμα και μετά την υλοποίηση
- Για ποικιλία και όγκο δεδομένων, επεξεργασία σε υλικό βασικής υποδομής – HADOOP
- Απαιτούμενο βασικό υλικό για τη δημιουργία ενός Hadoop Cluster
Εισαγωγή στο MapReduce / HDFS
- MapReduce – κατανεμημένη υπολογιστική σε πολλαπλούς διακομιστές
- HDFS – κάνει τα δεδομένα τοπικά διαθέσιμα για την υπολογιστική διαδικασία (με πλεονασμό)
- Δεδομένα – μπορούν να είναι αδόμητα/χωρίς σχήμα (σε αντίθεση με τα RDBMS)
- Ευθύνη του προγραμματιστή να εξάγει νόημα από τα δεδομένα
- Προγραμματισμός MapReduce = εργασία με Java (πλεονεκτήματα/μειονεκτήματα), χειροκίνητη φόρτωση δεδομένων στο HDFS
Ημέρα 2: Συνεδρία 1: Οικοσύστημα Μεγάλων Δεδομένων – Δημιουργία ETL για Μεγάλα Δεδομένα: σύμπαν εργαλείων Μεγάλων Δεδομένων – ποιο να χρησιμοποιήσετε και πότε;
- Hadoop έναντι άλλων λύσεων NoSQL
- Για διαδραστική, τυχαία πρόσβαση σε δεδομένα
- Hbase (στήλης βάση δεδομένων) πάνω από Hadoop
- Τυχαία πρόσβαση σε δεδομένα αλλά με περιορισμούς (μέγιστο 1 PB)
- Δεν είναι κατάλληλο για ad-hoc αναλυτική, κατάλληλο για καταγραφή, μέτρηση, χρονοσειρές
- Sqoop – Εισαγωγή από βάσεις δεδομένων σε Hive ή HDFS (πρόσβαση JDBC/ODBC)
- Flume – Ροή δεδομένων (π.χ. δεδομένα καταγραφής) σε HDFS
Ημέρα 2: Συνεδρία 2: Σύστημα Διαχείρισης Μεγάλων Δεδομένων
- Κινούμενα μέρη, κόμβοι επεξεργασίας που εκκινούν/αποτυγχάνουν: ZooKeeper – για υπηρεσίες παραμετροποίησης/συντονισμού/ονοματοδοσίας
- Πολύπλοκο pipeline/ροή εργασίας: Oozie – διαχείριση ροών εργασίας, εξαρτήσεων, αλυσίδων
- Εγκατάσταση, παραμετροποίηση, διαχείριση συστάδων, αναβαθμίσεις κ.λπ. (διαχείριση συστήματος): Ambari
- Στο Cloud: Whirr
Ημέρα 2: Συνεδρία 3: Προβλεπτική Αναλυτική στην Επιχειρηματική Ευφυΐα -1: Θεμελιώδεις Τεχνικές & BI βασισμένη σε Μηχανική Μάθηση:
- Εισαγωγή στη Μηχανική Μάθηση
- Τεχνικές εκμάθησης ταξινόμησης
- Πρόβλεψη κατά Bayes – προετοιμασία αρχείου εκπαίδευσης
- Μηχανές Διανυσμάτων Υποστήριξης (SVM)
- KNN p-Tree Άλγεβρα & κατακόρυφη εξόρυξη
- Νευρωνικά Δίκτυα
- Πρόβλημα μεγάλων μεταβλητών στα Μεγάλα Δεδομένα – Τυχαίο Δάσος (RF)
- Πρόβλημα αυτοματισμού Μεγάλων Δεδομένων – Πολύ-μοντελικό σύνολο RF
- Αυτοματισμός μέσω Soft10-M
- Εργαλείο ανάλυσης κειμένου – Treeminer
- Ευέλικτη μάθηση (Agile learning)
- Μάθηση βασισμένη σε πράκτορες (Agent based learning)
- Κατανεμημένη μάθηση (Distributed learning)
- Εισαγωγή σε εργαλεία ανοικτού κώδικα για προβλεπτική αναλυτική: R, Rapidminer, Mahut
Ημέρα 2: Συνεδρία 4: Οικοσύστημα Προβλεπτικής Αναλυτικής-2: Συνήθη προβλήματα προβλεπτικής αναλυτικής στο Δημόσιο
- Αναλυτική Ενόρασης (Insight analytic)
- Αναλυτική Οπτικοποίησης (Visualization analytic)
- Δομημένη Προβλεπτική Αναλυτική
- Αδόμητη Προβλεπτική Αναλυτική
- Κατάρτιση προφίλ απειλών/δόλιων προμηθευτών
- Μηχανή Συστάσεων (Recommendation Engine)
- Ανίχνευση Προτύπων
- Ανακάλυψη Κανόνων/Σεναρίων – αποτυχία, απάτη, βελτιστοποίηση
- Ανακάλυψη Ριζικών Αιτίων
- Ανάλυση Συναισθήματος
- Αναλυτική CRM
- Αναλυτική Δικτύου
- Αναλυτική Κειμένου
- Επανεξέταση με υποβοήθηση τεχνολογίας (Technology Assisted Review)
- Αναλυτική Απάτης
- Αναλυτική Πραγματικού Χρόνου
Ημέρα 3: Συνεδρία 1: Επεκτάσιμη Αναλυτική Πραγματικού Χρόνου πάνω από Hadoop
- Γιατί οι συνηθισμένοι αλγόριθμοι αναλυτικής αποτυγχάνουν σε Hadoop/HDFS
- Apache Hama – για μαζικό σύγχρονο κατανεμημένο υπολογισμό (Bulk Synchronous)
- Apache SPARK – για υπολογιστική σε συστάδες για αναλυτική πραγματικού χρόνου
- CMU Graphics Lab2 – προσέγγιση βασισμένη σε γράφους για ασύγχρονο κατανεμημένο υπολογισμό
- Προσέγγιση βασισμένη στην άλγεβρα KNN p-Algebra από το Treeminer για μειωμένο κόστος υλικού λειτουργίας
Ημέρα 3: Συνεδρία 2: Εργαλεία για eDiscovery και Ψηφιακή Εγκληματολογία
- eDiscovery πάνω από Μεγάλα Δεδομένα vs. Υπάρχοντα δεδομένα – σύγκριση κόστους και απόδοσης
- Προβλεπτική κωδικοποίηση και επανεξέταση με υποβοήθηση τεχνολογίας (TAR)
- Ζωντανή επίδειξη προϊόντος TAR (vMiner) για να κατανοηθεί πώς λειτουργεί το TAR για ταχύτερη ανακάλυψη
- Ταχύτερη ευρετηρίαση μέσω HDFS – ταχύτητα δεδομένων
- NLP ή Επεξεργασία Φυσικής Γλώσσας – διάφορες τεχνικές και προϊόντα ανοικτού κώδικα
- eDiscovery σε ξένες γλώσσες – τεχνολογία επεξεργασίας ξένων γλωσσών
Ημέρα 3: Συνεδρία 3: BI Μεγάλων Δεδομένων για την Κυβερνοασφάλεια – Κατανόηση της πλήρους 360 μοιρών εικόνας από την ταχεία συλλογή δεδομένων έως τον εντοπισμό απειλών
- Κατανόηση βασικών αρχών αναλυτικής ασφάλειας – επιφάνεια επίθεσης, εσφαλμένη παραμετροποίηση ασφάλειας, άμυνες κεντρικών υπολογιστών
- Δικτυακή υποδομή / Μεγάλος αγωγός δεδομένων / ETL απόκρισης για αναλυτική πραγματικού χρόνου
- Προδιαγεγραμμένο (Prescriptive) vs προβλεπτικό (Predictive) – Βασισμένο σε σταθερούς κανόνες vs αυτόματη ανακάλυψη κανόνων απειλών από μεταδεδομένα
Ημέρα 3: Συνεδρία 4: Μεγάλα Δεδομένα στο USDA: Εφαρμογές στη Γεωργία
- Εισαγωγή στο IoT (Internet of Things) για τη γεωργία – Μεγάλα Δεδομένα και έλεγχος βασισμένοι σε αισθητήρες
- Εισαγωγή στη δορυφορική απεικόνιση και τις εφαρμογές της στη γεωργία
- Ενσωμάτωση δεδομένων αισθητήρων και εικόνας για τη γονιμότητα του εδάφους, συστάσεις καλλιέργειας και προγνώσεις
- Γεωργική ασφάλιση και Μεγάλα Δεδομένα
- Πρόβλεψη απωλειών συγκομιδής
Ημέρα 4: Συνεδρία 1: BI Πρόληψης Απάτης από Μεγάλα Δεδομένα στο Δημόσιο – Αναλυτική Απάτης:
- Βασική ταξινόμηση αναλυτικής απάτης – βασισμένη σε κανόνες vs προβλεπτική αναλυτική
- Επιτηρούμενη vs μη επιτηρούμενη Μηχανική Μάθηση για ανίχνευση προτύπων απάτης
- Απάτη προμηθευτή / υπερτιμολόγηση έργων
- Απάτη Medicare και Medicaid – τεχνικές ανίχνευσης απάτης στην επεξεργασία απαιτήσεων
- Απάτες αποζημίωσης ταξιδιωτικών εξόδων
- Απάτες επιστροφών φόρου IRS
- Μελέτες περίπτωσης και ζωντανή επίδειξη θα δοθούν όπου τα δεδομένα είναι διαθέσιμα.
Ημέρα 4: Συνεδρία 2: Αναλυτική Μέσων Κοινωνικής Δικτύωσης – Συλλογή και ανάλυση πληροφοριών
- API ETL Μεγάλων Δεδομένων για εξαγωγή δεδομένων από μέσα κοινωνικής δικτύωσης
- Κείμενο, εικόνα, μεταδεδομένα και βίντεο
- Ανάλυση συναισθήματος από ροές μέσων κοινωνικής δικτύωσης
- Φιλτράρισμα βάσει συμφραζομένων και εκτός συμφραζομένων ροών μέσων κοινωνικής δικτύωσης
- Ταμπλό Μέσων Κοινωνικής Δικτύωσης για ενσωμάτωση διαφορετικών μέσων
- Αυτοματοποιημένη κατάρτιση προφίλ σε μέσα κοινωνικής δικτύωσης
- Ζωντανή επίδειξη κάθε αναλυτικής θα γίνει μέσω του εργαλείου Treeminer.
Ημέρα 4: Συνεδρία 3: Αναλυτική Μεγάλων Δεδομένων στην επεξεργασία εικόνας και τις ροές βίντεο
- Τεχνικές αποθήκευσης εικόνας στα Μεγάλα Δεδομένα – Λύση αποθήκευσης για δεδομένα που υπερβαίνουν τα petabytes
- LTFS και LTO
- GPFS-LTFS (Λύση ιεραρχικής αποθήκευσης για μεγάλα δεδομένα εικόνας)
- Βασικές αρχές αναλυτικής εικόνας
- Αναγνώριση αντικειμένων
- Τμηματοποίηση εικόνας
- Παρακολούθηση κίνησης
- Τρισδιάστατη ανακατασκευή εικόνας
Ημέρα 4: Συνεδρία 4: Εφαρμογές Μεγάλων Δεδομένων στο NIH:
- Αναδυόμενοι τομείς Βιοπληροφορικής
- Μετα-γενετική και ζητήματα εξόρυξης Μεγάλων Δεδομένων
- Προβλεπτική Αναλυτική Μεγάλων Δεδομένων για Φαρμακογονιδιωματική, Μεταβολομική και Πρωτεωμική
- Μεγάλα Δεδομένα στις διαδικασίες κατάντη Γενετικής
- Εφαρμογή προβλεπτικής αναλυτικής Μεγάλων Δεδομένων στη Δημόσια Υγεία
Ταμπλό Μεγάλων Δεδομένων για γρήγορη προσβασιμότητα διαφορετικών δεδομένων και απεικόνιση:
- Ενοποίηση υφιστάμενων πλατφορμών εφαρμογών με Ταμπλό Μεγάλων Δεδομένων
- Διαχείριση Μεγάλων Δεδομένων
- Μελέτη Περίπτωσης Ταμπλό Μεγάλων Δεδομένων: Tableau και Pentaho
- Χρήση εφαρμογών Μεγάλων Δεδομένων για ώθηση υπηρεσιών βάσει τοποθεσίας στο Δημόσιο
- Σύστημα και διαχείριση παρακολούθησης
Ημέρα 5: Συνεδρία 1: Πώς να αιτιολογήσετε την υλοποίηση BI Μεγάλων Δεδομένων εντός ενός οργανισμού:
- Ορισμός της Απόδοσης Επένδυσης (ROI) για την υλοποίηση Μεγάλων Δεδομένων
- Μελέτες περίπτωσης για εξοικονόμηση χρόνου αναλυτή στη συλλογή και προετοιμασία δεδομένων – αύξηση κέρδους παραγωγικότητας
- Μελέτες περίπτωσης για κέρδος εσόδων από εξοικονόμηση κόστους αδειοδοτημένων βάσεων δεδομένων
- Κέρδος εσόδων από υπηρεσίες βάσει τοποθεσίας
- Εξοικονόμηση από την πρόληψη απάτης
- Μια ολοκληρωμένη προσέγγιση μέσω λογιστικών φύλλων για τον υπολογισμό του κατά προσέγγιση κόστους έναντι του κέρδους/εξοικονόμησης εσόδων από την υλοποίηση Μεγάλων Δεδομένων.
Ημέρα 5: Συνεδρία 2: Βήμα-βήμα διαδικασία αντικατάστασης υπαρχόντων συστημάτων δεδομένων με Σύστημα Μεγάλων Δεδομένων:
- Κατανόηση του πρακτικού οδικού χάρτη μετάβασης σε Μεγάλα Δεδομένα
- Ποιες είναι οι σημαντικές πληροφορίες που απαιτούνται πριν από την αρχιτεκτόνηση μιας υλοποίησης Μεγάλων Δεδομένων
- Ποιοι είναι οι διαφορετικοί τρόποι υπολογισμού του όγκου, της ταχύτητας, της ποικιλίας και της ακρίβειας των δεδομένων
- Πώς να εκτιμήσετε την ανάπτυξη των δεδομένων
- Μελέτες περίπτωσης
Ημέρα 5: Συνεδρία 4: Επισκόπηση Προμηθευτών Μεγάλων Δεδομένων και των προϊόντων τους. Ερωτήσεις/Απαντήσεις:
- Accenture
- APTEAN (Formerly CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (Formerly 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Part of EMC)
Απαιτήσεις
- Βασική γνώση επιχειρηματικών λειτουργιών και συστημάτων δεδομένων στο δημόσιο τομέα στον τομέα τους
- Βασική κατανόηση SQL/Oracle ή σχεσιακών βάσεων δεδομένων
- Βασική κατανόηση Στατιστικής (σε επίπεδο λογιστικών φύλλων)
35 Ώρες
Σχόλια (1)
Η ικανότητα του εκπαιδευτή να στοιχειοδοτήσει το μάθημα σύμφωνα με τις ανάγκες της οργάνωσης και όχι απλώς να παρέχει το μάθημα για λόγους παράδοσής του.
Masilonyane - Revenue Services Lesotho
Κομμάτι - Big Data Business Intelligence for Govt. Agencies
Μηχανική Μετάφραση