Επικοινωνήστε μαζί μας

Εξέλιξη Κομματιού

Κάθε συνεδρία είναι 2 ώρες

Ημέρα 1: Συνεδρία 1: Επιχειρηματική Επισκόπηση των Λόγων Χρήσης Επιχειρηματικής Ευφυΐας Μεγάλων Δεδομένων στην Κυβέρνηση

  • Μελέτες Περίπτωσης από NIH, DoE
  • Ρυθμός υιοθέτησης Μεγάλων Δεδομένων στις κυβερνητικές υπηρεσίες και πώς ευθυγραμμίζουν τη μελλοντική λειτουργία τους γύρω από την Προβλεπτική Αναλυτική Μεγάλων Δεδομένων
  • Τομείς εφαρμογής ευρείας κλίμακας σε DoD, NSA, IRS, USDA κ.λπ.
  • Διασύνδεση Μεγάλων Δεδομένων με Υπάρχοντα Δεδομένα (Legacy)
  • Βασική κατανόηση των ενεργοποιών τεχνολογιών στην προβλεπτική αναλυτική
  • Ενοποίηση Δεδομένων και Οπτικοποίηση σε Ταμπλό
  • Διαχείριση απάτης
  • Δημιουργία επιχειρηματικών κανόνων / κανόνων ανίχνευσης απάτης
  • Ανίχνευση και κατάρτιση προφίλ απειλών
  • Ανάλυση κόστους-οφέλους για την υλοποίηση Μεγάλων Δεδομένων

Ημέρα 1: Συνεδρία 2: Εισαγωγή στα Μεγάλα Δεδομένα-1

  • Κύρια χαρακτηριστικά των Μεγάλων Δεδομένων: όγκος, ποικιλία, ταχύτητα και ακρίβεια. Αρχιτεκτονική MPP για τον όγκο.
  • Αποθήκες Δεδομένων – στατικό σχήμα, σύνολα δεδομένων με αργή εξέλιξη
  • Βάσεις δεδομένων MPP όπως Greenplum, Exadata, Teradata, Netezza, Vertica κ.λπ.
  • Λύσεις βασισμένες σε Hadoop – κανένας περιορισμός στη δομή του συνόλου δεδομένων.
  • Τυπικό πρότυπο: HDFS, MapReduce (επεξεργασία), ανάκτηση από το HDFS
  • Δέσμη – κατάλληλο για αναλυτικές/μη διαδραστικές λειτουργίες
  • Όγκος: CEP ροή δεδομένων
  • Τυπικές επιλογές – προϊόντα CEP (π.χ. Infostreams, Apama, MarkLogic κ.λπ.)
  • Λιγότερο ώριμα – Storm/S4
  • Βάσεις δεδομένων NoSQL – (στήλης και κλειδιού-τιμής): Ιδανικές ως αναλυτικό συμπλήρωμα σε αποθήκες/βάσεις δεδομένων

Ημέρα 1: Συνεδρία 3: Εισαγωγή στα Μεγάλα Δεδομένα-2

Λύσεις NoSQL

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (Ιεραρχικό) - GT.m, Cache
  • KV Store (Ταξινομημένο) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • Βάσεις Δεδομένων Αντικειμένων - ZopeDB, DB40, Shoal
  • Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Ποικιλίες Δεδομένων: Εισαγωγή στα ζητήματα καθαρισμού δεδομένων στα Μεγάλα Δεδομένα

  • RDBMS – στατική δομή/σχήμα, δεν προάγει ευέλικτο, διερευνητικό περιβάλλον.
  • NoSQL – ημιδομημένα, αρκετή δομή για αποθήκευση δεδομένων χωρίς ακριβές σχήμα πριν την αποθήκευση
  • Ζητήματα καθαρισμού δεδομένων

Ημέρα 1: Συνεδρία 4: Εισαγωγή στα Μεγάλα Δεδομένα-3: Hadoop

  • Πότε να επιλέξετε Hadoop;
  • ΔΟΜΗΜΕΝΑ – Οι επιχειρηματικές αποθήκες/βάσεις δεδομένων μπορούν να αποθηκεύσουν τεράστια δεδομένα (με κόστος) αλλά επιβάλλουν δομή (δεν είναι κατάλληλο για ενεργητική εξερεύνηση)
  • ΗΜΙΔΟΜΗΜΕΝΑ δεδομένα – δύσκολο να τα διαχειριστεί κανείς με παραδοσιακές λύσεις (DW/DB)
  • Αποθήκευση δεδομένων = ΤΕΡΑΣΤΙΑ προσπάθεια και στατική ακόμα και μετά την υλοποίηση
  • Για ποικιλία και όγκο δεδομένων, επεξεργασία σε υλικό βασικής υποδομής – HADOOP
  • Απαιτούμενο βασικό υλικό για τη δημιουργία ενός Hadoop Cluster

Εισαγωγή στο MapReduce / HDFS

  • MapReduce – κατανεμημένη υπολογιστική σε πολλαπλούς διακομιστές
  • HDFS – κάνει τα δεδομένα τοπικά διαθέσιμα για την υπολογιστική διαδικασία (με πλεονασμό)
  • Δεδομένα – μπορούν να είναι αδόμητα/χωρίς σχήμα (σε αντίθεση με τα RDBMS)
  • Ευθύνη του προγραμματιστή να εξάγει νόημα από τα δεδομένα
  • Προγραμματισμός MapReduce = εργασία με Java (πλεονεκτήματα/μειονεκτήματα), χειροκίνητη φόρτωση δεδομένων στο HDFS

Ημέρα 2: Συνεδρία 1: Οικοσύστημα Μεγάλων Δεδομένων – Δημιουργία ETL για Μεγάλα Δεδομένα: σύμπαν εργαλείων Μεγάλων Δεδομένων – ποιο να χρησιμοποιήσετε και πότε;

  • Hadoop έναντι άλλων λύσεων NoSQL
  • Για διαδραστική, τυχαία πρόσβαση σε δεδομένα
  • Hbase (στήλης βάση δεδομένων) πάνω από Hadoop
  • Τυχαία πρόσβαση σε δεδομένα αλλά με περιορισμούς (μέγιστο 1 PB)
  • Δεν είναι κατάλληλο για ad-hoc αναλυτική, κατάλληλο για καταγραφή, μέτρηση, χρονοσειρές
  • Sqoop – Εισαγωγή από βάσεις δεδομένων σε Hive ή HDFS (πρόσβαση JDBC/ODBC)
  • Flume – Ροή δεδομένων (π.χ. δεδομένα καταγραφής) σε HDFS

Ημέρα 2: Συνεδρία 2: Σύστημα Διαχείρισης Μεγάλων Δεδομένων

  • Κινούμενα μέρη, κόμβοι επεξεργασίας που εκκινούν/αποτυγχάνουν: ZooKeeper – για υπηρεσίες παραμετροποίησης/συντονισμού/ονοματοδοσίας
  • Πολύπλοκο pipeline/ροή εργασίας: Oozie – διαχείριση ροών εργασίας, εξαρτήσεων, αλυσίδων
  • Εγκατάσταση, παραμετροποίηση, διαχείριση συστάδων, αναβαθμίσεις κ.λπ. (διαχείριση συστήματος): Ambari
  • Στο Cloud: Whirr

Ημέρα 2: Συνεδρία 3: Προβλεπτική Αναλυτική στην Επιχειρηματική Ευφυΐα -1: Θεμελιώδεις Τεχνικές & BI βασισμένη σε Μηχανική Μάθηση:

  • Εισαγωγή στη Μηχανική Μάθηση
  • Τεχνικές εκμάθησης ταξινόμησης
  • Πρόβλεψη κατά Bayes – προετοιμασία αρχείου εκπαίδευσης
  • Μηχανές Διανυσμάτων Υποστήριξης (SVM)
  • KNN p-Tree Άλγεβρα & κατακόρυφη εξόρυξη
  • Νευρωνικά Δίκτυα
  • Πρόβλημα μεγάλων μεταβλητών στα Μεγάλα Δεδομένα – Τυχαίο Δάσος (RF)
  • Πρόβλημα αυτοματισμού Μεγάλων Δεδομένων – Πολύ-μοντελικό σύνολο RF
  • Αυτοματισμός μέσω Soft10-M
  • Εργαλείο ανάλυσης κειμένου – Treeminer
  • Ευέλικτη μάθηση (Agile learning)
  • Μάθηση βασισμένη σε πράκτορες (Agent based learning)
  • Κατανεμημένη μάθηση (Distributed learning)
  • Εισαγωγή σε εργαλεία ανοικτού κώδικα για προβλεπτική αναλυτική: R, Rapidminer, Mahut

Ημέρα 2: Συνεδρία 4: Οικοσύστημα Προβλεπτικής Αναλυτικής-2: Συνήθη προβλήματα προβλεπτικής αναλυτικής στο Δημόσιο

  • Αναλυτική Ενόρασης (Insight analytic)
  • Αναλυτική Οπτικοποίησης (Visualization analytic)
  • Δομημένη Προβλεπτική Αναλυτική
  • Αδόμητη Προβλεπτική Αναλυτική
  • Κατάρτιση προφίλ απειλών/δόλιων προμηθευτών
  • Μηχανή Συστάσεων (Recommendation Engine)
  • Ανίχνευση Προτύπων
  • Ανακάλυψη Κανόνων/Σεναρίων – αποτυχία, απάτη, βελτιστοποίηση
  • Ανακάλυψη Ριζικών Αιτίων
  • Ανάλυση Συναισθήματος
  • Αναλυτική CRM
  • Αναλυτική Δικτύου
  • Αναλυτική Κειμένου
  • Επανεξέταση με υποβοήθηση τεχνολογίας (Technology Assisted Review)
  • Αναλυτική Απάτης
  • Αναλυτική Πραγματικού Χρόνου

Ημέρα 3: Συνεδρία 1: Επεκτάσιμη Αναλυτική Πραγματικού Χρόνου πάνω από Hadoop

  • Γιατί οι συνηθισμένοι αλγόριθμοι αναλυτικής αποτυγχάνουν σε Hadoop/HDFS
  • Apache Hama – για μαζικό σύγχρονο κατανεμημένο υπολογισμό (Bulk Synchronous)
  • Apache SPARK – για υπολογιστική σε συστάδες για αναλυτική πραγματικού χρόνου
  • CMU Graphics Lab2 – προσέγγιση βασισμένη σε γράφους για ασύγχρονο κατανεμημένο υπολογισμό
  • Προσέγγιση βασισμένη στην άλγεβρα KNN p-Algebra από το Treeminer για μειωμένο κόστος υλικού λειτουργίας

Ημέρα 3: Συνεδρία 2: Εργαλεία για eDiscovery και Ψηφιακή Εγκληματολογία

  • eDiscovery πάνω από Μεγάλα Δεδομένα vs. Υπάρχοντα δεδομένα – σύγκριση κόστους και απόδοσης
  • Προβλεπτική κωδικοποίηση και επανεξέταση με υποβοήθηση τεχνολογίας (TAR)
  • Ζωντανή επίδειξη προϊόντος TAR (vMiner) για να κατανοηθεί πώς λειτουργεί το TAR για ταχύτερη ανακάλυψη
  • Ταχύτερη ευρετηρίαση μέσω HDFS – ταχύτητα δεδομένων
  • NLP ή Επεξεργασία Φυσικής Γλώσσας – διάφορες τεχνικές και προϊόντα ανοικτού κώδικα
  • eDiscovery σε ξένες γλώσσες – τεχνολογία επεξεργασίας ξένων γλωσσών

Ημέρα 3: Συνεδρία 3: BI Μεγάλων Δεδομένων για την Κυβερνοασφάλεια – Κατανόηση της πλήρους 360 μοιρών εικόνας από την ταχεία συλλογή δεδομένων έως τον εντοπισμό απειλών

  • Κατανόηση βασικών αρχών αναλυτικής ασφάλειας – επιφάνεια επίθεσης, εσφαλμένη παραμετροποίηση ασφάλειας, άμυνες κεντρικών υπολογιστών
  • Δικτυακή υποδομή / Μεγάλος αγωγός δεδομένων / ETL απόκρισης για αναλυτική πραγματικού χρόνου
  • Προδιαγεγραμμένο (Prescriptive) vs προβλεπτικό (Predictive) – Βασισμένο σε σταθερούς κανόνες vs αυτόματη ανακάλυψη κανόνων απειλών από μεταδεδομένα

Ημέρα 3: Συνεδρία 4: Μεγάλα Δεδομένα στο USDA: Εφαρμογές στη Γεωργία

  • Εισαγωγή στο IoT (Internet of Things) για τη γεωργία – Μεγάλα Δεδομένα και έλεγχος βασισμένοι σε αισθητήρες
  • Εισαγωγή στη δορυφορική απεικόνιση και τις εφαρμογές της στη γεωργία
  • Ενσωμάτωση δεδομένων αισθητήρων και εικόνας για τη γονιμότητα του εδάφους, συστάσεις καλλιέργειας και προγνώσεις
  • Γεωργική ασφάλιση και Μεγάλα Δεδομένα
  • Πρόβλεψη απωλειών συγκομιδής

Ημέρα 4: Συνεδρία 1: BI Πρόληψης Απάτης από Μεγάλα Δεδομένα στο Δημόσιο – Αναλυτική Απάτης:

  • Βασική ταξινόμηση αναλυτικής απάτης – βασισμένη σε κανόνες vs προβλεπτική αναλυτική
  • Επιτηρούμενη vs μη επιτηρούμενη Μηχανική Μάθηση για ανίχνευση προτύπων απάτης
  • Απάτη προμηθευτή / υπερτιμολόγηση έργων
  • Απάτη Medicare και Medicaid – τεχνικές ανίχνευσης απάτης στην επεξεργασία απαιτήσεων
  • Απάτες αποζημίωσης ταξιδιωτικών εξόδων
  • Απάτες επιστροφών φόρου IRS
  • Μελέτες περίπτωσης και ζωντανή επίδειξη θα δοθούν όπου τα δεδομένα είναι διαθέσιμα.

Ημέρα 4: Συνεδρία 2: Αναλυτική Μέσων Κοινωνικής Δικτύωσης – Συλλογή και ανάλυση πληροφοριών

  • API ETL Μεγάλων Δεδομένων για εξαγωγή δεδομένων από μέσα κοινωνικής δικτύωσης
  • Κείμενο, εικόνα, μεταδεδομένα και βίντεο
  • Ανάλυση συναισθήματος από ροές μέσων κοινωνικής δικτύωσης
  • Φιλτράρισμα βάσει συμφραζομένων και εκτός συμφραζομένων ροών μέσων κοινωνικής δικτύωσης
  • Ταμπλό Μέσων Κοινωνικής Δικτύωσης για ενσωμάτωση διαφορετικών μέσων
  • Αυτοματοποιημένη κατάρτιση προφίλ σε μέσα κοινωνικής δικτύωσης
  • Ζωντανή επίδειξη κάθε αναλυτικής θα γίνει μέσω του εργαλείου Treeminer.

Ημέρα 4: Συνεδρία 3: Αναλυτική Μεγάλων Δεδομένων στην επεξεργασία εικόνας και τις ροές βίντεο

  • Τεχνικές αποθήκευσης εικόνας στα Μεγάλα Δεδομένα – Λύση αποθήκευσης για δεδομένα που υπερβαίνουν τα petabytes
  • LTFS και LTO
  • GPFS-LTFS (Λύση ιεραρχικής αποθήκευσης για μεγάλα δεδομένα εικόνας)
  • Βασικές αρχές αναλυτικής εικόνας
  • Αναγνώριση αντικειμένων
  • Τμηματοποίηση εικόνας
  • Παρακολούθηση κίνησης
  • Τρισδιάστατη ανακατασκευή εικόνας

Ημέρα 4: Συνεδρία 4: Εφαρμογές Μεγάλων Δεδομένων στο NIH:

  • Αναδυόμενοι τομείς Βιοπληροφορικής
  • Μετα-γενετική και ζητήματα εξόρυξης Μεγάλων Δεδομένων
  • Προβλεπτική Αναλυτική Μεγάλων Δεδομένων για Φαρμακογονιδιωματική, Μεταβολομική και Πρωτεωμική
  • Μεγάλα Δεδομένα στις διαδικασίες κατάντη Γενετικής
  • Εφαρμογή προβλεπτικής αναλυτικής Μεγάλων Δεδομένων στη Δημόσια Υγεία

Ταμπλό Μεγάλων Δεδομένων για γρήγορη προσβασιμότητα διαφορετικών δεδομένων και απεικόνιση:

  • Ενοποίηση υφιστάμενων πλατφορμών εφαρμογών με Ταμπλό Μεγάλων Δεδομένων
  • Διαχείριση Μεγάλων Δεδομένων
  • Μελέτη Περίπτωσης Ταμπλό Μεγάλων Δεδομένων: Tableau και Pentaho
  • Χρήση εφαρμογών Μεγάλων Δεδομένων για ώθηση υπηρεσιών βάσει τοποθεσίας στο Δημόσιο
  • Σύστημα και διαχείριση παρακολούθησης

Ημέρα 5: Συνεδρία 1: Πώς να αιτιολογήσετε την υλοποίηση BI Μεγάλων Δεδομένων εντός ενός οργανισμού:

  • Ορισμός της Απόδοσης Επένδυσης (ROI) για την υλοποίηση Μεγάλων Δεδομένων
  • Μελέτες περίπτωσης για εξοικονόμηση χρόνου αναλυτή στη συλλογή και προετοιμασία δεδομένων – αύξηση κέρδους παραγωγικότητας
  • Μελέτες περίπτωσης για κέρδος εσόδων από εξοικονόμηση κόστους αδειοδοτημένων βάσεων δεδομένων
  • Κέρδος εσόδων από υπηρεσίες βάσει τοποθεσίας
  • Εξοικονόμηση από την πρόληψη απάτης
  • Μια ολοκληρωμένη προσέγγιση μέσω λογιστικών φύλλων για τον υπολογισμό του κατά προσέγγιση κόστους έναντι του κέρδους/εξοικονόμησης εσόδων από την υλοποίηση Μεγάλων Δεδομένων.

Ημέρα 5: Συνεδρία 2: Βήμα-βήμα διαδικασία αντικατάστασης υπαρχόντων συστημάτων δεδομένων με Σύστημα Μεγάλων Δεδομένων:

  • Κατανόηση του πρακτικού οδικού χάρτη μετάβασης σε Μεγάλα Δεδομένα
  • Ποιες είναι οι σημαντικές πληροφορίες που απαιτούνται πριν από την αρχιτεκτόνηση μιας υλοποίησης Μεγάλων Δεδομένων
  • Ποιοι είναι οι διαφορετικοί τρόποι υπολογισμού του όγκου, της ταχύτητας, της ποικιλίας και της ακρίβειας των δεδομένων
  • Πώς να εκτιμήσετε την ανάπτυξη των δεδομένων
  • Μελέτες περίπτωσης

Ημέρα 5: Συνεδρία 4: Επισκόπηση Προμηθευτών Μεγάλων Δεδομένων και των προϊόντων τους. Ερωτήσεις/Απαντήσεις:

  • Accenture
  • APTEAN (Formerly CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (Formerly 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Part of EMC)

Απαιτήσεις

  • Βασική γνώση επιχειρηματικών λειτουργιών και συστημάτων δεδομένων στο δημόσιο τομέα στον τομέα τους
  • Βασική κατανόηση SQL/Oracle ή σχεσιακών βάσεων δεδομένων
  • Βασική κατανόηση Στατιστικής (σε επίπεδο λογιστικών φύλλων)
 35 Ώρες

Αριθμός συμμετέχοντων


Τιμή ανά συμμετέχοντα

Σχόλια (1)

Εφεξής Μαθήματα

Σχετικές Κατηγορίες