Επικοινωνήστε μαζί μας

Εξέλιξη Κομματιού

Κάθε συνεδρία διαρκεί 2 ώρες

Ημέρα 1: Συνεδρία 1: Επιχειρηματική Επισκόπηση του Γιατί Επιχειρηματική Ευφυΐα Μεγάλων Δεδομένων στην Κυβέρνηση

  • Μελέτες Περίπτωσης από NIH, DoE
  • Ρυθμός υιοθέτησης Μεγάλων Δεδομένων σε Κυβερνητικούς Οργανισμούς και πώς ευθυγραμμίζουν τη μελλοντική τους λειτουργία γύρω από την Προγνωστική Αναλυτική Μεγάλων Δεδομένων
  • Περιοχές Εφαρμογής Ευρείας Κλίμακας σε DoD, NSA, IRS, USDA κ.λπ.
  • Διασύνδεση Μεγάλων Δεδομένων με Παλαιότερα Δεδομένα
  • Βασική κατανόηση των υποστηρικτικών τεχνολογιών στην προγνωστική αναλυτική
  • Ενοποίηση Δεδομένων και Οπτικοποίηση Πινάκων Ελέγχου
  • Διαχείριση απάτης
  • Δημιουργία Επιχειρηματικών Κανόνων/Ανίχνευσης Απάτης
  • Ανίχνευση απειλών και κατάρτιση προφίλ
  • Ανάλυση κόστους-οφέλους για την υλοποίηση Μεγάλων Δεδομένων

Ημέρα 1: Συνεδρία 2: Εισαγωγή στα Μεγάλα Δεδομένα-1

  • Κύρια χαρακτηριστικά των Μεγάλων Δεδομένων-όγκος, ποικιλία, ταχύτητα και ακρίβεια. Αρχιτεκτονική MPP για όγκο.
  • Αποθήκες Δεδομένων – στατικό σχήμα, αργά εξελισσόμενο σύνολο δεδομένων
  • Βάσεις Δεδομένων MPP όπως Greenplum, Exadata, Teradata, Netezza, Vertica κ.λπ.
  • Λύσεις Βασισμένες σε Hadoop – χωρίς περιορισμούς στη δομή του συνόλου δεδομένων.
  • Τυπικό μοτίβο: HDFS, MapReduce (επεξεργασία), ανάκτηση από HDFS
  • Μαζική επεξεργασία- κατάλληλη για αναλυτική/μη διαδραστική χρήση
  • Όγκος: Δεδομένα ροής CEP
  • Τυπικές επιλογές – Προϊόντα CEP (π.χ. Infostreams, Apama, MarkLogic κ.λπ.)
  • Λιγότερο έτοιμα για παραγωγή – Storm/S4
  • Βάσεις Δεδομένων NoSQL – (στηλοειδείς και κλειδιού-τιμής): Καταλληλότερες ως αναλυτικό συμπλήρωμα σε αποθήκη δεδομένων/βάση δεδομένων

Ημέρα 1: Συνεδρία 3: Εισαγωγή στα Μεγάλα Δεδομένα-2

Λύσεις NoSQL

  • Αποθήκη KV - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • Αποθήκη KV - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • Αποθήκη KV (Ιεραρχική) - GT.m, Cache
  • Αποθήκη KV (Ταξινομημένη) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • Κρυφή μνήμη KV - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Αποθήκη Πλειάδων - Gigaspaces, Coord, Apache River
  • Βάση Δεδομένων Αντικειμένων - ZopeDB, DB40, Shoal
  • Αποθήκη Εγγράφων - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, Βάσεις Δεδομένων XML, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Ευρεία Στηλοειδής Αποθήκη - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Ποικιλίες Δεδομένων: Εισαγωγή στο ζήτημα Καθαρισμού Δεδομένων στα Μεγάλα Δεδομένα

  • RDBMS – στατική δομή/σχήμα, δεν προάγει ευέλικτο, διερευνητικό περιβάλλον.
  • NoSQL – ημιδομημένα, αρκετή δομή για αποθήκευση δεδομένων χωρίς ακριβές σχήμα πριν από την αποθήκευση
  • Ζητήματα καθαρισμού δεδομένων

Ημέρα 1: Συνεδρία 4: Εισαγωγή στα Μεγάλα Δεδομένα-3: Hadoop

  • Πότε να επιλέξετε Hadoop;
  • ΔΟΜΗΜΕΝΑ - Οι εταιρικές αποθήκες δεδομένων/βάσεις δεδομένων μπορούν να αποθηκεύσουν τεράστια δεδομένα (με κόστος) αλλά επιβάλλουν δομή (όχι καλές για ενεργή εξερεύνηση)
  • ΗΜΙΔΟΜΗΜΕΝΑ δεδομένα – δύσκολα με παραδοσιακές λύσεις (DW/DB)
  • Αποθήκευση δεδομένων = ΤΕΡΑΣΤΙΑ προσπάθεια και στατική ακόμη και μετά την υλοποίηση
  • Για ποικιλία και όγκο δεδομένων, επεξεργασία σε βασικό υλικό – HADOOP
  • Βασικό υλικό που απαιτείται για τη δημιουργία μιας συστάδας Hadoop

Εισαγωγή στο Map Reduce / HDFS

  • MapReduce – κατανεμημένος υπολογισμός σε πολλούς διακομιστές
  • HDFS – καθιστά τα δεδομένα διαθέσιμα τοπικά για την υπολογιστική διαδικασία (με πλεονασμό)
  • Δεδομένα – μπορεί να είναι μη δομημένα/χωρίς σχήμα (σε αντίθεση με τα RDBMS)
  • Ευθύνη του προγραμματιστή να κατανοήσει τα δεδομένα
  • Προγραμματισμός MapReduce = εργασία με Java (πλεονεκτήματα/μειονεκτήματα), χειροκίνητη φόρτωση δεδομένων στο HDFS

Ημέρα 2: Συνεδρία 1: Οικοσύστημα Μεγάλων Δεδομένων-Δημιουργία ETL Μεγάλων Δεδομένων: σύμπαν εργαλείων Μεγάλων Δεδομένων-ποιο να χρησιμοποιήσετε και πότε;

  • Hadoop έναντι άλλων λύσεων NoSQL
  • Για διαδραστική, τυχαία πρόσβαση σε δεδομένα
  • Hbase (στηλοειδής βάση δεδομένων) πάνω από Hadoop
  • Τυχαία πρόσβαση σε δεδομένα αλλά με περιορισμούς (μέγιστο 1 PB)
  • Όχι καλή για ad-hoc αναλυτική, καλή για καταγραφή, μέτρηση, χρονοσειρές
  • Sqoop - Εισαγωγή από βάσεις δεδομένων σε Hive ή HDFS (πρόσβαση JDBC/ODBC)
  • Flume – Δεδομένα ροής (π.χ. δεδομένα καταγραφής) στο HDFS

Ημέρα 2: Συνεδρία 2: Σύστημα Διαχείρισης Μεγάλων Δεδομένων

  • Κινούμενα μέρη, κόμβοι υπολογισμού εκκινούν/αποτυγχάνουν: ZooKeeper - Για υπηρεσίες διαμόρφωσης/συντονισμού/ονοματοδοσίας
  • Σύνθετη διοχέτευση/ροή εργασίας: Oozie – διαχείριση ροής εργασίας, εξαρτήσεων, αλυσιδωτών διαδικασιών
  • Ανάπτυξη, διαμόρφωση, διαχείριση συστάδας, αναβάθμιση κ.λπ. (διαχείριση συστήματος): Ambari
  • Στο Νέφος: Whirr

Ημέρα 2: Συνεδρία 3: Προγνωστική αναλυτική στην Επιχειρηματική Ευφυΐα -1: Θεμελιώδεις Τεχνικές και ΕΕ βασισμένη σε Μηχανική Μάθηση:

  • Εισαγωγή στη Μηχανική Μάθηση
  • Εκμάθηση τεχνικών ταξινόμησης
  • Μπεϋζιανή Πρόβλεψη-προετοιμασία αρχείου εκπαίδευσης
  • Μηχανές Διανυσμάτων Υποστήριξης
  • KNN p-Tree Άλγεβρα και κάθετη εξόρυξη
  • Νευρωνικό Δίκτυο
  • Πρόβλημα μεγάλων μεταβλητών Μεγάλων Δεδομένων -Τυχαίο δάσος (RF)
  • Πρόβλημα Αυτοματοποίησης Μεγάλων Δεδομένων – Πολυμοντέλο σύνολο RF
  • Αυτοματοποίηση μέσω Soft10-M
  • Εργαλείο ανάλυσης κειμένου-Treeminer
  • Ευέλικτη μάθηση
  • Μάθηση βασισμένη σε πράκτορες
  • Κατανεμημένη μάθηση
  • Εισαγωγή σε εργαλεία Ανοιχτού Κώδικα για προγνωστική αναλυτική: R, Rapidminer, Mahut

Ημέρα 2: Συνεδρία 4 Οικοσύστημα προγνωστικής αναλυτικής-2: Κοινά προβλήματα προγνωστικής αναλυτικής στην Κυβέρνηση

  • Αναλυτική διορατικότητας
  • Αναλυτική οπτικοποίησης
  • Δομημένη προγνωστική αναλυτική
  • Μη δομημένη προγνωστική αναλυτική
  • Κατάρτιση προφίλ απειλών/απατεώνων/προμηθευτών
  • Μηχανή Συστάσεων
  • Ανίχνευση προτύπων
  • Ανακάλυψη Κανόνων/Σεναρίων – αποτυχία, απάτη, βελτιστοποίηση
  • Ανακάλυψη βαθύτερης αιτίας
  • Ανάλυση συναισθήματος
  • Αναλυτική CRM
  • Αναλυτική δικτύου
  • Αναλυτική Κειμένου
  • Επισκόπηση υποβοηθούμενη από τεχνολογία
  • Αναλυτική απάτης
  • Αναλυτική Πραγματικού Χρόνου

Ημέρα 3: Συνεδρία 1: Αναλυτική Πραγματικού Χρόνου και Κλιμακούμενη πάνω από Hadoop

  • Γιατί αποτυγχάνουν οι κοινοί αλγόριθμοι αναλυτικής σε Hadoop/HDFS
  • Apache Hama- για Μαζικό Σύγχρονο κατανεμημένο υπολογισμό
  • Apache SPARK- για υπολογισμό συστάδας για αναλυτική πραγματικού χρόνου
  • CMU Graphics Lab2- Προσέγγιση βασισμένη σε γράφους και ασύγχρονη για κατανεμημένο υπολογισμό
  • Προσέγγιση βασισμένη σε KNN p-Άλγεβρα από την Treeminer για μειωμένο κόστος υλικού λειτουργίας

Ημέρα 3: Συνεδρία 2: Εργαλεία για eDiscovery και Ψηφιακή Εγκληματολογία

  • eDiscovery πάνω από Μεγάλα Δεδομένα έναντι Παλαιότερων Δεδομένων – σύγκριση κόστους και απόδοσης
  • Προγνωστική κωδικοποίηση και επισκόπηση υποβοηθούμενη από τεχνολογία (TAR)
  • Ζωντανή επίδειξη ενός προϊόντος Tar (vMiner) για κατανόηση του πώς λειτουργεί το TAR για ταχύτερη ανακάλυψη
  • Ταχύτερη ευρετηρίαση μέσω HDFS – ταχύτητα δεδομένων
  • NLP ή Επεξεργασία Φυσικής Γλώσσας – διάφορες τεχνικές και προϊόντα ανοιχτού κώδικα
  • eDiscovery σε ξένες γλώσσες-τεχνολογία για επεξεργασία ξένων γλωσσών

Ημέρα 3: Συνεδρία 3: ΕΕ Μεγάλων Δεδομένων για Κυβερνοασφάλεια – Κατανόηση πλήρους εικόνας 360 μοιρών από την ταχεία συλλογή δεδομένων έως την αναγνώριση απειλών

  • Κατανόηση βασικών αρχών αναλυτικής ασφάλειας-επιφάνεια επίθεσης, εσφαλμένη διαμόρφωση ασφάλειας, άμυνες κεντρικού υπολογιστή
  • Υποδομή δικτύου/ Μεγάλος αγωγός δεδομένων / ETL απόκρισης για αναλυτική πραγματικού χρόνου
  • Καθοδηγητική έναντι προγνωστικής – Σταθεροί κανόνες έναντι αυτόματης ανακάλυψης κανόνων απειλών από Μεταδεδομένα

Ημέρα 3: Συνεδρία 4: Μεγάλα Δεδομένα στο USDA: Εφαρμογή στη Γεωργία

  • Εισαγωγή στο IoT (Διαδίκτυο των Πραγμάτων) για τη γεωργία-Μεγάλα Δεδομένα βασισμένα σε αισθητήρες και έλεγχος
  • Εισαγωγή στη δορυφορική απεικόνιση και την εφαρμογή της στη γεωργία
  • Ενσωμάτωση δεδομένων αισθητήρων και εικόνας για τη γονιμότητα του εδάφους, συστάσεις καλλιέργειας και προβλέψεις
  • Αγροτική ασφάλιση και Μεγάλα Δεδομένα
  • Πρόβλεψη απώλειας καλλιεργειών

Ημέρα 4: Συνεδρία 1: ΕΕ πρόληψης απάτης από Μεγάλα Δεδομένα στην Κυβέρνηση-Αναλυτική απάτης:

  • Βασική ταξινόμηση της αναλυτικής απάτης- βασισμένη σε κανόνες έναντι προγνωστικής αναλυτικής
  • Εποπτευόμενη έναντι μη εποπτευόμενης Μηχανικής Μάθησης για ανίχνευση προτύπων απάτης
  • Απάτη προμηθευτών/υπερχρέωση για έργα
  • Απάτη Medicare και Medicaid- τεχνικές ανίχνευσης απάτης για επεξεργασία απαιτήσεων
  • Απάτες επιστροφής εξόδων ταξιδιού
  • Απάτες επιστροφής φόρου IRS
  • Θα δοθούν μελέτες περίπτωσης και ζωντανές επιδείξεις όπου υπάρχουν διαθέσιμα δεδομένα.

Ημέρα 4: Συνεδρία 2: Αναλυτική Κοινωνικών Μέσων- Συλλογή και ανάλυση πληροφοριών

  • API ETL Μεγάλων Δεδομένων για εξαγωγή δεδομένων κοινωνικών μέσων
  • Κείμενο, εικόνα, μεταδεδομένα και βίντεο
  • Ανάλυση συναισθήματος από ροή κοινωνικών μέσων
  • Συμφραστικό και μη συμφραστικό φιλτράρισμα ροής κοινωνικών μέσων
  • Πίνακας Ελέγχου Κοινωνικών Μέσων για ενσωμάτωση διαφορετικών κοινωνικών μέσων
  • Αυτοματοποιημένη κατάρτιση προφίλ κοινωνικών μέσων
  • Θα δοθεί ζωντανή επίδειξη κάθε αναλυτικής μέσω του εργαλείου Treeminer.

Ημέρα 4: Συνεδρία 3: Αναλυτική Μεγάλων Δεδομένων στην επεξεργασία εικόνας και ροών βίντεο

  • Τεχνικές Αποθήκευσης Εικόνας σε Μεγάλα Δεδομένα- Λύση αποθήκευσης για δεδομένα που υπερβαίνουν τα petabytes
  • LTFS και LTO
  • GPFS-LTFS (Λύση αποθήκευσης σε επίπεδα για μεγάλα δεδομένα εικόνας)
  • Θεμελιώδεις αρχές αναλυτικής εικόνας
  • Αναγνώριση αντικειμένων
  • Κατάτμηση εικόνας
  • Παρακολούθηση κίνησης
  • Τρισδιάστατη ανακατασκευή εικόνας

Ημέρα 4: Συνεδρία 4: Εφαρμογές Μεγάλων Δεδομένων στο NIH:

  • Αναδυόμενοι τομείς Βιοπληροφορικής
  • Μετα-γονιδιωματική και ζητήματα εξόρυξης Μεγάλων Δεδομένων
  • Προγνωστική αναλυτική Μεγάλων Δεδομένων για Φαρμακογονιδιωματική, Μεταβολομική και Πρωτεομική
  • Μεγάλα Δεδομένα σε μεταγενέστερες διαδικασίες Γονιδιωματικής
  • Εφαρμογή προγνωστικής αναλυτικής μεγάλων δεδομένων στη Δημόσια υγεία

Πίνακας Ελέγχου Μεγάλων Δεδομένων για γρήγορη προσβασιμότητα και προβολή ποικίλων δεδομένων:

  • Ενσωμάτωση υπάρχουσας πλατφόρμας εφαρμογών με Πίνακα Ελέγχου Μεγάλων Δεδομένων
  • Διαχείριση Μεγάλων Δεδομένων
  • Μελέτη Περίπτωσης Πίνακα Ελέγχου Μεγάλων Δεδομένων: Tableau και Pentaho
  • Χρήση εφαρμογής Μεγάλων Δεδομένων για προώθηση υπηρεσιών βάσει τοποθεσίας στην Κυβέρνηση
  • Σύστημα παρακολούθησης και διαχείριση

Ημέρα 5: Συνεδρία 1: Πώς να δικαιολογήσετε την υλοποίηση ΕΕ Μεγάλων Δεδομένων εντός ενός οργανισμού:

  • Ορισμός ROI για υλοποίηση Μεγάλων Δεδομένων
  • Μελέτες περίπτωσης για εξοικονόμηση χρόνου Αναλυτή για συλλογή και προετοιμασία Δεδομένων – αύξηση παραγωγικότητας
  • Μελέτες περίπτωσης κέρδους εσόδων από εξοικονόμηση κόστους αδειοδοτημένων βάσεων δεδομένων
  • Κέρδος εσόδων από υπηρεσίες βάσει τοποθεσίας
  • Εξοικονόμηση από πρόληψη απάτης
  • Μια ολοκληρωμένη προσέγγιση λογιστικών φύλλων για υπολογισμό κατά προσέγγιση εξόδων έναντι κέρδους εσόδων/εξοικονόμησης από την υλοποίηση Μεγάλων Δεδομένων.

Ημέρα 5: Συνεδρία 2: Βήμα προς Βήμα διαδικασία αντικατάστασης παλαιότερου συστήματος δεδομένων με Σύστημα Μεγάλων Δεδομένων:

  • Κατανόηση πρακτικού Οδικού Χάρτη Μετάβασης σε Μεγάλα Δεδομένα
  • Ποιες είναι οι σημαντικές πληροφορίες που απαιτούνται πριν από τον σχεδιασμό μιας υλοποίησης Μεγάλων Δεδομένων
  • Ποιοι είναι οι διαφορετικοί τρόποι υπολογισμού του όγκου, της ταχύτητας, της ποικιλίας και της ακρίβειας των δεδομένων
  • Πώς να εκτιμήσετε την ανάπτυξη δεδομένων
  • Μελέτες περίπτωσης

Ημέρα 5: Συνεδρία 4: Επισκόπηση Προμηθευτών Μεγάλων Δεδομένων και επισκόπηση των προϊόντων τους. Συνεδρία Q/A:

  • Accenture
  • APTEAN (Πρώην CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (Πρώην 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Μέρος της EMC)

Απαιτήσεις

  • Βασικές γνώσεις επιχειρησιακής λειτουργίας και συστημάτων δεδομένων στην κυβέρνηση στον τομέα τους
  • Βασική κατανόηση SQL/Oracle ή σχεσιακών βάσεων δεδομένων
  • Βασική κατανόηση Στατιστικής (σε επίπεδο λογιστικών φύλλων)
 35 Ώρες

Αριθμός συμμετέχοντων


Τιμή ανά συμμετέχοντα

Σχόλια (1)

Εφεξής Μαθήματα

Σχετικές Κατηγορίες