Тривалість – 4 лекції по 2 години
Цей курс допоможе слухачам познайомитись з новітніми технологіями і процедурами, зорієнтованими на виявлення вад у наборах табличних даних великих обсягів. Зазвичай такі набори мають недоліки, якщо отримані з джерел невідомого походження, або з відомих, але пошкоджені випадково чи зумисно. Із-за великих розмірів даних шукану інформацію «майнять» з даних досконалими і дороговартісними комп’ютерними засобами. За відсутності великих обчислювальних потужностей це можна реалізувати засобами табличного процесора MS Excel
За 4 заняття можна буде опанувати такі теми:
- Набори даних: вибірковий аналіз; візуалізація даних; інструмент Missing Data Handling;
- Кластеризація: ітераційний алгоритм k-середніх оптимальної кластеризації; інструмент Hierarchical Clustering;
- Короткострокове передбачення: інструмент Partition; метод ARIMA; інструмент Lag Analysis;
- Датамайнінг. Класифікація: інструмент Discriminant Analysis; інструмент Logistic Regression .
