BIT Data Warehousing and Data Mining
Data Warehousing and Data Mining
Subject Code: BIT454
Course Title: Data Warehousing and Data Mining
Course No: BIT454
Nature of Course: Theory & Practical
Full Marks: 100
Pass Marks: 40
Credit Hours: 3
Course Description
Course Objective
Course Contents
Unit 1: Introduction to Data Warehousing (5 Hrs.)
Data Warehouse and Data Warehousing, Differences between Operational Database and Data Warehouse, MOLAP, OLAP Operations, Conceptual Modeling of Data Warehouse, Components of Data Warehouse
Unit 2: Introduction to Data Mining (2 Hrs.)
Motivation for Data Mining, Introduction to Data Mining System, Data Mining Functionalities, KDD, Data Mining Goals
Unit 3: Data Preprocessing (3 Hrs.)
Data Types and Attributes, Various Similarity Measures, Data Cleaning, Data Integration and Transformation, Data Reduction, Data Discretization and Concept Hierarchy Generation
Unit 4: Data Cube Technology (4 Hrs.)
Cube Materialization (Introduction to Full Cube, Iceberg Cube, Closed Cube, Shell Cube), General Strategies for Cube Computation, Attribute Oriented Analysis (Attribute Generalization, Attribute Relevance, Class Comparison)
Unit 5: Mining Frequent Patterns (6 Hrs.)
Frequent Patterns, Market Basket Analysis, Frequent Itemsets, Generating Itemsets and Association Rules, Finding Frequent Itemset (Apriori Algorithm, FP Growth), Generating Association Rules from Frequent Itemset, Limitation and Improving Apriori, Association Mining to Correlation Analysis, Constraint-Based Association Mining
Unit 6: Classification and Prediction (10 Hrs.)
Definition (Classification, Prediction), Learning and Testing of Classification, Classification by Decision Tree Induction, ID3 and Gini Index as Attribute Selection Algorithm, Bayesian Classification, Laplace Smoothing, Classification by Back Propagation, Rule Based Classifier (Decision Tree to Rules, Rule Coverage and Accuracy, Efficiency of Rule Simplification), Support Vector Machine, Associative Classification, Lazy Learners, Accuracy and Error Measures, Ensemble Methods, Issues in Classification
Unit 7: Cluster Analysis (8 Hrs.)
Types of Data in Cluster Analysis, Similarity and Dissimilarity between Objects, Clustering Techniques: Partitioning Methods, Hierarchical Methods, Density-Based Methods, Grid-Based Methods, Model-Based Clustering Methods, Clustering High-Dimensional Data, Constraint-Based Cluster Analysis, Outlier Analysis
Unit 8: Graph Mining and Social Network Analysis (5 Hrs.)
Graph Mining, Why Graph Mining, Graph Mining Algorithm (Beam Search), Mining Frequent Sub-Graph, Apriori Graph, Pattern Growth Graph, Graph Indexing, Social Network Analysis, Characteristics of Social Network (Densification Power Law, Shrinking Diameter, Heavy-Tailed Out-Degree and In-Degree Distributions), Link Mining (Tasks Involved in Link Mining, Challenges Faced by Link Mining), Friends of Friends, Viral Marketing, Community Mining, Theory of Balance, Theory of Status, Conflict Between the Theory of Balance and Status, Predicting Positive and Negative Links
Unit 9: Mining Spatial, Multimedia, Text and Web Data (2 Hrs.)
Spatial Data Mining, Mining Spatial Association, Multimedia Data Mining, An Introduction to Text Mining, Natural Language Processing and Information Extraction, Web Mining (Web Content Mining, Web Structure Mining, Web Usage Mining)
Reference Books
- Han, Jiawei, Micheline Kamber, and Jian Pei. Data Mining: Concepts and Techniques. 3rd ed. Morgan Kaufmann Series in Data Management Systems, Morgan Kaufmann Publishers, July 2011.
- Tan, Pang-Ning, Michael Steinbach, Anuj Karpatne, and Vipin Kumar. Introduction to Data Mining. 2nd ed. Pearson Publisher, 2019.
- Leskovec, Jure, Anand Rajaraman, and Jeffrey D. Ullman. Mining of Massive Datasets. 2014.
Lab Works
The laboratory should contain all the features mentioned in the course, which should include data preprocessing and cleaning, implementing classification, clustering, and association algorithms in any programming language, and data visualization through data mining tools.
