Two canvases here, because they were two courses.
Data Science is the pandas side: what a row and a column are, then summarizing, plotting, distances and text. Data Mining is the theory side: proximity measures, preprocessing, and classification.
Drawings
Data Science
| Topic | Items |
|---|---|
| What is data | Observation (row), variable (column), cells (values), tabular data on disk (CSV) and in Python (pandas DataFrame) |
| Summarizing a variable | Center (mean, median), spread (variance, standard deviation) |
| Visualizing one variable | Plotting |
| Distributions | Joint, conditional, comparing distributions |
| Relationships | Correlation coefficient (r) between quantitative variables |
| Multivariate + graphics | Multivariate data, grammar of graphics (data, aesthetic mappings, geometric objects, facets, labels, scales, themes) |
| Distances | Distance formula (Pythagorean), higher dimensions |
| Scaling | Standardization, z-score, formula |
| sklearn distances | Calculating distances in scikit-learn |
| Categorical encoding | Dummy / one-hot encoding, ColumnTransformer |
| Split-apply-combine | Selecting columns, proportions |
| Textual data | Document, corpus, text normalization, bag-of-words, n-grams (unigram, bigram), vector space model, tf-idf |
Data Mining
| Part | Topics |
|---|---|
| Part 1 (Ch 1-5) | Types of data sets (four major features), basic statistical descriptions, graphic displays |
| Similarity | Measuring similarity / dissimilarity, issues in proximity calculation, selecting the right measure, using weights to combine similarities, general approach for combining similarities |
| Preprocessing | Data cleaning + cleaning process, integration, transformation (normalization, discretization), reduction |
| Variables | Discrete vs continuous |
| Part 2 (Ch 6-7) | Classification rule matching (conflicts, no-match), precision and recall (formulas), likelihood |