Two canvases here, because they were two courses.

Data Science is the pandas side: what a row and a column are, then summarizing, plotting, distances and text. Data Mining is the theory side: proximity measures, preprocessing, and classification.

Drawings

Data Science

TopicItems
What is dataObservation (row), variable (column), cells (values), tabular data on disk (CSV) and in Python (pandas DataFrame)
Summarizing a variableCenter (mean, median), spread (variance, standard deviation)
Visualizing one variablePlotting
DistributionsJoint, conditional, comparing distributions
RelationshipsCorrelation coefficient (r) between quantitative variables
Multivariate + graphicsMultivariate data, grammar of graphics (data, aesthetic mappings, geometric objects, facets, labels, scales, themes)
DistancesDistance formula (Pythagorean), higher dimensions
ScalingStandardization, z-score, formula
sklearn distancesCalculating distances in scikit-learn
Categorical encodingDummy / one-hot encoding, ColumnTransformer
Split-apply-combineSelecting columns, proportions
Textual dataDocument, corpus, text normalization, bag-of-words, n-grams (unigram, bigram), vector space model, tf-idf

Data Mining

PartTopics
Part 1 (Ch 1-5)Types of data sets (four major features), basic statistical descriptions, graphic displays
SimilarityMeasuring similarity / dissimilarity, issues in proximity calculation, selecting the right measure, using weights to combine similarities, general approach for combining similarities
PreprocessingData cleaning + cleaning process, integration, transformation (normalization, discretization), reduction
VariablesDiscrete vs continuous
Part 2 (Ch 6-7)Classification rule matching (conflicts, no-match), precision and recall (formulas), likelihood

0 items under this folder.