0.概述
无监督学习和监督学习的区别是,无监督学习使用一个未标记的训练集,而监督学习使用的是一个标记的训练集。换句话说,我们没有一个预期结果的向量,只有一个可以找到结构的特征数据集。
无监督学习可以适用于以下领域:
1.市场细分
2.社会网络分析
3.组织计算机集群
4.天文数据分析
1.K-Means(K-均值)
k-均值算法是自动分组数据到相干子集问题中使用最流行和最广泛的算法。
1.在数据集中随机初始化两个点。(称为聚类中心)。
2.群集分配:根据当前例子距离哪个聚类中心最近,将所有的例子都分配到两个组中的一个。
3.移动聚类中心:计算两个聚类中心组内的所有点的平均值,然后将聚类中心点移动到这些平均值的位置上。
4.重复运行2,3步骤,直到找到我们的聚类。
我们使用的几个主要变量是:
1.K(聚类的数量)
2.训练集(x1,x2,…xm)
3.xi属于实数
注意:我们不使用x0=1这个参数。经过若干次的迭代,算法将会收敛,一旦收敛后,在新的迭代中不会影响现有的集群。
关于非分离聚类的注记:一些数据集没有真正的内分离或自然结构。k-均值仍然可以将您的数据均匀地分割成K个子集,因此在这种情况下仍然有用。
2.代价函数

3.初始化和簇的数目

4.降维(Dimensionality Reduction)

5.主成分分析(Principal Component Analysis)问题描述

6.PCA算法

7.解压缩数据

8.选择主成分的数量

9.使用PCA的建议
