0.概述
机器学习包含了许多的算法和设计规则,掌握这些算法对机器学习的设计和改善将会有很大的帮助。参考内容有Standford大学的NG老师的公开课
machine-learning以及自己收集的一些算法介绍资料。
下面是常用算法列表,分类,聚类,相似度常用的算法。我会对每一个算法进行概述在以后的系列文章中。
1.算法列表
分类算法:
1.LogisticRegression(逻辑回归)
2.NeuralNetwork(神经网络)
3.SVM(支持向量机)
4.Bayesian(朴素贝叶斯)
5.HMM(隐含马尔科夫模型)
6.DecisionForest(决策森林)
7.RandomForests(随机森林)
8.Perceptron(感知器算法)
9.RestrictedBoltzmannMachines(有限波尔兹曼)
10.KNN(K邻近)
聚类算法:
1.K-meansClustering(K均值算法)
2.FuzzyK-means(模糊K均值)
3.CanopyClustering(Canopy聚类)
4.LatentDirichletAllocation(LDA聚类)
5.SpectralClustering(谱聚类)
6.ExpectationMaximization(期望最大化聚类)
7.MeanShiftClustering(均值漂移聚类)
8.HierarchicalClustering(层次聚类)
9.DirichletProcessClustering(狄利克雷过程聚类)
相似度算法:
1.EuclideanDistance(欧几里得距离相似度)
2.ManhattanDistance(曼哈顿距离相似度)
3.ChebyshevDistance(切比雪夫距离相似度)
4.MinkowskiDistance(闵可夫斯基距离相似度)
5.MahalanobisDistance(马氏距离)
6.UncenteredCosineSimilarity(余弦相似度)
7.PearsonCorrelationSimilarity(皮尔森相似度)
8.SpearmanCorrelationSimilarity(皮尔斯曼相关系数相似度)
9.LogLikelihoodSimilarity(对数似然相似度)
10.TanimotoCoefficientSimilarity(谷本系数相似度)
11.HammingDistance(汉明距离)
12.JaccardSimilarityCoefficient(杰卡德相似系数)
13.CorrelationCoefficient(相关系数)与CorrelationDistance(相关距离)
14.InformationEntropy(信息熵)
2.机器学习概述
Tom Mitchell 给机器学习一个明确的定义: “A computer program is said to learn from experience E with respect to some class of tasks T and performance measure P, if its performance at tasks in T, as measured by P, improves with experience E.”
一般来说,任何机器学习问题可以分为两大分类:Supervised Learning(监督学习)和Unsupervised Learning(无监督学习).
Supervised Learning(监督学习):
在监督学习中,我们给出了一个数据集,已经知道我们的正确的输出应该是什么样子的,输入和输出之间有一定关系。
监督学习问题分为“回归”(regression)和“分类”(classification)问题。在一个回归问题中,我们试图预测结果在一个连续的输出,这意味着我们正在试图将输入变量映射到一些连续函数。在一个分类问题中,我们试图预测结果在一个离散的输出。换句话说,我们正在试图将输入变量映射到离散的类别中。这是关于连续数据和离散数据的数学描述。
Unsupervised Learning(无监督学习):
无监督学习,使我们能够在很少或根本不知道我们的研究结果应该是什么样的情况下。从数据中获得结构,尽管我们不一定知道变量之间的关系。
我们可以根据这种结构化的聚类数据,得出数据中变量之间的关系。
无监督学习,对预测结果没有任何反馈,也就是说,没有老师纠正你的结果。
3.机器学习笔记
网上看到有人把NG老师的课程做成笔记的形式,可以回顾下学习的内容,不错。记到这里了。