文档介绍：精选优质文档-----倾情为你奉上
精选优质文档-----倾情为你奉上
专心---专注---专业
专心---专注---专业
精选优质文档-----倾情为你奉上
专心---专注---专业
监督学****和无监督学****br/>这个问题可以回答得精选优质文档-----倾情为你奉上
精选优质文档-----倾情为你奉上
专心---专注---专业
专心---专注---专业
精选优质文档-----倾情为你奉上
专心---专注---专业
监督学****和无监督学****br/>这个问题可以回答得很简单：是否有监督（supervised），就看输入数据是否有标签（label）。输入数据有标签，则为有监督学****没标签则为无监督学****br/>首先看什么是学****learning）？一个成语就可概括：举一反三。此处以高考为例，高考的题目在上考场前我们未必做过，但在高中三年我们做过很多很多题目，懂解题方法，因此考场上面对陌生问题也可以算出答案。机器学****的思路也类似：我们能不能利用一些训练数据（已经做过的题），使机器能够利用它们（解题方法）分析未知数据（高考的题目）？
最简单也最普遍的一类机器学****算法就是分类（classification）。对于分类，输入的训练数据有特征（feature），有标签（label）。所谓的学****其本质就是找到特征和标签间的关系（mapping）。这样当有特征而无标签的未知数据输入时，我们就可以通过已有的关系得到未知数据标签。
在上述的分类过程中，如果所有训练数据都有标签，则为有监督学****supervised learning）。如果数据没有标签，显然就是无监督学****unsupervised learning）了，也即聚类（clustering）。
（但有监督学****并非全是分类，还有回归（regression），此处不细说。（哇擦，贵圈太乱，逼着我用了这么多括号））
精选优质文档-----倾情为你奉上
精选优质文档-----倾情为你奉上
专心---专注---专业
专心---专注---专业
精选优质文档-----倾情为你奉上
专心---专注---专业
目前分类算法的效果普遍还是不错的（研究者们每天都在outperform其他人……），相对来讲，聚类算法就有些惨不忍睹了。（聚类：这不是我的错嘤嘤嘤嘤└(T_T;)┘）确实，无监督学****本身的特点使其难以得到如分类一样近乎完美的结果。这也正如我们在高中做题，答案（标签）是非常重要的，假设两个完全相同的人进入高中，一个正常学****另一人做的所有题目都没有答案，那么想必第一个人高考会发挥更好，第二个人会发疯。
这时各位可能要问，既然分类如此之好，聚类如此之不靠谱（分类<(￣︶￣)/，聚类└(T_T;)┘），那为何我们还可以容忍聚类的存在？因为在实际应用中，标签的获取常常需要极大的人工工作量，有时甚至非常困难。例如在自然语言处理（NLP）中，Penn Chinese Treebank在2年里只