k-近邻算法概述

发布时间： 2023-02-19 10:18:14 作者：etogether.net 来源：网络浏览次数：

摘要: 选择k个最相似数据中出现次数最多的分类，作为新数据的分类。

简单地说，k-近邻算法采用测量不同特征值之间的距离方法进行分类。

K-近邻算法

优点：精度高、对异常值不敏感、无数据输入假定。

缺点：计算复杂度高、空间复杂度高。

适用数据范围：数值型和标称型。

k近邻算法（kNN）的工作原理是：存在一个样本数据集合，也称作训练样本集，并且样本集中每个数据都存在标签，即我们知道样本集中每一数据与所属分类的对应关系。输入没有标签的新数据后，将新数据的每个特征与样本集中数据对应的特征进行比较，然后算法提取样本集中特征最相似数据(最近邻）的分类标签。一般来说，我们只选择样本数据集中前k个最相似的数据，这就是k-近邻算法中k的出处，通常k是不大于20的整数。最后，选择k个最相似数据中出现次数最多的分类，作为新数据的分类。

现在我们回到前面电影分类的例子，使用k-近邻算法分类爱情片和动作片。有人曾经统计过很多电影的打斗镜头和接吻镜头，图1显示了6部电影的打斗和接吻镜头数。假如有一部未看过的电影，如何确定它是爱情片还是动作片呢？我们可以使用kNN来解决这个问题。

图1.png

图1 使用打斗和接吻镜头数分类电影

首先我们需要知道这个未知电影存在多少个打斗镜头和接吻镜头，图2 中问号位置是该未知电影出现的镜头数图形化展示，具体数字参见表1。

[1] [2] [下一页] 【欢迎大家踊跃评论】

上一篇：python编程示例：手写识别系统
下一篇：Python语言的优势

《译聚网》倡导尊重与保护知识产权。如发现本站文章存在版权问题，烦请30天内提供版权疑问、身份证明、版权证明、联系方式等发邮件至18964029557@163.com，我们将及时沟通与处理。

k-近邻算法概述

相关机器翻译技术文章

免费在线翻译

翻译机

外语书籍

行业文章

人工翻译