试题详情
- 简答题什么是聚类?简单描述如下的聚类方法:划分方法,层次方法,基于密度的方法,基于模型的方法。为每类方法给出例子。
- 聚类是将数据划分为相似对象组的过程,使得同一组中对象相似度最大而不同组中对象相似度最小。主要有以下几种类型方法:
(1)划分方法
给定一个有N个元组或者记录的数据集,分裂法将构造K个分组,每一个分组就代表一个聚类,K使用这个基本思想的算法有:K-MEANS算法、K-MEDOIDS算法、CLARANS算法。
(2)层次方法
这种方法对给定的数据集进行层次似的分解,直到某种条件满足为止。具体又可分为“自底向上”和“自顶向下”两种方案。例如在“自底向上”方案中,初始时每一个数据记录都组成一个单独的组,在接下来的迭代中,它把那些相互邻近的组合并成一个组,直到所有的记录组成一个分组或者某个条件满足为止。
代表算法有:BIRCH算法、CURE算法、CHAMELEON算法等。
(3)基于密度的方法
基于密度的方法与其它方法的一个根本*区别是:它不是基于各种各样的距离,而是基于密度的。这样就能克服基于距离的算法只能发现“类圆形”的聚类的缺点。这个方法的指导思想就是:只要一个区域中的点的密度大过某个阈值,就把它加到与之相近的聚类中去。
代表算法有:DBSCAN算法、OPTICS算法、DENCLUE算法等。
(4)基于模型的方法
基于模型的方法给每一个聚类假定一个模型,然后去寻找能够很好的满足这个模型的数据。这样一个模型可能是数据点在空间中的密度分布函数或者其它。它的一个潜在假定就是:目标数据集是由一系列的概率分布所决定的。
基于模型的方法主要有两类:统计学方法和神经网络方法(SOM)。 关注下方微信公众号,在线模考后查看
热门试题
- 什么是数据仓库的3层数据结构?
- 下列几种数据挖掘功能中,()被广泛的应用
- 什么是决策节点?
- 从信息处理角度看,神经元具有哪些基本特征
- 简述决策树的构建。
- 在有关数据仓库测试,下列说法不正确的是:
- SVM是这样一个分类器,他寻找具有最小边
- 相异度矩阵
- 何谓粒度?它对数据仓库有什么影响?按粒度
- Apriori算法所面临的主要的挑战包括
- 在聚类分析当中,簇内的相似性越大,簇间的
- 简述k-means算法,层次聚类算法的优
- 如果规则集R中不存在两条规则被同一条记录
- 哪种数据变换的方法将数据沿概念分层向上汇
- 为什么说相对于日常的应用数据库,数据仓库
- 字段Hair_color={auburn
- OLAP服务器的类型主要包括:()、()
- 简述数据仓库的组成。
- 特征提取技术并不依赖于特定的领域。
- 数据挖掘