国内刊号:43-1258/TP
国际刊号:1007-130X
发布日期:
作者:沈郭鑫, 蒋中云
单位:(1.上海海洋大学信息学院, 上海 201306;2.上海建桥学院信息技术学院, 上海 201306)
关键词:聚类,二分K-均值算法,密度,邻域半径,指数函数,中心指标,
基金:上海市属高校应用型本科试点专业基金(Z32004-17-84)
针对二分K-均值算法由于随机选取初始中心及人为定义聚类数而造成的聚类结果不稳定问题,提出了基于密度和中心指标的Canopy二分K-均值算法SDC_Bisecting K-Means。首先计算样本中数据密度及其邻域半径;然后选出密度最小的数据并结合Canopy算法的思想进行聚类,将得到的簇的个数及其中心作为二分K-均值算法的输入参数;最后在二分K-均值算法的基础上引入指数函数和中心指标对原始样本进行聚类。利用UCI数据集和自建数据集进行模拟实验对比,结果表明SDC_Bisecting K-Means不仅使得聚类结果更精确,同时算法的运行速度更快、稳定性更好。
来源:2022年第2期
《计算机工程与科学》期刊编辑部