-
题名基于Spark框架和ASPSO的并行划分聚类算法
被引量:11
- 1
-
-
作者
毛伊敏
甘德瑾
廖列法
陈志刚
-
机构
江西理工大学信息工程学院
中南大学计算机学院
-
出处
《通信学报》
EI
CSCD
北大核心
2022年第3期148-163,共16页
-
基金
国家自然科学基金资助项目(No.41562019)
科技创新2030-“新一代人工智能”重大基金资助项目(No.2020AAA0109605)。
-
文摘
针对划分聚类算法处理海量的数据存在的数据离散系数较大与抗干扰性差、局部簇簇数难以确定、局部簇质心随机性及局部簇并行化合并效率低等问题,提出了一种基于Spark框架和粒子群优化自适应策略(ASPSO)的并行划分聚类(PDC-SFASPSO)算法。首先,提出了基于皮尔逊相关系数和方差的网格划分策略获取数据离散系数较小的网格单元并进行离群点过滤,解决了数据离散系数较大与抗干扰性差的问题;其次,提出了基于势函数与高斯函数的网格划分策略,获取局部聚类的簇数,解决了局部簇簇数难以确定的问题;再次,提出了ASPSO获取局部簇质心,解决了局部簇质心的随机性问题;最后,提出了基于簇半径与邻居节点的合并策略对相似度大的簇进行并行化合并,提高了局部簇并行化合并的效率。实验结果表明,PDC-SFASPSO算法在大数据环境下进行数据的划分聚类具有较好的性能表现,适用于对大规模的数据集进行并行化聚类。
-
关键词
Spark框架
并行划分聚类
网格划分
粒子群优化自适应策略
并行化合并
-
Keywords
Spark framework
parallel division clustering
grid division
ASPSO
parallel merge
-
分类号
TP311
[自动化与计算机技术—计算机软件与理论]
-