摘要
提出了一个基于k-means算法框架和半监督机制的single-means算法,以解决单类中心学习问题。k-means算法实质上是对一种混合高斯模型的期望最大化(EM)算法的近似,对该模型随机生成的多类混合数据集,从目标类中随机标定的初始中心出发,能确定地收敛到该类的实际中心。将single-means算法应用到对单类文本中心学习问题中,实验结果表明:在给定目标类中的小标定文本集后,新算法能够有效地改进类的初始中心,且对数据稀疏和方差较大的实际问题具有健壮性。
A new algorithm named "single-means" was presented to improve the centre estimation of the object class when a hybrid data set had unknown k value and feature of accumulating to centre. Based on that k-means algorithm was equivalent to Expectation Maximum (EM) algorithm on a special hybrid Gaussian model, it was proved that given a data set generated by the above Gaussian model, the true centre of the object Gaussian distribution could be converged by a new algorithm. The new algorithm was applied in learning the centre of single text class. The experiment shows that given a small labeled text set, the new algorithm can get a better centre, and is robust on sparse data set and that with great variance.
出处
《计算机应用》
CSCD
北大核心
2008年第10期2513-2516,共4页
journal of Computer Applications
基金
国家自然科学基金资助项目(60603027)
天津市应用基础研究计划项目(05YFJMJC11700)
作者简介
李志圣(1977-),男,江西上高人,博士研究生,主要研究方向:信息检索;(lzs_jeff@tom.com)
孙越恒(1974-),男,山东烟台人,讲师,主要研究方向:文本分类;
何丕廉(1943-),男,天津人,教授,博士生导师,主要研究方向:人工智能、计算机辅助教育;
侯越先(1972-),男,天津人,副教授,主要研究方向:机器学习、维数约简。