-
题名一种新的微博短文本特征词选择算法
被引量:17
- 1
-
-
作者
黄贤英
陈红阳
刘英涛
熊李媛
-
机构
重庆理工大学计算机科学与工程学院
-
出处
《计算机工程与科学》
CSCD
北大核心
2015年第9期1761-1767,共7页
-
基金
国家自然科学基金资助项目(61173184)
重庆市教委科技计划项目(KJ100821)
重庆市科委自然科学基金资助项目(CSTC2012jjA40030)
-
文摘
针对微博短文本有效特征较稀疏且难以提取,从而影响微博文本表示、分类与聚类准确性的问题,提出一种基于统计与语义信息相结合的微博短文本特征词选择算法。该算法基于词性组合匹配规则,根据词项的TF-IDF、词性与词长因子构造综合评估函数,结合词项与文本内容的语义相关度,对微博短文本进行特征词选择,以使挑选出来的特征词能准确表示微博短文本内容主题。将新的特征词选择算法与朴素贝叶斯分类算法相结合,对微博分类语料集进行实验,结果表明,相比其它的传统算法,新算法使得微博短文本分类准确率更高,表明该算法选取出来的特征词能够更准确地表示微博短文本内容主题。
-
关键词
微博短文本
特征词选择
统计与语义信息
词性组合
朴素贝叶斯分类算法
-
Keywords
micro-blog short text
feature selection
statistics and semantic information
POS grouping
Naive Bayesian classification algorithm
-
分类号
TP391.1
[自动化与计算机技术—计算机应用技术]
-