-
题名基于Word2Vec的一种文档向量表示
被引量:150
- 1
-
-
作者
唐明
朱磊
邹显春
-
机构
西南大学计算机与信息科学学院
-
出处
《计算机科学》
CSCD
北大核心
2016年第6期214-217,269,共5页
-
文摘
在文本分类中,如何运用word2vec词向量高效地表达一篇文档一直是一个难点。目前,将word2vec模型与聚类算法结合形成的doc2vec模型能有效地表达文档信息。但是,这种方法很少考虑单个词对整篇文档的影响力。为了解决这个问题,利用TF-IDF算法计算每篇文档中词的权重,并结合word2vec词向量生成文档向量,最后将其应用于中文文档分类。在搜狗中文语料库上的实验验证了新方法的有效性。
-
关键词
tf-idf
word2vec
doc2vec
文本分类
-
Keywords
tf-idf, word2vec, doc2vec, text classification
-
分类号
TP181
[自动化与计算机技术—控制理论与控制工程]
-