期刊文献+
共找到1篇文章
< 1 >
每页显示 20 50 100
基于改进三体训练法的半监督专利文本分类方法 被引量:10
1
作者 胡云青 邱清盈 +1 位作者 余秀 武建伟 《浙江大学学报(工学版)》 EI CAS CSCD 北大核心 2020年第2期331-339,共9页
针对信息增益算法只能考察特征对整个系统的贡献、忽略特征对单个类别的信息贡献的问题,提出改进信息增益算法,通过引入权重系数调整对分类有重要价值的特征的信息增益值,以更好地考虑一个词在类别间的分布不均匀性.针对传统专利自动分... 针对信息增益算法只能考察特征对整个系统的贡献、忽略特征对单个类别的信息贡献的问题,提出改进信息增益算法,通过引入权重系数调整对分类有重要价值的特征的信息增益值,以更好地考虑一个词在类别间的分布不均匀性.针对传统专利自动分类中训练集标注瓶颈问题,提出基于改进三体训练算法的半监督分类方法,通过追踪每次更新后的训练集样本类别分布来动态改变3个分类器对同一未标记样本类别的预测概率阈值,从而在降低噪音数据影响的同时实现对未标记训练样本的充分利用.实验结果表明,本研究所提出的分类方法在有标记训练样本较少的情况下,可以取得较好的自动分类效果,并且适当增大未标记样本数据可以增强分类器的泛化能力. 展开更多
关键词 专利文本分类 特征选择 信息增益 半监督 三体训练算法
在线阅读 下载PDF
上一页 1 下一页 到第
使用帮助 返回顶部