期刊文献+
共找到2篇文章
< 1 >
每页显示 20 50 100
网页正文信息抽取新方法 被引量:20
1
作者 宋明秋 张瑞雪 +1 位作者 吴新涛 李文立 《大连理工大学学报》 EI CAS CSCD 北大核心 2009年第4期594-597,共4页
基于包装器的信息抽取方法只能处理一种特定的信息源,而且对网页结构的依赖性强.基于此提出了一种将中文标点符号和HTML树结构作为识别网页正文内容重要特征的网页分析方法,通过统计中文标点符号确定部分正文信息,然后根据正文信息在结... 基于包装器的信息抽取方法只能处理一种特定的信息源,而且对网页结构的依赖性强.基于此提出了一种将中文标点符号和HTML树结构作为识别网页正文内容重要特征的网页分析方法,通过统计中文标点符号确定部分正文信息,然后根据正文信息在结构上的相似性确定其他正文信息内容.实验结果表明该方法能有效地剔除网页噪音并提取网页正文,具有较好的通用性和较高的准确性. 展开更多
关键词 包装器 html树 网页信息提取
在线阅读 下载PDF
网页正文信息抽取新方法 被引量:4
2
作者 史瑞芳 《通讯世界》 2015年第10期210-211,共2页
随着社会的快速发展与互联网时代的到来,Web页面上所包含的信息已经是包罗万象,而面对如此海量的信息资源,我们要如何有效快速的检索并提取对我们有价值的信息资源已经成为对Web研究的一个重要命题。而基于信息抽取方法只能够处理一种... 随着社会的快速发展与互联网时代的到来,Web页面上所包含的信息已经是包罗万象,而面对如此海量的信息资源,我们要如何有效快速的检索并提取对我们有价值的信息资源已经成为对Web研究的一个重要命题。而基于信息抽取方法只能够处理一种特定的信息资源,并且对网页的依懒性较强,因此,在此提出一种将标点符号与HTML树结构相结合,作为网页识别正文内容的分析方法。其后通过对标点符号进行数据统计从而确定部分的正文信息,再根据正文信息的结构来确定其他信息内容。经此实验该提取方法能够有效的提取网页正文并屏蔽网页噪音。而且其普及性和准确性都比较高,在此本文将对网页正文提取信息进行探索。 展开更多
关键词 网页正文 信息抽取 html树 方法
在线阅读 下载PDF
上一页 1 下一页 到第
使用帮助 返回顶部