-
题名基于局部标签树匹配的改进网页聚类算法
被引量:14
- 1
-
-
作者
李睿
曾俊瑀
周四望
-
机构
湖南大学软件学院
-
出处
《计算机应用》
CSCD
北大核心
2010年第3期818-820,共3页
-
基金
湖南省自然科学基金资助项目(09JJ3123)
-
文摘
Web信息抽取中需要对目标网站的网页进行聚类分析,以检测并生成信息抽取所需的模板。传统的基于DOM树编辑距离的网页聚类算法不适合文档对象模型(DOM)树结构复杂的动态模板网页,提出了一种基于局部标签树匹配的改进网页聚类算法,利用标签树中模板节点和非模板节点的层次差异性,根据节点对布局影响的大小赋予节点不同的匹配权值,使用局部树匹配完成对网页结构相似性的有效计算。实验结果表明,改进的算法较传统的基于DOM树编辑距离的网页聚类算法,在对采用模板生成的动态网页进行聚类分析时具有更高的准确率,且时间复杂度低。
-
关键词
WEB信息抽取
网页聚类
树编辑距离
局部标签树匹配
-
Keywords
Web information extraction
Web page clustering
tree edit distance
partial tag tree matching
-
分类号
TP301
[自动化与计算机技术—计算机系统结构]
-
-
题名面向不规则列表的网页数据抽取技术的研究
被引量:1
- 2
-
-
作者
常丽君
钱钢
-
机构
南京财经大学信息工程学院
-
出处
《计算机应用研究》
CSCD
北大核心
2015年第9期2651-2654,2658,共5页
-
文摘
抽取列表页中的列表数据可以用于进一步的数据挖掘以及数据集成等系统。针对怎样提高自动抽取列表页数据的准确率和适应性进行了研究。在研究已有的多数据区域挖掘算法和数据记录识别算法的基础上,针对列表页数据记录组织方式的多样性改进了数据记录识别算法,提高了识别数据记录的准确率。而对于数据记录之间的不规则性问题,在已有的标签树匹配算法的基础上加入了对节点内容的考虑,提高了两棵标签树匹配的准确率。根据构成数据记录的标签树之间的匹配结果,再采用部分树对齐算法生成一个数据记录的最大匹配结构,进而用于抽取出所有数据记录。实验结果表明,提出的改进算法有效提高了自动抽取列表页数据的准确率和适应性。
-
关键词
列表页
网页数据抽取
标签树匹配
部分树对齐
-
Keywords
list pages
Web data extraction
matching of tag tree
partial tree alignment
-
分类号
TP391.1
[自动化与计算机技术—计算机应用技术]
-