期刊文献+
共找到1篇文章
< 1 >
每页显示 20 50 100
基于分层抽样的重叠深网数据源选择 被引量:3
1
作者 江俊彦 彭智勇 +2 位作者 吴小莹 彭承晨 王敏 《软件学报》 EI CSCD 北大核心 2017年第5期1271-1295,共25页
深网查询在Web上众多的应用,需要查询大量的数据源才能获得足够的数据,如多媒体数据搜索、团购网站信息聚合等.应用的成功,取决于查询多数据源的效率和效果.当前研究侧重查询与数据源的相关性而忽略数据源之间的重叠关系,使得不同数据... 深网查询在Web上众多的应用,需要查询大量的数据源才能获得足够的数据,如多媒体数据搜索、团购网站信息聚合等.应用的成功,取决于查询多数据源的效率和效果.当前研究侧重查询与数据源的相关性而忽略数据源之间的重叠关系,使得不同数据源上相同结果的数据被重复查询,增加了查询开销及数据源的工作负载.为了提高深网查询的效率,提出一种元组水平的分层抽样方法来估计和利用查询在数据源上的统计数据,选择高相关、低重叠的数据源.该方法分为两个阶段:离线阶段,基于元组水平对数据源进行分层抽样,获得样本数据;在线阶段,基于样本数据迭代地估计查询在数据源上的覆盖率和重叠率,并采用一种启发式策略以高效地发现低重叠的数据源.实验结果表明,该方法能够显著提高重叠数据源选择的精度和效率. 展开更多
关键词 数据选择 分层抽样 数据源重叠率估计 回归
在线阅读 下载PDF
上一页 1 下一页 到第
使用帮助 返回顶部