摘要
分析大规模中文搜索日志中的查询重复性,通过对查询重复率和用户个体查询重复率等数据的统计发现:查询串的查询频率、文档的点击频率及用户查询频率均符合Zipf分布,查询重复率较高。查询历史越长,查询重复率越高。高查询频率用户的查询重复率较高。以上数据为中文搜索引擎的改进提供了有力的依据。
This paper analyzes query repetition in a large-scale Chinese search engine log. It provides detailed statistics about query repetition and individual query repetition. Key conclusions include: query frequency, document click frequency and user frequency follow Zipf distributions. Queries are with high repetition ratios. Query repetition ratio increases when users' search histories become rich. The users who search more frequently have higher query repetition ratios. These conclusions are useful for improving search performance of Chinese search engines.
出处
《计算机工程》
CAS
CSCD
北大核心
2008年第21期40-41,44,共3页
Computer Engineering
基金
天津市科技发展计划基金资助项目(06YFGZGX05700)
天津市应用基础研究计划基金资助项目(07JCYBJC14500)
作者简介
窦志成(1980-),男,博士研究生,主研方向:Web信息检索,数据挖掘,日志分析; E-mail:douzc@hotmail.com
袁晓洁,教授、博士生导师;
何松柏,讲师