期刊文献+
共找到1篇文章
< 1 >
每页显示 20 50 100
网页数据采集算法及在住户调查中的应用 被引量:7
1
作者 沈承放 莫达隆 黄文韬 《统计与决策》 CSSCI 北大核心 2021年第7期52-56,共5页
目前网页数据获取技术仍然存在着动态网页难以解析、网络爬虫速度慢、抓取内容不准确等现象,为了避免此类情况的发生,文章设计了一套基于Selenium的多线程网页数据采集与分析算法。该算法的数据采集部分主要应用了python中用于自动运行... 目前网页数据获取技术仍然存在着动态网页难以解析、网络爬虫速度慢、抓取内容不准确等现象,为了避免此类情况的发生,文章设计了一套基于Selenium的多线程网页数据采集与分析算法。该算法的数据采集部分主要应用了python中用于自动运行和操作浏览器的Selenium库,完美地解决了动态和静态页面数据信息的获取问题,无界面版本浏览器、多线程网络爬虫技术以及关键词判别程序的使用,在很大程度上提高了网络爬虫速度和抓取内容准确度。并将该算法应用到在精准扶贫形式下的住户工资性收入调查数据的准确性判别中。最后以某地区人才市场网为例,抓取各行业工资水平的实时数据,通过对调查数据与抓取数据的比较分析判别住户调查中工资数据的准确性。 展开更多
关键词 网页数据采集算法 住户调查 网络爬虫 多线程 精准扶贫 PYTHON SELENIUM
在线阅读 下载PDF
上一页 1 下一页 到第
使用帮助 返回顶部