首页 > 其他 > 详细

增量式爬虫

时间:2019-03-05 23:47:40      阅读:165      评论:0      收藏:0      [点我收藏+]

引言 : 

    当我们在浏览相关网页的时候会发现,某些网站定时会在原有网页数据的基础上更新一批数据,例如某电影网站会实时更新一批最近热门的电影。小说网站会根据作者创作的进度实时更新最新的章节数据等等。那么,类似的情景,当我们在爬虫的过程中遇到时,我们是不是需要定时更新程序以便能爬取到网站中最近更新的数据呢?这个时候增量式爬虫就派上用途了!!!

 

一 . 增量式爬虫  

概念 : 通过爬虫程序监测某网站数据更新的情况,以便可以爬取到该网站更新出的新数据

如何进行增量式的爬取工作 : 

  • 在发送请求之前判断这个url是不是之前爬取过
  • 在解析内容后判断这部分内容是不是之前爬取过
  • 写入存储介质时判断内容是不是已经在介质中存在了   

分析 : 

      不难发现,其实增量爬取的核心是去重, 至于去重的操作在哪个步骤起作用,只能说各有利弊。在我看来,前两种思路需要根据实际情况取一个(也可能都用)。第一种思路适合不断有新页面出现的网站,比如说小说的新章节,每天的最新新闻等等;第二种思路则适合页面内容会更新的网站。第三个思路是相当于是最后的一道防线。这样做可以最大程度上达到去重的目的。

去重方法 : 

 

增量式爬虫

原文:https://www.cnblogs.com/zmc940317/p/10480443.html

(0)
(0)
   
举报
评论 一句话评论(0
关于我们 - 联系我们 - 留言反馈 - 联系我们:wmxa8@hotmail.com
© 2014 bubuko.com 版权所有
打开技术之扣,分享程序人生!