文章詳情頁

python爬蟲scrapy框架之增量式爬蟲的示例代碼

瀏覽：4日期：2022-06-27 08:52:11

scrapy框架之增量式爬蟲

一、增量式爬蟲

什么時候使用增量式爬蟲：增量式爬蟲：需求當我們瀏覽一些網站會發現，某些網站定時的會在原有的基礎上更新一些新的數據。如一些電影網站會實時更新最近熱門的電影。那么，當我們在爬蟲的過程中遇到這些情況時，我們是不是應該定期的更新程序以爬取到更新的新數據？那么，增量式爬蟲就可以幫助我們來實現

二、增量式爬蟲

概念：通過爬蟲程序檢測某網站數據更新的情況，這樣就能爬取到該網站更新出來的數據

如何進行增量式爬取工作：在發送請求之前判斷這個URL之前是不是爬取過在解析內容之后判斷該內容之前是否爬取過在寫入存儲介質時判斷內容是不是在該介質中

增量式的核心是去重去重的方法：將爬取過程中產生的URL進行存儲，存入到redis中的set中，當下次再爬取的時候，對在存儲的URL中的set中進行判斷，如果URL存在則不發起請求，否則就發起請求對爬取到的網站內容進行唯一的標識，然后將該唯一標識存儲到redis的set中，當下次再爬取數據的時候，在進行持久化存儲之前，要判斷該數據的唯一標識在不在redis中的set中，如果在，則不在進行存儲，否則就存儲該內容

三、示例

爬蟲文件

# -*- coding: utf-8 -*-import scrapyfrom scrapy.linkextractors import LinkExtractorfrom scrapy.spiders import CrawlSpider, Rulefrom redis import Redisfrom increment2_Pro.items import Increment2ProItemimport hashlibclass QiubaiSpider(CrawlSpider): name = ’qiubai’ # allowed_domains = [’www.xxx.com’] start_urls = [’https://www.qiushibaike.com/text/’] rules = ( Rule(LinkExtractor(allow=r’/text/page/d+/’), callback=’parse_item’, follow=True), ) def parse_item(self, response): div_list = response.xpath(’//div[@class='article block untagged mb15 typs_hot']’) conn = Redis(host=’127.0.0.1’,port=6379) for div in div_list: item = Increment2ProItem() item[’content’] = div.xpath(’.//div[@class='content']/span//text()’).extract() item[’content’] = ’’.join(item[’content’]) item[’author’] = div.xpath(’./div/a[2]/h2/text() | ./div[1]/span[2]/h2/text()’).extract_first() # 將當前爬取的數據做哈希唯一標識(數據指紋) sourse = item[’content’]+item[’author’] hashvalue = hashlib.sha256(sourse.encode()).hexdigest() ex = conn.sadd(’qiubai_hash’,hashvalue) if ex == 1:yield item else:print(’沒有可更新的數據可爬取’) # item = {} #item[’domain_id’] = response.xpath(’//input[@id='sid']/@value’).get() #item[’name’] = response.xpath(’//div[@id='name']’).get() #item[’description’] = response.xpath(’//div[@id='description']’).get() # return item

管道文件（管道文件也可以不用加）

from redis import Redisclass Increment2ProPipeline(object): conn = None def open_spider(self,spider): self.conn = Redis(host=’127.0.0.1’,port=6379) def process_item(self, item, spider): dic = { ’author’:item[’author’], ’content’:item[’content’] } self.conn.lpush(’qiubaiData’,dic) print(’爬取到一條數據,正在入庫......’) return item

到此這篇關于python爬蟲之scrapy框架之增量式爬蟲的示例代碼的文章就介紹到這了,更多相關scrapy增量式爬蟲內容請搜索好吧啦網以前的文章或繼續瀏覽下面的相關文章希望大家以后多多支持好吧啦網！

Python 編程

上一條：python lambda的使用詳解下一條：詳解Python openpyxl庫的基本應用

相關文章：

1. JSP 中response.setContentType()的作用及參數2. idea開啟代碼提示功能的方法步驟3. ASP.NET MVC使用jQuery的Load方法加載靜態頁面及注意事項4. Docker究竟是什么為什么這么流行它的優點和缺陷有哪些？5. ASP.NET MVC實現城市或車型三級聯動6. Springboot集成jsp及部署服務器實現原理7. IntelliJ IDEA 2020常用配置設置大全(方便干活)8. SSM框架JSP使用Layui實現layer彈出層效果9. IntelliJ IDEA設置條件斷點的方法步驟10. IntelliJ IDEA導入jar包的方法

排行榜

					
					idea開啟代碼提示功能的方法步驟
JSP 中response.setContentType()的作用及參數
ASP.NET MVC使用jQuery的Load方法加載靜態頁面及注意事項
Docker究竟是什么 為什么這么流行 它的優點和缺陷有哪些？
ASP.NET MVC實現城市或車型三級聯動
Springboot集成jsp及部署服務器實現原理
IntelliJ IDEA 2020常用配置設置大全(方便干活)
SSM框架JSP使用Layui實現layer彈出層效果
IntelliJ IDEA設置條件斷點的方法步驟
IntelliJ IDEA導入jar包的方法
IntelliJ IDEA導出項目的方法