基于scrapy-redis两种形式的分布式爬虫

域名2025-11-04 07:23:02212

  edis分布式部署

  1.scrapy框架是基于否可以自己实现分布式?

基于scrapy-redis两种形式的分布式爬虫

  不可以。原因有二。种形

  其一:因为多台机器上部署的式的式爬scrapy会各自拥有各自的调度器,这样就使得多台机器无法分配start_urls列表中的分布url。(多台机器无法共享同一个调度器)

  其二:多台机器爬取到的基于数据无法通过同一个管道对数据进行统一的数据持久出存储。(多台机器无法共享同一个管道)

  2.基于scrapy-redis组件的种形分布式爬虫

  scrapy-redis组件中为我们封装好了可以被多台机器共享的调度器和管道,我们可以直接使用并实现分布式数据爬取。式的式爬

  实现方式:

  1.基于该组件的b2b信息网分布RedisSpider类

  2.基于该组件的RedisCrawlSpider类

  3.分布式实现流程:上述两种不同方式的分布式实现流程是统一的

  3.1 下载scrapy-redis组件:pip install scrapy-redis

  3.2 redis配置文件的配置:

  注释该行:bind 127.0.0.1,表示可以让其他ip访问redis

  将yes该为no:protected-mode no,基于表示可以让其他ip操作redis

  3.3 修改爬虫文件中的种形相关代码:

  将爬虫类的父类修改成基于RedisSpider或者RedisCrawlSpider。注意:如果原始爬虫文件是式的式爬基于Spider的,则应该将父类修改成RedisSpider,分布如果原始爬虫文件是基于基于CrawlSpider的高防服务器,则应该将其父类修改成RedisCrawlSpider。种形

  注释或者删除start_urls列表,式的式爬切加入redis_key属性,属性值为scrpy-redis组件中调度器队列的名称

  3.4 在配置文件中进行相关配置,开启使用scrapy-redis组件中封装好的管道

ITEM_PIPELINES = { scrapy_redis.pipelines.RedisPipeline: 400 }

  3.5 在配置文件中进行相关配置,开启使用scrapy-redis组件中封装好的调度器

# 使用scrapy-redis组件的去重队列 DUPEFILTER_CLASS = "scrapy_redis.dupefilter.RFPDupeFilter" # 使用scrapy-redis组件自己的调度器 SCHEDULER = "scrapy_redis.scheduler.Scheduler" # 是否允许暂停 SCHEDULER_PERSIST = True

  3.6 在配置文件中进行爬虫程序链接redis的配置:

REDIS_HOST = redis服务的ip地址 REDIS_PORT = 6379 REDIS_ENCODING = ‘utf-8’ REDIS_PARAMS = {‘password’:’123456’}

  3.7 开启redis服务器:redis-server 配置文件

  3.8 开启redis客户端:redis-cli

  3.9 运行爬虫文件:scrapy runspider SpiderFile

  3.10 向调度器队列中扔入一个起始url(在redis客户端中操作):lpush redis_key属性值 起始url

  转载于:https://www.cnblogs.com/bobo-zhang/p/9686978.html

本文地址:http://www.bhae.cn/html/266d9199642.html
版权声明

本文仅代表作者观点,不代表本站立场。
本文系作者授权发表,未经许可,不得转载。

全站热门

如何选择正确的电脑显示接口(避免因接口选择错误而带来的问题和困扰)

台式机内存条安装教程(详细讲解内存条的选择和安装步骤,让你轻松提升电脑性能)

使用PE安装XP教程(详细指导如何通过PE环境安装WindowsXP系统)

昂达obook10Pro(全面提升工作和娱乐体验的最佳选择)

解决电脑上网弹出证书错误的方法(探索证书错误的原因及应对之道)

ThinkPadX230(纵享高效办公与卓越使用体验)

华硕U盘安装教程(华硕U盘安装教程详解,帮助您轻松安装操作系统)

U盘启动教程(简单易懂的U盘启动教程,帮助你快速安装系统)

友情链接

滇ICP备2023000592号-9