17.基于scrapy-redis两种形式的分布式爬虫
redis分布式部署
1.scrapy框架是否可以自己实现分布式?
- 不可以。原因有二。
其一:因为多台机器上部署的scrapy会各自拥有各自的调度器,这样就使得多台机器无法分配start_urls列表中的url。(多台机器无法共享同一个调度器)
其二:多台机器爬取到的数据无法通过同一个管道对数据进行统一的数据持久出存储。(多台机器无法共享同一个管道)
2.基于scrapy-redis组件的分布式爬虫
- scrapy-redis组件中为我们封装好了可以被多台机器共享的调度器和管道,我们可以直接使用并实现分布式数据爬取。
- 实现方式:
1.基于该组件的RedisSpider类
2.基于该组件的RedisCrawlSpider类
3.分布式实现流程:上述两种不同方式的分布式实现流程是统一的
- 3.1 下载scrapy-redis组件:pip install scrapy-redis
- 3.2 redis配置文件的配置:
3.3 修改爬虫文件中的相关代码:
- 将爬虫类的父类修改成基于RedisSpider或者RedisCrawlSpider。注意:如果原始爬虫文件是基于Spider的,则应该将父类修改成RedisSpider,如果原始爬虫文件是基于CrawlSpider的,则应该将其父类修改成RedisCrawlSpider。
- 注释或者删除start_urls列表,切加入redis_key属性,属性值为scrpy-redis组件中调度器队列的名称
3.4 在配置文件中进行相关配置,开启使用scrapy-redis组件中封装好的管道
3.5 在配置文件中进行相关配置,开启使用scrapy-redis组件中封装好的调度器
3.6 在配置文件中进行爬虫程序链接redis的配置:
3.7 开启redis服务器:redis-server 配置文件
3.8 开启redis客户端:redis-cli
3.9 运行爬虫文件:scrapy runspider SpiderFile
3.10 向调度器队列中扔入一个起始url(在redis客户端中操作):lpush redis_key属性值 起始url
- 推荐文章
- CSS之常见布局|常用单位|水平垂直居中
- JavaScript之ES6常用新特性
- POI XWPFDocument 实现word导出功能
- java实现ftp文件上传
- 7、java jdbc如何连接oracle12
- 6、oracle入门篇
- 5、oracle入门篇
- java 使用 HSSF方式+Maven 实现excle导出
- 4、oracle 数据库导入与导出
- @DateTimeFormat 和 @JsonFormat 注解完成日期参数接收和格式化输出
- 03、oracle入门篇
- Alibabacloud nacos配置中心使用
- 电流单位表
- 一、可视化
- VGG详解_基于up主总结
- pytorch中的损失函数
- sklearn中的数据集
- 如何训练一个分类器
- 学习资料集合
- 卷积层----个人总结
- torch上疑问用法总结
- matplotlib库介绍
- java学习总结
- java高级并发编程实战
- java的spi思想--打破双亲委派模型的操作
- linux设置静态ip步骤流程
- jvm调优参数设置
- jvisualvm插件的基本使用
- jvm常见的gc种类
- jvm调优案例与步骤