14.UA池和代理池
今日概要
- scrapy下载中间件
- UA池
- 代理池
今日详情
一.下载中间件
先祭出框架图:
下载中间件(Downloader Middlewares) 位于scrapy引擎和下载器之间的一层组件。
- 作用:
(1)引擎将请求传递给下载器过程中, 下载中间件可以对请求进行一系列处理。比如设置请求的 User-Agent,设置代理等
(2)在下载器完成将Response传递给引擎中,下载中间件可以对响应进行一系列处理。比如进行gzip解压等。
我们主要使用下载中间件处理请求,一般会对请求设置随机的User-Agent ,设置随机的代理。目的在于防止爬取网站的反爬虫策略。
二.UA池:User-Agent池
- 作用:尽可能多的将scrapy工程中的请求伪装成不同类型的浏览器身份。
- 操作流程:
1.在下载中间件中拦截请求
2.将拦截到的请求的请求头信息中的UA进行篡改伪装
3.在配置文件中开启下载中间件
代码展示:
三.代理池
- 作用:尽可能多的将scrapy工程中的请求的IP设置成不同的。
- 操作流程:
1.在下载中间件中拦截请求
2.将拦截到的请求的IP修改成某一代理IP
3.在配置文件中开启下载中间件
代码展示:
【推广】
免费学中医,健康全家人
原文地址:https://www.cnblogs.com/duhong0520/p/13283969.html
- 推荐文章
- 操作系统 part2
- 操作系统 part1
- C++ part7
- C++ part6
- hibernate Session
- 技术书推荐
- Castle 整合.NET Remoting
- C#--Attribute本质论
- 各大主流.Net的IOC框架性能测试比较
- Castle 开发系统文章
- Oracle中的 UPDATE FROM 解决方法
- 提升SQL Server速度整理索引碎片
- 揭开隐藏数据的面纱,优化应用程序性能
- 查看语句运行时间异常的原因(SQLServer)
- 把spring boot发布成window Service
- Domain Driven Development相关概念
- ShoppingCart类图
- Excel Vlookup使用
- NIO学习资料
- 理解Deadlock
- redis使用
- ZooKeeper之service discovery
- Git环境配置
- Windows 下MySql Replication(复制)配置
- Django框架简介(MVC框架和MTV框架)
- ftp连接服务器失败||或者Xshell链接错误:Could notconnect to '192.168.18.128' (port 22): Connection failed
- git
- roles
- ansible 中的模块
- ansible 中的 playbook 模块