Python selenium get页面很慢时，处理办法

方法一：设置超时时间

driver.get（"url")等到页面全部加载渲染完成后才会执行后续的脚本。

在执行脚本时，driver.get("url") ，如果当前的url页面内容较多加载特别慢，很费时间，但是我们需要操作的元素已经加载出来，可以将页面加载停掉，不影响后面的脚本执行，解决办法

设置页面加载timeout，get操作： try get except 脚本window.stop(), 使用GeckoDriver上有效果，但是在ChromeDriver上还是会有问题，抛出异常timeout后续脚本不会继续执行

from selenium import webdriver
import re
 
driver = webdriver.Firefox()
#设定页面加载timeout时长，需要的元素能加载出来就行
driver.set_page_load_timeout(20)
driver.set_script_timeout(20)
#try去get
try:
    driver.get("http://tieba.baidu.com/p/5659969529?red_tag=w0852861182")
except:
    print("加载页面太慢，停止加载，继续下一步操作")
    driver.execute_script("window.stop()")
last_page_element = driver.find_element_by_css_selector("li.l_pager.pager_theme_4.pb_list_pager >a:nth-child(12)") #定位到元素尾页元素
#获取尾页页码链接文本
text = last_page_element.get_attribute("href")
all_page_num = re.search("d+$",text).group() # 正则匹配到页码
print("当前贴吧贴子总页数为:%s"%all_page_num)

方法二：修改加载策略pageLoadStrategy（推荐）

from selenium import webdriver
from selenium.webdriver.common.desired_capabilities import DesiredCapabilities
from selenium.webdriver.support.ui import WebDriverWait

desired_capabilities = DesiredCapabilities.CHROME  # 修改页面加载策略
desired_capabilities["pageLoadStrategy"] = "none"  # 注释这两行会导致最后输出结果的延迟，即等待页面加载完成再输出
driver = webdriver.Chrome('browsers/chromedriver.exe')
wait = WebDriverWait(driver, 10)  #后面可以使用wait对特定元素进行等待
driver.get('http://qzone.qq.com/')
# some code to work.
print("Reach end.")

将页面加载策略修改为none之后，页面即使在加载过程中，程序也可以继续执行。代码中的pageLoadStrategy属性可以设置为以下三种属性：

normal：即正常情况下，selenium会等待整个界面加载完成（指对html和子资源的下载与解析，不包括ajax）

eager：要等待整个dom树加载完成，即DOMContentLoaded这个事件完成，仅对html的内容进行下载解析

none：当html下载完成之后，不等待解析完成，selenium会直接返回

上面的代码用了最后一种解析方式——none，不作等待，直接返回，然后在后面的代码中可以用explicit_wait或者implicit_wait等方式来对特定元素进行等待捕获。　

不建议使用eager模式，会导致browser没有生成，返回异常；

使用none模式相当于生成了dom，但不加载其它文件（图片等）。