什么是网络爬虫

理论知识小结

1、网络爬虫也叫作网络蜘蛛、网络蚂蚁、网络机器人等,可以自动的浏览网站中的信息,当然浏览信息的时候需要按照我们规定的规则去浏览,这些规则我们将其称为网络爬虫算法。使用Python可以很方便地编写出爬虫程序,进行互联网信息的自动化检索

2、学习爬虫我们可以:①私人定制一个搜索引擎,并且可以对搜索引擎的数据采集工作原理,进行更深层次地理解;②为大数据分析提供更多高质量的数据源;③更好地研究搜索引擎优化;④解决就业或跳槽问题。

3、网络爬虫由控制节点爬虫节点资源库构成。

4、网络爬虫按照现实的技术和结构可以分为通用网络爬虫聚焦网络爬虫增量式网络爬虫深层次网络爬虫等类型。在实际的网络爬虫中,通常是这几类爬虫的组合体。

5、聚焦网络爬虫主要有初始URL集合、URL队列、页面爬行模式、页面分析模块、页面数据库、链接过滤模块、内容评价模块、链接评价模块等构成。

原文地址:https://www.cnblogs.com/MaGnet/p/10079935.html