JAVA开源爬虫，WebCollector,使用方便，有接口。

JAVA开源爬虫，WebCollector,使用方便，有接口。

假设你想下载整个网站内容爬行动物，我不希望配置heritrix复杂的爬行动物，要选择WebCollector。项目github一个不断更新。

github源地址：https://github.com/CrawlScript/WebCollector

github下载地址：http://crawlscript.github.io/WebCollector/

执行方式：

1.解压从http://crawlscript.github.io/WebCollector/ 页面下载的压缩包。

2.解压后找到webcollector-版本-bin.zip,解压。

3.假设是windows，双击里面的start.bat，假设是linux，用命令行进入目录，运行sh start.sh

版权声明：本文博主原创文章，博客，未经同意不得转载。

【推广】免费学中医，健康全家人

原文地址：https://www.cnblogs.com/lcchuguo/p/4887378.html