# sitemapcrawler **Repository Path**: hu321/sitemapcrawler ## Basic Information - **Project Name**: sitemapcrawler - **Description**: 通用爬虫 - **Primary Language**: Python - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2021-02-25 - **Last Updated**: 2021-02-28 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # 通用爬虫demo ## 架构说明 * 采用Web Scraper + Scrapy架构 * Web Scraper 是一个浏览器插件,可以安装在Chrome、FireFox浏览器,安装之后可以通过交互式操作编写网页采集规则,点击执行后会自动控制浏览器进行采集,提供采集结果导出功能。 * 本方案将WebScraper 当作采集规则开发工具,提供给无爬虫经验的人员使用,经过简单培训之后即可交互式的开发爬虫。爬虫用交互式方式开发调试完成后,导出sitemap文件(为Json格式) 利用scrapy解析此sitemap文件中的采集规则,实现定时和脚本化采集、入库等工作 ## Demo说明 * 实现了web scraper简单sitemap规则解析 * 利用web scraper插件编写了大公网(http://www.takungpao.com/news)新闻采集规则,导出的sitemap配置在sitemap_crawler/sitemap_crawler/settings.py * 演示命令 ```bash $ cd sitemap_crawler/ $ scrapy crawl sitemap -o 大公网.csv ``` * 执行结果保存为大公网.csv