熟悉scrapy的基本使用(创建与运行,目录结构)---爬虫项目

1.创建爬虫项目命令,在Terminal命令窗口执行:scrapy startproject project_name(project_name代表项目名字)

2.在项目目录下的spiders文件如何创建爬虫项目文件的命令 ,在Terminal命令窗口执行:scrapy genspider get_data(项目的名字) baidu.com(要爬取数据的网址后缀)

3.1启动项目的命令,在Terminal命令窗口执行:scrapy crawl  project_name   (要先切换到项目路径,可以新建窗口打开项目,这样就不用了切换到项目的路径 project_name代表的是项目名字)

3.2也可以在项目下创建py文件begin.py

熟悉scrapy的基本使用(创建与运行,目录结构)---爬虫项目

内容是: 

熟悉scrapy的基本使用(创建与运行,目录结构)---爬虫项目

这样就可以右键执行不用输入命令这么麻烦。

4.切换到项目路径的命令,在Terminal命令窗口执行:  cd .\project_name\  按tab键自动会补全爬虫项目名

5.在settings.py文件中修改: ROBOTSTXT_OBEY = False  #硬要爬取数据修改方法

6.如何将爬取的内容保存为文档,命令为

scrapy crawl (project_name)-o (filename.type)支持的文件类型有:json、csv、xml

熟悉scrapy的基本使用(创建与运行,目录结构)---爬虫项目

上一篇:注解与反射


下一篇:String字符串类型详解