安装

这里建议使用虚拟环境来搭建项目

pip install scrapy //我这个已经默认为清华源了,如果没有设置,需要声明源,否则可能无法下载

如果安装有问题,需要上https://www.lfd.uci.edu/~gohlke/pythonlibs/下载相应配置

然后使用cmd cd到相应下载文件夹,输入:

pip insatll -i 文件名

完成后便可进入项目环境

配置

进入项目并选择好解释器后在命令行中输入scrapy即可查看信息

输入:

scrapy startproject 项目名称

来搭建项目;

然后输入:

scrapy genspider 文件名 网站域名

即可使用基础框架。

以上操作完成后即可进行爬虫的编写了。

获取信息

以爬取新浪新闻为例

创建项目

scrapy startproject new

获取网页信息

import scrapy
from bs4 import BeautifulSoup
 
class Sinanews(scrapy.Spider):
    name='Sina_news'
    start_urls=[
        "https://news.sina.com.cn/"
    ]
    
    def parse(self,response):
        soup= BeautifulSoup(response.text,'html.parser')
        tags=soup.findall("a")
        for tag in tags:
            print(tag.get("herf))

将信息转化为json