零基础写python爬虫之使用Scrapy框架编写爬虫(2)

时间:2014-11-08 02:36来源:网络整理作者:网络点击: 次

分享到：

复制代码代码如下: from scrapy.spider import Spider class DmozSpider(Spider): name = "dmoz" allowed_domains = ["dmoz.org"] start_urls = [ " http://www.dmoz.org/Computers/Programming/Languages/

复制代码代码如下:

from scrapy.spider import Spider

class DmozSpider(Spider):
    name = "dmoz"
    allowed_domains = ["dmoz.org"]
    start_urls = [
        "http://www.dmoz.org/Computers/Programming/Languages/Python/Books/",
        "http://www.dmoz.org/Computers/Programming/Languages/Python/Resources/"
    ]

    def parse(self, response):
        filename = response.url.split("/")[-2]
        open(filename, 'wb').write(response.body)

allow_domains是搜索的域名范围，也就是爬虫的约束区域，规定爬虫只爬取这个域名下的网页。
从parse函数可以看出，将链接的最后两个地址取出作为文件名进行存储。
然后运行一下看看，在tutorial目录下按住shift右击，在此处打开命令窗口，输入：

复制代码代码如下:

scrapy crawl dmoz

运行结果如图：

报错了：
UnicodeDecodeError: 'ascii' codec can't decode byte 0xb0 in position 1: ordinal not in range(128)
运行第一个Scrapy项目就报错，真是命运多舛。
应该是出了编码问题，谷歌了一下找到了解决方案：
在python的Lib\site-packages文件夹下新建一个sitecustomize.py：

复制代码代码如下:

import sys    

sys.setdefaultencoding('gb2312')    

再次运行，OK，问题解决了，看一下结果：

最后一句INFO: Closing spider (finished)表明爬虫已经成功运行并且自行关闭了。
包含 [dmoz]的行，那对应着我们的爬虫运行的结果。
可以看到start_urls中定义的每个URL都有日志行。
还记得我们的start_urls吗？
http://www.dmoz.org/Computers/Programming/Languages/Python/Books
http://www.dmoz.org/Computers/Programming/Languages/Python/Resources
因为这些URL是起始页面，所以他们没有引用(referrers)，所以在它们的每行末尾你会看到 (referer: <None>)。
在parse 方法的作用下，两个文件被创建：分别是 Books 和 Resources，这两个文件中有URL的页面内容。

那么在刚刚的电闪雷鸣之中到底发生了什么呢？
首先，Scrapy为爬虫的 start_urls属性中的每个URL创建了一个 scrapy.http.Request 对象，并将爬虫的parse 方法指定为回调函数。
然后，这些 Request被调度并执行，之后通过parse()方法返回scrapy.http.Response对象，并反馈给爬虫。

上一篇：Python获取Linux系统下的本机IP地址代码分享
下一篇：python刷投票的脚本实现代码

分享到： QQ空间新浪微博人人网开心网更多

精彩图集

成为顶尖算

用Python编写

跟老齐学P

Python struct模

精彩文章

热点文章

零基础写python爬虫之使用Scrapy框架编写爬虫(2)

热门标签

赞助商链接