python爬虫入门教程之糗百图片爬虫代码分享

站长资源 2024/10/10 佚名

2 0 1

黑松山资源网 Design By www.paidiu.com

学习python少不了写爬虫，不仅能以点带面地学习、练习使用python，爬虫本身也是有用且有趣的，大量重复性的下载、统计工作完全可以写一个爬虫程序完成。

用python写爬虫需要python的基础知识、涉及网络的几个模块、正则表达式、文件操作等知识。昨天在网上学习了一下，写了一个爬虫自动下载「糗事百科」里面的图片。源代码如下：

复制代码代码如下:
# -*- coding: utf-8 -*-
# 上面那句让代码里支持中文

#---------------------------------------
#   程序：糗百图片爬虫
#   版本：0.1
#   作者：赵伟
#   日期：2013-07-25
#   语言：Python 2.7
#   说明：能设置下载的页数。没有做更多抽象和交互方面的优化。
#---------------------------------------

import urllib2
import urllib
import re

#正则表达式，用来抓取图片的地址
pat = re.compile('<div class="thumb">\\n<img src=\"(ht.*".*?>')

#用来合成网页的URL
nexturl1 = "http://m.qiushibaike.com/imgrank/page/"
nexturl2 = ""

#页数计数
count = 1

#设置抓取的页数
while count < 3:

    print "Page " + str(count) + "\n"
    myurl = nexturl1 + str(count) + nexturl2
    myres = urllib2.urlopen(myurl)#抓取网页
    mypage = myres.read()#读取网页内容
    ucpage = mypage.decode("utf-8") #转码

    mat = pat.findall(ucpage)#用正则表达式抓取图片地址

    count += 1;

    if len(mat):
        for item in mat:
            print "url: " + item + "\n"
            fnp = re.compile('/(\w+\.\w+)$')#下面三行分离出图片文件的名称
            fnr = fnp.findall(item)
            fname = fnr[0]
            urllib.urlretrieve(item, fname)#下载图片

    else:
        print "no data"

使用方法：新建一个practice文件夹，将源代码保存为qb.py文件，并放在practice文件夹中，在命令行里执行python qb.py，即开始下载图片。可以修改源代码里面的while语句设置下载的页数。

python,爬虫入门教程,糗百图片爬虫

黑松山资源网 Design By www.paidiu.com

广告合作：本站广告合作请联系QQ：858582 申请时备注：广告合作（否则不回）
免责声明：本站资源来自互联网收集,仅供用于学习和交流,请遵循相关法律法规,本站一切资源不代表本站立场,如有侵权、后门、不妥请联系本站删除！

黑松山资源网 Design By www.paidiu.com

评论“python爬虫入门教程之糗百图片爬虫代码分享”

暂无评论...

P70系列延期，华为新旗舰将在下月发布

3月20日消息，近期博主@数码闲聊站透露，原定三月份发布的华为新旗舰P70系列延期发布，预计4月份上市。

而博主@定焦数码爆料，华为的P70系列在定位上已经超过了Mate60，成为了重要的旗舰系列之一。它肩负着重返影像领域顶尖的使命。那么这次P70会带来哪些令人惊艳的创新呢？
根据目前爆料的消息来看，华为P70系列将推出三个版本，其中P70和P70 Pro采用了三角形的摄像头模组设计，而P70 Art则采用了与上一代P60 Art相似的不规则形状设计。这样的外观是否好看见仁见智，但辨识度绝对拉满。

更新日志

2024年10月10日

python爬虫入门教程之糗百图片爬虫代码分享

Python深入学习之对象的属性

Python深入学习之上下文管理器

评论“python爬虫入门教程之糗百图片爬虫代码分享”

P70系列延期，华为新旗舰将在下月发布

更新日志

友情链接