首页 > Web开发 > 详细

网页资源下载器

时间:2015-07-28 16:02:58      阅读:338      评论:0      收藏:0      [点我收藏+]

一个简单的python程序,用于下载pdf/txt/ppt等网页资源下载。

import urllib 
import urllib2 
import re 
import socket

#######################You may change here###############
baseurl = ‘##########‘  #请自行添加下载网页地址
format = ‘(pdf|txt|cc|ppt|pptx)‘ #下载格式,可自行添加
#########################################################

def downfunc(blocknum, blocksize, totalsize):
    ‘‘‘回调函数
    @blocknum:  已经下载的数据块
    @blocksize: 数据块的大小
    @totalsize: 下载文件的大小
    ‘‘‘
    percent = 100.0 * blocknum * blocksize / totalsize
    if percent > 100:
        percent = 100
        print "下载完成^^~"
    else:
        print "已下载%.2f%%......"% percent

def download(downurl, localFileName=None):
    #m = re.search(‘(\w+.pdf)‘,downurl)
    m = re.search(‘(\w+.%s)‘ % format,downurl)  
    if localFileName == None:
        localFileName = m.group(0)

    print ("正在下载" + localFileName)

    try:
        urllib.urlretrieve(downurl, localFileName,downfunc)  
    except socket.timeout:
        print "下载超时"

socket.setdefaulttimeout(30)

#打开页面
page = urllib2.urlopen(baseurl) 

# 读取包含HTML源码内容的页面信息 
page_inform = page.read() 

# 获取资源列表
#list_of_res = re.findall(r‘href=.*"(.*\.pdf)‘, page_inform)
list_of_res = re.findall(r‘href=.*"(.*\.%s)‘ % format, page_inform)

# 去除重复的资源
list_of_res = list(set(list_of_res)) 

# 根据资源列表逐个下载
for res in list_of_res:
    downurl = res[0]
    if downurl[0:4] != ‘http‘:
        downurl = baseurl+downurl
    download(downurl)

程序下载:
网页资源下载器

版权声明:本文为博主原创文章,未经博主允许不得转载。

网页资源下载器

原文:http://blog.csdn.net/kzq_qmi/article/details/47105761

(0)
(0)
   
举报
评论 一句话评论(0
关于我们 - 联系我们 - 留言反馈 - 联系我们:wmxa8@hotmail.com
© 2014 bubuko.com 版权所有
打开技术之扣,分享程序人生!