web crawling(plus6) pic mining

时间：2017-10-03 16:20:54 阅读：301 评论：0 收藏：0 [点我收藏+]

#Author：Mini
#！/usr/bin/env python
import urllib.request
import re
import urllib.error
headers=("User-Agent","Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:56.0) Gecko/20100101 Firefox/56.0")
opener=urllib.request.build_opener()
opener.addheaders=[headers]
urllib.request.install_opener(opener)
keyword="连衣裙"
key=urllib.request.quote(keyword)
for i in range(1,101):
   try:
       url="https://s.taobao.com/search?q="+key+"&imgfile=&js=1&stats_click=search_radio_all%3A1&initiative_id=staobaoz_20171003&ie=utf8&bcoffset=4&ntoffset=4&p4ppushleft=1%2C48&s="+str(i*44)
       data=urllib.request.urlopen(url).read().decode("utf-8","ignore")
       pat1=‘"pic_url":"//(.*?)"‘
       pic=re.compile(pat1).findall(data)
       print("success!")
       print(pic)
       for j in range(0,len(pic)):
           thispic=pic[j]
           thispicurl="http://"+thispic
           picf="E:/m/"+str(i)+"."+str(j)+".jpg"
           urllib.request.urlretrieve(thispicurl,filename=picf)
   except urllib.error.URLError as e:
       if hasattr(e, "code"):
           print(e.code)
       if hasattr(e, "reason"):
           print(e.reason)

原文：http://www.cnblogs.com/rabbittail/p/7623819.html

踩

(0)

评论一句话评论（0）

分享档案

更多>

2021年09月23日 (328)
2021年09月24日 (313)
2021年09月17日 (191)
2021年09月15日 (369)
2021年09月16日 (411)
2021年09月13日 (439)
2021年09月11日 (398)
2021年09月12日 (393)
2021年09月10日 (160)
2021年09月08日 (222)