首页 > 编程语言 > 详细

Python爬虫 爬取豆瓣读书

时间:2015-05-21 10:55:37      阅读:744      评论:0      收藏:0      [点我收藏+]

最近用Python写了个豆瓣读书的爬虫玩,方便搜罗各种美美书,分享给大家



实现功能:

1 可以爬下豆瓣读书标签下的所有图书

2 按评分排名依次存储

3 存储到Excel中,可方便大家筛选搜罗,比如筛选评价人数>1000的高分书籍;可依据不同的主题存储到Excel不同的Sheet

4 采用User Agent伪装为浏览器进行爬取,并加入随机延时来更好的模仿浏览器行为,避免爬虫被封



试着爬了七八万本书,存在了book_list.xlsx中,结果截图如下:

技术分享



详细代码和爬取的一些结果可移步到GitHub: https://github.com/lanbing510/DouBanSpider



Python爬虫 爬取豆瓣读书

原文:http://blog.csdn.net/lanbing510/article/details/45887075

(0)
(0)
   
举报
评论 一句话评论(0
关于我们 - 联系我们 - 留言反馈 - 联系我们:wmxa8@hotmail.com
© 2014 bubuko.com 版权所有
打开技术之扣,分享程序人生!