首页 > Web开发 > 详细

nodeJS实现简易爬虫

时间:2019-08-28 18:28:57      阅读:79      评论:0      收藏:0      [点我收藏+]

nodeJS实现简易爬虫

需求:使用nodeJS爬取昵图网某个分类下的图片并存入本地

  • 运用nodeJS自带系统模块http、fs

    示例代码:

var http =require('http');
var fs =require('fs');

var curentPage=1; //当前图片页数
var maxcurentPage=5;//最大页数
//获取图片地址
function getData(){
    let url = 'http://www.nipic.com/photo/xiandai/jiaotong/index.html?page='+curentPage
    http.get(url,(res)=>{
        var data = '';
        res.on('data',(a)=>{
            data+=a.toString();
        })
        res.on('end',()=>{
            let reg = /<img src="(.+?)" data-src="(.*?)"  alt="(.*?)" \/>/g
            let arr=[];
            while (reg.exec(data)){
                arr.push(reg.exec(data)[2]);
            }
            for(i in arr){
                (function(i){
                    setTimeout(()=>{
                        getImg(arr[i])
                    },500*i)
                })(i)
            }
            if (curentPage < maxcurentPage){
                curentPage++;
                arguments.callee();
            }
        })
    })
}
//图片写入img文件夹
function getImg(url){
    let u = url.replace(/\/pic\//,'/file/')
        .replace(/_4.jpg/,'_2.jpg');
    http.get(u,(res)=>{
        let name = new Date().getTime();
        let stream = fs.createWriteStream('./img/' + name + '.png');
        res.pipe(stream);
    })
}
getData();

nodeJS实现简易爬虫

原文:https://www.cnblogs.com/sgs123/p/11425008.html

(0)
(0)
   
举报
评论 一句话评论(0
关于我们 - 联系我们 - 留言反馈 - 联系我们:wmxa8@hotmail.com
© 2014 bubuko.com 版权所有
打开技术之扣,分享程序人生!