Node.js 实现简单小说爬虫实例

更新时间：2016年11月18日 13:06:37 作者：leeonway

现在爬虫在很多web项目中都有应用，这篇文章主要介绍了Node.js 实现简单小说爬虫实例，有兴趣的可以了解一下。

最近因为剧荒，老大追了爱奇艺的一部网剧，由丁墨的同名小说《美人为馅》改编，目前已经放出两季，虽然整部剧槽点满满，但是老大看得不亦乐乎，并且在看完第二季之后跟我要小说资源，直接要奔原著去看结局……

随手搜了下，都是在线资源，下载的话需要登录，注册登录好麻烦，写个爬虫玩玩也好，于是动手用 node 写了一个，这里做下笔记

工作流程

获取 URLs 列表(请求资源 request模块)
根据 URLs 列表获取相关页面源码(可能遇到页面编码问题，iconv-lite模块)
源码解析，获取小说信息( cheerio模块)
保存小说信息到 Markdown 文件，并且加适当修饰以及章节信息(写文件 fs、同步请求资源 sync-request 模块)
Markdown 转 PDF (使用 Pandoc 或者 Chrome 的打印功能)

获取 URLs

根据小说的导航页，获取小说所有章节的 URL，并且以 JSON 数组的方式存储。

首选通过 http.get() 方法获取页面源码
获取到源码，打印发现中文乱码，查看发现 charset = 'gbk'，需要进行转码
使用 iconv-lite 模块进行转码，中文显示正常后开始解析源码，获取需要的 URL，为了更方便地解析，需要引进 cheerio 模块，cheerio 可以理解为运行在后台的 jQuery，用法与 jQuery 也十分相似，熟悉 jQuery 的同学可以很快的上手
将源码加载进 cheerio，分析了源码后得知所有章节信息都存于被 div 包裹的 a 标签中，通过 cheerio 取出符合条件的 a 标签组，进行遍历，获取章节的 title 和 URL，保存为对象，存进数组，(因为链接中存储的 URL 不完整，所以存储时需要补齐)
将对象数组序列化，写进 list.json 文件

var http = require("http")
var fs = require("fs")
var cheerio = require("cheerio")
var iconv = require("iconv-lite")
var url = 'http://www.17fa.com/files/article/html/90/90747/index.html'
http.get(url, function(res) { //资源请求
  var chunks = []
  res.on('data', function(chunk) {
    chunks.push(chunk)
  })
  res.on('end', function() {
    var html = iconv.decode(Buffer.concat(chunks), 'gb2312') //转码操作
    var $ = cheerio.load(html, {
      decodeEntities: false
    })
    var content = $("tbody")
    var links = []
    $('div').children('a').each(function(i, elem) {
      var link = new Object()
      link.title = $(this).text()
      link.link = 'http://www.17fa.com/files/article/html/90/90747/' + $(this).attr('href') //补齐 URL 信息
      if (i > 5) {
        links.push(link)
      }
    })
    fs.writeFile("list.json", JSON.stringify(links), function(err) {
      if (!err) {
        console.log("写文件成功")
      }
    })
  }).on('error', function() {
    console.log("网页访问出错")
  })
})

获取的列表示例

[{
  "title": "3 法医司白",
  "link": "http://www.17fa.com/files/article/html/90/90747/16548771.html"
}, {
  "title": "4 第1个梦 ",
  "link": "http://www.17fa.com/files/article/html/90/90747/16548772.html"
}, {
  "title": "5 刑警韩沉 ",
  "link": "http://www.17fa.com/files/article/html/90/90747/16548773.html"
}, {
  "title": "6 最初之战",
  "link": "http://www.17fa.com/files/article/html/90/90747/16548774.html "
}]

获取数据

有了 URLs 列表，接下来的工作就很机械了，遍历 URLs 列表请求资源，获取源码，解析源码，获取小说，写文件，但是，因为最终将所有的章节保存入一个文件，要保证章节的顺序，因此写文件需要同步操作，实际上，我在编码的时候所有的操作都改成了同步方式

获取源码

通过解析读取的 list.json 文件，获取到 URLs 列表，遍历列表获取资源，因为需要确保章节的顺序，所以这里引进 sync-request 模块进行同步 request 请求资源，请求资源后照例转码

var http = require("http")
var fs = require("fs")
var cheerio = require("cheerio")
var iconv = require("iconv-lite")
var request = require('sync-request')
var urlList = JSON.parse(fs.readFileSync('list.json', 'utf8'))
function getContent(chapter) {
  var res = request('GET',chapter.link)
  var html = iconv.decode(res.body, 'gb2312') //获取源码
}
for (let i = 0; i < urlList.length; i++) {
  getContent(urlList[i])
}

解析源码，获取小说

还是通过 cheerio 模块获取小说内容，避免影响观感，写操作之前去除内容中的的 html 标签

function getContent(chapter) {
  var res = request('GET',chapter.link)
  var html = iconv.decode(res.body, 'gb2312')
  var $ = cheerio.load(html, {
    decodeEntities: false
  })
  var content = ($("div#r1c").text()).replace(/\&nbsp;/g, '')
}

保存小说

写操作也需要同步操作，因此使用了同步写函数 fs.writeFileSync() 和同步添加函数 fs.appendFileSync()，第一次写使用写函数，之后的内容都是进行 append 操作，为了改善阅读体验，每个章节前添加标题

也可以在内容前添加拍 [TOC]，作为导航链接

var http = require("http")
var fs = require("fs")
var cheerio = require("cheerio")
var iconv = require("iconv-lite")
var path = require('path')
var urlList = JSON.parse(fs.readFileSync('list.json', 'utf8'))
function getContent(chapter) {
  console.log(chapter.link)
  http.get(chapter.link, function(res) {
    var chunks = []
    res.on('data', function(chunk) {
      chunks.push(chunk)
    })
    res.on('end', function() {
      var html = iconv.decode(Buffer.concat(chunks), 'gb2312')
      var $ = cheerio.load(html, {
        decodeEntities: false
      })
      var content = ($("div#r1c").text()).replace(/\&nbsp;/g, '')
      if (fs.existsSync('美人为馅.md')) {
        fs.appendFileSync('美人为馅.md', '### ' + chapter.title)
        fs.appendFileSync('美人为馅.md', content)
      } else {
        fs.writeFileSync('美人为馅.md', '### ' + chapter.title)
        fs.appendFileSync('美人为馅.md', content)
      }
    })
  }).on('error', function() {
    console.log("爬取" + chapter.link + "链接出错！")
  })
}
for (let i = 0; i < urlList.length; i++) {
  console.log(urlList[i])
  getContent(urlList[i])
}

Markdown 转 PDF

我将小说保存在 Markdown 文件中，为了提升阅读体验，可以将 Markdown 文件转换成 PDF 文件，目前我较为喜欢的两种方式，通过 Chrome 的打印功能以及 pandoc 转换

Chrome 打印

SublimeText 有个插件 markdown preview ，可通过 Alt + m 快捷键在 Chrome 中预览 Markdown，在 Chrome 页面中右键，选择打印，调整好参数后，选择另存为 PDF，简单，粗暴，深得我心

打印效果：

pandoc 转换
pandoc 是十分强大的文件格式转换工具，可以将 Markdown 文件转换成多种格式，今晚在 windows10 下折腾了半天，始终检索不到 pdflatex，关于 pandoc，后面会专门写一篇总结。

PDF 已经发给老大了，现在正在看

关于python、node、爬虫

在之前很长的一段时间里，很想用 Python，很想写爬虫，更想用 Python 写爬虫，甚至成为了心里的一块执念，随着接触的知识更全面，执念也逐渐淡去，少了很多“想”，遇事想着多去动手，实践出真知。

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持脚本之家。

您可能感兴趣的文章:

node.js发送邮件email的方法详解
这篇文章主要介绍了node.js发送邮件email的方法,结合实例形式详细分析了node.js发送邮件的原理、操作步骤、注意事项及常见问题解决方法,需要的朋友可以参考下
2017-01-01
node.js与C语言实现遍历文件夹下最大的文件，并输出路径，大小
这篇文章主要介绍了node.js与C语言实现遍历文件夹下最大的文件，并输出路径，大小的相关资料,需要的朋友可以参考下
2017-01-01
node.js中RPC(远程过程调用)的实现原理介绍
这篇文章主要介绍了node.js中RPC(远程过程调用)的实现原理介绍,本文基于一个简单的RPC库nodejs light_rpc实现,需要的朋友可以参考下
2014-12-12
nodejs调用cmd命令实现复制目录
本文给大家介绍的是如何在nodejs中调用CMD命令，从而实现目录的复制，非常的实用，有需要的小伙伴可以参考下。
2015-05-05
如何使用npm安装yarn详解
Yarn是一个新的快速安全可信赖的可以替代NPM的依赖管理工具,下面这篇文章主要给大家介绍了关于如何使用npm安装yarn的相关资料,文中通过实例代码介绍的非常详细,需要的朋友可以参考下
2022-09-09
解决Node.js包管理器安装报错npm ERR! code 1的问题
在开发过程中,我们经常需要使用各种Node.js包来扩展我们的应用程序功能,这些包通常通过npm（Node.js包管理器）进行安装和管理,有时候我们可能会遇到一些关于npm的错误,本文将详细介绍如何解决这个问题,并提供一个详细的实例,需要的朋友可以参考下
2024-03-03
nodejs 图片预览和上传的示例代码
本篇文章主要介绍了nodejs 图片预览和上传的示例代码，小编觉得挺不错的，现在分享给大家，也给大家做个参考。一起跟随小编过来看看吧
2017-09-09
Nodejs + Websocket 指定发送及群聊的实现
这篇文章主要介绍了Nodejs + Websocket 指定发送及群聊的实现，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2020-01-01
使用nodejs中httpProxy代理时候出现404异常的解决方法
下面小编就为大家带来一篇使用nodejs中httpProxy代理时候出现404异常的解决方法。小编觉得挺不错的，现在就分享给大家，也给大家做个参考。一起跟随小编过来看看吧
2016-08-08
Node.js使用Koa搭建基础项目
时下前端工程师有很多人比较关注NodeJs以及express 框架或者Koa 框架之类的新技术。难得我最近闲时较多，利用一下旧历新年尚未正式到来的这片闲暇，也来涉足其中，一窥其中奥妙。
2018-01-01

Node.js 实现简单小说爬虫实例

相关文章

最新评论

大家感兴趣的内容

最近更新的内容

常用在线小工具