NodeJS去除BOM和转换UTF8编码

更新时间：2023年11月18日 16:56:47 投稿：yin

使用NodeJS编写前端工具时,操作得最多的是文本文件,但遗憾的是,GBK编码不在NodeJS自身支持范围内,UTF8文件还可能带有BOM,在读取不同编码的文本文件时,需要将文件内容转换为JS使用的UTF8编码字符串后才能正常处理

使用NodeJS编写前端工具时，操作得最多的是文本文件，因此也就涉及到了文件编码的处理问题。我们常用的文本编码有UTF8和GBK两种，并且UTF8文件还可能带有BOM。在读取不同编码的文本文件时，需要将文件内容转换为JS使用的UTF8编码字符串后才能正常处理。

BOM用于标记一个文本文件使用Unicode编码,其本身是一个Unicode字符（"\uFEFF"）,根据文本文件头几个字节等于啥来判断文件是否包含BOM,以及使用哪种Unicode编码,NodeJS支持在读取文本文件时,或者在Buffer转换为字符串时指定文本编码,但遗憾的是,GBK编码不在NodeJS自身支持范围内,因此,一般我们借助iconv-lite这个三方包来转换编码。

BOM的移除

BOM用于标记一个文本文件使用Unicode编码，其本身是一个Unicode字符（"\uFEFF"），位于文本文件头部。在不同的Unicode编码下，BOM字符对应的二进制字节如下：

    Bytes      Encoding
----------------------------
    FE FF       UTF16BE
    FF FE       UTF16LE
    EF BB BF    UTF8

因此，我们可以根据文本文件头几个字节等于啥来判断文件是否包含BOM，以及使用哪种Unicode编码。但是，BOM字符虽然起到了标记文件编码的作用，其本身却不属于文件内容的一部分，如果读取文本文件时不去掉BOM，在某些使用场景下就会有问题。例如我们把几个JS文件合并成一个文件后，如果文件中间含有BOM字符，就会导致浏览器JS语法错误。因此，使用NodeJS读取文本文件时，一般需要去掉BOM。例如，以下代码实现了识别和去除UTF8 BOM的功能。

function readText(pathname) {
    var bin = fs.readFileSync(pathname);

    if (bin[0] === 0xEF && bin[1] === 0xBB && bin[2] === 0xBF) {
        bin = bin.slice(3);
    }

    return bin.toString('utf-8');
}

GBK转UTF8

NodeJS支持在读取文本文件时，或者在Buffer转换为字符串时指定文本编码，但遗憾的是，GBK编码不在NodeJS自身支持范围内。因此，一般我们借助iconv-lite这个三方包来转换编码。使用NPM下载该包后，我们可以按下边方式编写一个读取GBK文本文件的函数。

var iconv = require('iconv-lite');

function readGBKText(pathname) {
    var bin = fs.readFileSync(pathname);

    return iconv.decode(bin, 'gbk');
}

单字节编码

有时候，我们无法预知需要读取的文件采用哪种编码，因此也就无法指定正确的编码。比如我们要处理的某些CSS文件中，有的用GBK编码，有的用UTF8编码。虽然可以一定程度可以根据文件的字节内容猜测出文本编码，但这里要介绍的是有些局限，但是要简单得多的一种技术。

首先我们知道，如果一个文本文件只包含英文字符，比如Hello World，那无论用GBK编码或是UTF8编码读取这个文件都是没问题的。这是因为在这些编码下，ASCII0~128范围内字符都使用相同的单字节编码。

反过来讲，即使一个文本文件中有中文等字符，如果我们需要处理的字符仅在ASCII0~128范围内，比如除了注释和字符串以外的JS代码，我们就可以统一使用单字节编码来读取文件，不用关心文件的实际编码是GBK还是UTF8。以下示例说明了这种方法。

1\. GBK编码源文件内容：
    var foo = '中文';
2\. 对应字节：
    76 61 72 20 66 6F 6F 20 3D 20 27 D6 D0 CE C4 27 3B
3\. 使用单字节编码读取后得到的内容：
    var foo = '{乱码}{乱码}{乱码}{乱码}';
4\. 替换内容：
    var bar = '{乱码}{乱码}{乱码}{乱码}';
5\. 使用单字节编码保存后对应字节：
    76 61 72 20 62 61 72 20 3D 20 27 D6 D0 CE C4 27 3B
6\. 使用GBK编码读取后得到内容：
    var bar = '中文';

这里的诀窍在于，不管大于0xEF的单个字节在单字节编码下被解析成什么乱码字符，使用同样的单字节编码保存这些乱码字符时，背后对应的字节保持不变。

NodeJS中自带了一种binary编码可以用来实现这个方法，因此在下例中，我们使用这种编码来演示上例对应的代码该怎么写。

function replace(pathname) {
    var str = fs.readFileSync(pathname, 'binary');
    str = str.replace('foo', 'bar');
    fs.writeFileSync(pathname, str, 'binary');
}

到此这篇关于NodeJS去除BOM和转换UTF8编码的文章就介绍到这了,更多相关NodeJS去除BOM和转换编码内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家！

您可能感兴趣的文章:

详解nodejs微信公众号开发——1.接入微信公众号
本篇文章主要介绍了详解nodejs微信公众号开发——1.接入微信公众号，非常具有实用价值，需要的朋友可以参考下
2017-04-04
使用nodejs spider爬取图片及数据实现
这篇文章主要为大家介绍了使用nodejs spider爬取图片及数据实现详解，有需要的朋友可以借鉴参考下，希望能够有所帮助，祝大家多多进步，早日升职加薪
2023-07-07
koa2实现登录注册功能的示例代码
这篇文章主要介绍了koa2实现登录注册功能的示例代码，小编觉得挺不错的，现在分享给大家，也给大家做个参考。一起跟随小编过来看看吧
2018-12-12
centos 上快速搭建ghost博客方法分享
本文给大家分享的是如何在centos上快速搭建基于Node.js 构建的开源博客平台ghost的方法，非常的实用，有需要的小伙伴可以参考下
2018-05-05
如何制作一个Node命令行图像识别工具
这篇文章主要介绍了如何制作一个Node命令行图像识别工具，小编觉得挺不错的，现在分享给大家，也给大家做个参考。一起跟随小编过来看看吧
2018-12-12
NodeJS实现一个聊天室功能
这篇文章主要介绍了NodeJS实现一个聊天室功能，本文实例截图相结合给大家介绍的非常详细，具有一定的参考借鉴价值,需要的朋友可以参考下
2019-11-11
Node.js的包详细介绍
这篇文章主要介绍了Node.js的包详细介绍,Node.js的包是一个目录,其中包含JSON格式的包说明文件package.json,Node.js的包基本遵循CommonJS规范,需要的朋友可以参考下
2015-01-01
基于豆瓣API+Angular开发的web App
这篇文章主要介绍了基于豆瓣API+Angular开发的web App的方法和示例代码，效果非常棒，有需要的小伙伴参考下
2015-01-01
浅谈Nodejs观察者模式
这篇文章主要介绍了浅谈Nodejs观察者模式的相关资料,需要的朋友可以参考下
2015-10-10
NodeJS实现单点登录原理解析
随着公司业务的增多，必然会产生各个不同的系统，如果每个系统都需要单独登录的话就会很不方便，所以这个时候单点登录会很方便，今天通过本文给大家讲解NodeJS实现单点登录原理解析，感兴趣的朋友一起看看吧
2022-05-05

NodeJS去除BOM和转换UTF8编码

目录

BOM的移除

GBK转UTF8

单字节编码

相关文章

最新评论

大家感兴趣的内容

最近更新的内容

常用在线小工具