返回列表
5 分钟阅读

TXT 编码与乱码修复:UTF-8/GBK/Big5 自动识别

TXT 打开是乱码怎么办?详解 UTF-8、GBK、Big5、Shift_JIS 编码识别、手动切换与乱码修复。

TXT 乱码的成因

打开 TXT 文件看到一堆「锟斤拷」「烫烫烫」「??」之类的乱码,根本原因是:打开文件用的编码和文件实际保存的编码不一致

文本文件本身只是一串字节,编码就是把这串字节解释成文字的规则。同一串字节,用 UTF-8 解释是一个字,用 GBK 解释可能完全是另一个字,甚至解释不出来。常见情况:

网文 TXT 大多来自不同站点、不同年代,编码混杂。老站点(2010 年前后)多为 GBK,新站点多为 UTF-8,港台站点多为 Big5,日文站点用 Shift_JIS。直接打开就可能乱码。

常见编码一览

编码 来源 典型场景
UTF-8 国际通用、新站点 2015 年后的网文、Web 标准
GBK / GB2312 简体中文 Windows 老站点、老 Windows 记事本默认
Big5 繁体中文 港台站点、繁体小说
Shift_JIS 日文 日文站点、轻小说
UTF-8 BOM Windows 记事本新版 首行多 BOM 字符

转换 EPUB 时,必须先把 TXT 正确解析成文字,才能分章、设封面、转换。如果编码识别错了,后续步骤全乱套——章节名是乱码、正文是乱码、生成的 EPUB 也是乱码。

自动编码检测

本站 TXT 转 EPUB 工具内置了编码自动检测,上传 TXT 后会自动尝试以下编码:

检测逻辑是按编码尝试解码,看是否产生无效字符或常见乱码特征,自动选最可能的编码。大多数情况下,自动检测能正确识别 UTF-8 和 GBK,Big5 和 Shift_JIS 也基本能识别。

自动检测的好处是不用手动试,上传文件直接就能看到正文。但自动检测不是 100% 准确,少数情况下会识别错,这时需要手动切换编码。

手动切换编码重新解析

如果自动检测识别错了(比如把 GBK 识别成了 UTF-8,正文出现「锟斤拷」),可以在编码选择器里手动切换:

  1. 打开编码选择器(通常在文件上传后、正文预览区附近)。
  2. 选择目标编码:UTF-8、GBK、Big5、Shift_JIS 等。
  3. 工具用选定编码重新解析 TXT,正文立即刷新。
  4. 看正文是否正常显示,正常了再进入下一步。

手动切换适合自动检测出错的情况。判断正文是否正常,看几个特征:

只要章节标题和正文前几段是正常汉字,编码就对了。

乱码修复实例

情况一:GBK 文件被识别成 UTF-8

现象:正文出现「锟斤拷」「烫烫烫」之类的乱码,但章节标题偶尔能认出。

修复:手动切换到 GBK 编码,正文立即恢复正常汉字。

情况二:Big5 文件被识别成 GBK

现象:繁体小说打开后是简体乱码,或一堆生僻字。

修复:手动切换到 Big5 编码,繁体字正常显示。

情况三:UTF-8 BOM 导致首行异常

现象:正文第一行多出「」或几个看不见的字符,第一章标题前有空行。

修复:工具通常会自动处理 BOM,如果没处理,手动选「UTF-8(去 BOM)」或重新保存为无 BOM 的 UTF-8。

情况四:Shift_JIS 日文乱码

现象:日文轻小说打开后是乱码或问号。

修复:手动切换到 Shift_JIS 编码,日文正常显示。

转换前的编码检查

在进入分章、设封面、转换之前,务必确认编码正确。判断方法:

如果以上三点都正常,说明编码正确,可以放心转换。如果有任何异常,先在编码选择器里试其他编码,直到正文正常。

转换后的 EPUB 是什么编码

转换后的 EPUB 内部统一使用 UTF-8 编码(这是 EPUB 标准规定的)。所以无论你的 TXT 原来是 GBK、Big5 还是 Shift_JIS,转换后都是 UTF-8,在任何阅读器上都不会再出现编码问题。这也是把 TXT 转 EPUB 的一个附带好处:一次性把编码问题解决掉

预防乱码的建议

小结

TXT 乱码本质是编码不匹配。本站 TXT 转 EPUB 工具支持 UTF-8、GBK、Big5、Shift_JIS 等主流编码的自动检测,识别错了可以手动切换编码重新解析。转换前务必确认正文无乱码,转换后 EPUB 内部统一为 UTF-8,不会再有编码问题。遇到乱码不要慌,在编码选择器里试几种编码,总能找到对的那个。

相关文章

TXT 转 EPUB 完全指南:网文一键转换

开始转换你的 TXT 文件

智能分章、自定义封面、本地转换,隐私安全

立即转换