TXT 乱码的成因
打开 TXT 文件看到一堆「锟斤拷」「烫烫烫」「??」之类的乱码,根本原因是:打开文件用的编码和文件实际保存的编码不一致。
文本文件本身只是一串字节,编码就是把这串字节解释成文字的规则。同一串字节,用 UTF-8 解释是一个字,用 GBK 解释可能完全是另一个字,甚至解释不出来。常见情况:
- 文件是 GBK 编码(老 Windows 记事本默认),用 UTF-8 打开 → 乱码。
- 文件是 UTF-8 编码,但带了 BOM,某些阅读器不认 BOM → 首行多出几个字符。
- 文件是 Big5 编码(繁体中文站点),用 GBK 打开 → 乱码。
- 文件是 Shift_JIS 编码(日文站点),用 GBK 打开 → 乱码。
网文 TXT 大多来自不同站点、不同年代,编码混杂。老站点(2010 年前后)多为 GBK,新站点多为 UTF-8,港台站点多为 Big5,日文站点用 Shift_JIS。直接打开就可能乱码。
常见编码一览
| 编码 | 来源 | 典型场景 |
|---|---|---|
| UTF-8 | 国际通用、新站点 | 2015 年后的网文、Web 标准 |
| GBK / GB2312 | 简体中文 Windows | 老站点、老 Windows 记事本默认 |
| Big5 | 繁体中文 | 港台站点、繁体小说 |
| Shift_JIS | 日文 | 日文站点、轻小说 |
| UTF-8 BOM | Windows 记事本新版 | 首行多 BOM 字符 |
转换 EPUB 时,必须先把 TXT 正确解析成文字,才能分章、设封面、转换。如果编码识别错了,后续步骤全乱套——章节名是乱码、正文是乱码、生成的 EPUB 也是乱码。
自动编码检测
本站 TXT 转 EPUB 工具内置了编码自动检测,上传 TXT 后会自动尝试以下编码:
- UTF-8(含 BOM 与不含 BOM)
- GBK / GB2312
- Big5
- Shift_JIS
检测逻辑是按编码尝试解码,看是否产生无效字符或常见乱码特征,自动选最可能的编码。大多数情况下,自动检测能正确识别 UTF-8 和 GBK,Big5 和 Shift_JIS 也基本能识别。
自动检测的好处是不用手动试,上传文件直接就能看到正文。但自动检测不是 100% 准确,少数情况下会识别错,这时需要手动切换编码。
手动切换编码重新解析
如果自动检测识别错了(比如把 GBK 识别成了 UTF-8,正文出现「锟斤拷」),可以在编码选择器里手动切换:
- 打开编码选择器(通常在文件上传后、正文预览区附近)。
- 选择目标编码:UTF-8、GBK、Big5、Shift_JIS 等。
- 工具用选定编码重新解析 TXT,正文立即刷新。
- 看正文是否正常显示,正常了再进入下一步。
手动切换适合自动检测出错的情况。判断正文是否正常,看几个特征:
- 章节标题行(如「第一章」)是否是正常汉字。
- 标点符号(如「,」「。」)是否正常。
- 有没有出现「?」「??」或方块字符。
只要章节标题和正文前几段是正常汉字,编码就对了。
乱码修复实例
情况一:GBK 文件被识别成 UTF-8
现象:正文出现「锟斤拷」「烫烫烫」之类的乱码,但章节标题偶尔能认出。
修复:手动切换到 GBK 编码,正文立即恢复正常汉字。
情况二:Big5 文件被识别成 GBK
现象:繁体小说打开后是简体乱码,或一堆生僻字。
修复:手动切换到 Big5 编码,繁体字正常显示。
情况三:UTF-8 BOM 导致首行异常
现象:正文第一行多出「」或几个看不见的字符,第一章标题前有空行。
修复:工具通常会自动处理 BOM,如果没处理,手动选「UTF-8(去 BOM)」或重新保存为无 BOM 的 UTF-8。
情况四:Shift_JIS 日文乱码
现象:日文轻小说打开后是乱码或问号。
修复:手动切换到 Shift_JIS 编码,日文正常显示。
转换前的编码检查
在进入分章、设封面、转换之前,务必确认编码正确。判断方法:
- 章节标题行能正确识别(智能分章结果正常)。
- 正文前几段是正常汉字,无乱码。
- 标点符号正常显示。
如果以上三点都正常,说明编码正确,可以放心转换。如果有任何异常,先在编码选择器里试其他编码,直到正文正常。
转换后的 EPUB 是什么编码
转换后的 EPUB 内部统一使用 UTF-8 编码(这是 EPUB 标准规定的)。所以无论你的 TXT 原来是 GBK、Big5 还是 Shift_JIS,转换后都是 UTF-8,在任何阅读器上都不会再出现编码问题。这也是把 TXT 转 EPUB 的一个附带好处:一次性把编码问题解决掉。
预防乱码的建议
- 下载时优先选 UTF-8:如果站点提供多种编码下载,优先选 UTF-8。
- 本地保存为 UTF-8:用编辑器打开 TXT,另存为 UTF-8(无 BOM),一劳永逸。
- 转换前检查:上传 TXT 后先看正文预览,确认无乱码再转换。
- 用工具自动检测:本站工具支持自动检测,多数情况能识别正确,识别错了手动切换即可。
小结
TXT 乱码本质是编码不匹配。本站 TXT 转 EPUB 工具支持 UTF-8、GBK、Big5、Shift_JIS 等主流编码的自动检测,识别错了可以手动切换编码重新解析。转换前务必确认正文无乱码,转换后 EPUB 内部统一为 UTF-8,不会再有编码问题。遇到乱码不要慌,在编码选择器里试几种编码,总能找到对的那个。