简繁中文互转
转换简体中文与繁体中文互转,逐字差异高亮。支持通用、台湾(含地区词汇如 内存→記憶體)、香港变体。基于 opencc-js,100% 浏览器端处理。
本页内容
什么是简繁转换?#
中文有两套并行的字体系。简体(简体字)在中国大陆、新加坡、马来西亚使用,是 1950 年代为提高识字率而减少笔画那次改革的产物。繁体(繁體字)在台湾、香港、澳门以及很多海外华人社区使用,也是古籍、书法和绝大多数 1950 年代以前文献里你能看到的形式。
两者之间的转换并不是简单的一对一换字,原因有两个:
- 一对多合并。 当年简化时,把好几个繁体字并成了一个简体字。简体的 发 要还原成繁体,得看意思:是 發(fā,“发送/发达”)还是 髮(fà,“头发”)。简体的 干 可能对应 幹、乾、干 三个。靠一张死查表挑一个,剩下的就全错。
- 地区用词不同。 同一个概念,在不同地区往往是不同的词。“内存”大陆叫 内存,台湾叫 記憶體;“软件”大陆叫 软件、台湾叫 軟體;“信息”大陆叫 信息、台湾叫 資訊。不把这些词改过来,只换字形,文本读起来还是一股大陆味,本地化就根本没做完。
本页两件事都做。通用场景下做字符级转换;针对台湾和香港,额外叠加地区词组改写,让输出对当地读者读起来自然,而不是一股机器味。同时把每一个变动的字都高亮出来,方便你一眼校对。
怎么使用#
- 选 方向:简体 → 繁体 或 繁体 → 简体。
- 选 地区:
- 通用 —— 纯字符级转换。只换字形、不在意地区用词时用(古籍、人名,或你打算自己改词)。
- 台湾 —— 字符转换 加 台湾用词变体(内存→記憶體、软件→軟體、信息→資訊)。
- 香港 —— 字符转换 加 香港自己的地区词组词典。
- 把文本贴进左侧 输入 框。右侧 输出 框显示转换结果,每一个跟输入不同的字都会高亮。
- 状态栏会报告一共改了多少个字。复制 拿走结果;示例 载入演示;清空 清空输入。
主要特性#
- 按地区改写词组。 选台湾或香港时,不只是换字——而是用主流本地化流程都在用的 OpenCC 词典把地区词汇改写掉,所以 内存 在台湾读者眼里真的是 記憶體(而不是只换字形的 內存)。
- 差异高亮。 输出按一串 span 渲染,变动的地方用高亮包起来。差异按 Unicode 码点粒度计算(扩展平面的生僻字也吃得准),当输入输出长度不同(词组改写)时,用最长公共子序列对齐,保证高亮范围有意义,而不是把整行都糊掉。
- 双向、三地区都支持。 简转繁、繁转简一视同仁,而且每个方向都覆盖 通用 / 台湾 / 香港。
- 词典本地内嵌。 完整的 OpenCC 词典打包在页面里——不发网络请求,离线也能用,你的文本不会离开浏览器。
- 安全渲染。 输出用受控的 DOM 接口构造(绝不把用户文本塞进
innerHTML),即便输入是恶意的,也注不进任何标签。
实例演示#
输入 中国汉字转换,方向选 简体 → 繁体,地区选 通用:
输入: 中国汉字转换
输出: 中國漢字轉換 (改了 4 个字:国→國、汉→漢、转→轉、换→換)
把地区切到 台湾,再试 内存。通用模式只换字,台湾模式会改词:
通用: 内存 → 內存 (字符级:内→內)
台湾: 内存 → 記憶體 (词组改写——台湾真正在用的那个词)
台湾词典还会改写好几个这类词——软件 变成 軟體、信息 变成 資訊。注意:一个没有台湾对应说法的字面词,只会被字符级转换——计算机 在任何地区都是 計算機,因为地区词典只改那些有当地专门说法的词。
想看反方向,输入 繁體中文,方向选 繁体 → 简体:
输入: 繁體中文
输出: 繁体中文 (改了 1 个字:體→体)
香港在字符转换之上挂的是它自己的一套地区词典,和台湾不同,所以同一段原文在两个地区下的输出可能略有差别——最快确认当前挂的是哪套词典的办法,就是拿一个地区词转一下、对比看看。
常见问题#
通用、台湾、香港 有什么区别?#
通用 只做一对一换字,不动词汇——适合人名、古籍,或者你打算自己处理用词的场合。台湾 和 香港 在换字之上叠了一层地区词组词典,所以台湾模式下 内存→記憶體、软件→軟體、信息→資訊。如果你的读者在台湾或香港,务必选对应的地区——否则字形对了,用词却一股大陆味。
一对多合并字(比如 发 → 發/髮),它能选对吗?#
如果是带上下文的整句,通常能选对,因为地区词典会根据周围字消歧。如果是一个孤立的、没有上下文的字,任何自动转换器都没法百分百确定——发 单独放着,确实两种都可能。法律、医学、出版物这类场景,高亮出来的字一定要人工复核。
输出里有些字为什么是高亮的?#
高亮标的就是转换过程中发生变动的那些字,让你把校对精力集中在真正动过的地方。差异按码点对齐;当输入输出长度不同(词组改写)时,用最长公共子序列(LCS)对齐,让高亮范围落在真正改动的片段上,而不是把整行都抹花。
我的文本简繁混杂,该选哪个方向?#
选占多数的那个方向。本工具不做字形自动识别——对混杂文本做完全正确的自动识别,需要字符表之外更多的上下文。如果你手上是一篇繁体文档,里面粘了几句简体,那就跑 繁体 → 简体,那几句简体会原样透传,不受影响。