Конвертер китайского (упрощённый ↔ традиционный)
КонвертацияКонвертируйте китайский текст между упрощённым и традиционным написанием с посимвольной подсветкой различий. Выбирайте общий, тайваньский (с региональной лексикой вроде 内存→記憶體) или гонконгский варианты. 100 % на стороне клиента через opencc-js.
На этой странице
Что такое упрощённый ↔ традиционный китайский?#
Китайский записывается двумя параллельными наборами символов. Упрощённый (简体) используется в материковом Китае, Сингапуре и Малайзии — результат реформы 1950-х, сократившей число черт ради повышения грамотности. Традиционный (繁體) используется на Тайване, в Гонконге, Макао и многими зарубежными общинами; это также форма, которую вы видите в классических текстах, каллиграфии и большинстве источников до 1950-х.
Преобразование между ними — нетривиальная замена 1:1 по двум причинам:
- Однозначные-многозначные символы. Несколько упрощений слили несколько традиционных символов в одну упрощённую форму. Упрощённое 发 восстанавливается как 發 (fā, «посылать / процветать») или 髮 (fà, «волос») в зависимости от смысла. Упрощённое 干 переходит в 幹, 乾 или 干. Наивная таблица замены выбирает одно и делает остальные неверно.
- Региональная лексика. Один и тот же концепт в разных регионах часто выражается разными словами. «Память» в материке — 内存, на Тайване — 記憶體; «ПО» в материке — 软件, на Тайване — 軟體; «информация» — 信息 versus 資訊. Настоящая локализация не закончена, пока эти фразы не переписаны, — одной замены символов хватает только для «материкового» аромата.
Эта страница справляется с обоими. Она делает посимвольное преобразование для общего случая и применяет учитывающее регион переписывание фраз для Тайваня и Гонконга, поэтому вывод читается естественно в каждом регионе, а не звучит как машинный перевод. Также подсвечиваются точно те символы, которые изменились, — для вычитки с одного взгляда.
Как пользоваться#
- Выберите направление: Упрощённый → Традиционный или Традиционный → Упрощённый.
- Выберите регион:
- Общий — чисто посимвольное преобразование. Используйте, когда нужно только сменить написание и не важна региональная лексика (классический текст, имена или вы локализуете лексику сами).
- Тайвань — посимвольное преобразование плюс тайваньские варианты фраз (内存→記憶體, 软件→軟體, 信息→資訊).
- Гонконг — посимвольное преобразование плюс гонконгские варианты из собственного регионального словаря.
- Вставьте текст в панель Ввод слева. Панель Вывод справа показывает преобразованный текст с подсветкой каждого изменившегося символа.
- Строка состояния сообщает число изменённых символов. Копировать забирает вывод; Пример загружает демо; Очистить опустошает ввод.
Ключевые возможности#
- Учитывающее регион переписывание фраз. Выбор Тайваня или Гонконга не просто меняет символы — он переписывает региональную лексику на тех же словарях OpenCC, что используют крупные локализационные пайплайны, поэтому 内存 действительно превращается в 記憶體 (а не просто в посимвольное 內存) для тайваньских читателей.
- Подсветка различий. Вывод строится как последовательность span-ов, причём изменившиеся участки обёрнуты в подсветку. Diff считается на уровне кодовых точек Unicode (поэтому символы дополнительных плоскостей обрабатываются корректно) и использует LCS-выравнивание для переписанных фраз, где длины ввода и вывода различаются.
- Оба направления, все регионы. Упрощённый→Традиционный и Традиционный→Упрощённый — оба первоклассны, и каждый работает с общим / тайваньским / гонконгским вариантами.
- Словари встроены в страницу. Полный словарь OpenCC поставляется в составе страницы — без сетевых запросов, поэтому инструмент работает офлайн, а текст никогда не покидает браузер.
- Безопасная отрисовка. Вывод строится контролируемыми DOM-API (никогда не
innerHTMLпользовательского текста), поэтому даже враждебный ввод не может внедрить разметку.
Разбор примера#
Начнём с 中国汉字转换, направление Упрощённый → Традиционный, регион Общий:
Ввод: 中国汉字转换
Вывод: 中國漢字轉換 (4 символа изменились: 国→國, 汉→漢, 转→轉, 换→換)
Теперь переключите регион на Тайвань и попробуйте 内存 («память»). Общий режим меняет только символы; тайваньский переписывает само слово:
Общий: 内存 → 內存 (посимвольно: 内→內)
Тайвань: 内存 → 記憶體 (переписывание фразы — слово, реально используемое на Тайване)
Тайваньский словарь переписывает несколько таких терминов — 软件 становится 軟體, информация 信息 — 資訊. Заметьте, что буквальный термин без тайваньского эквивалента остаётся только с посимвольной заменой: 计算机 превращается в 計算機 в любом регионе, поскольку региональные словари переписывают только слова с отчётливой местной формой.
Чтобы увидеть обратное направление, введите 繁體中文 с Традиционный → Упрощённый:
Ввод: 繁體中文
Вывод: 繁体中文 (1 символ изменился: 體→体)
Гонконг использует собственный словарь вариантов поверх посимвольного преобразования, отличный от тайваньского, поэтому один и тот же исходный текст в двух регионах может выходить слегка по-разному. Самый быстрый способ убедиться, какой словарь активен, — преобразовать региональный термин и сравнить.
FAQ#
В чём разница между общим, тайваньским и гонконгским?#
Общий делает посимвольную замену 1:1 без лексических изменений — подходит для имён, классических текстов или когда вы сами займётесь лексикой. Тайвань и Гонконг накладывают поверх региональные словари фраз, поэтому 内存→記憶體, 软件→軟體, 信息→資訊 в тайваньском режиме. Если ваша аудитория на Тайване или в Гонконге, всегда выбирайте соответствующий регион — иначе написание будет верным, но лексика будет звучать «по-материковому».
Выберет ли инструмент правильную традиционную форму для однозначных-многозначных (вроде 发 → 發/髮)?#
Для фразового ввода — обычно да, потому что региональные словари разрешают неоднозначность по окружающему контексту. Для изолированного неоднозначного символа без контекста ни один автоматический конвертер не может быть уверен — 发 само по себе действительно может быть любым из вариантов. Всегда вычитывайте подсвеченные символы в юридических, медицинских или публикуемых текстах.
Почему в выводе подсвечены некоторые символы?#
Подсветка отмечает каждый символ, изменившийся при преобразовании, чтобы сосредоточить вычитку на местах, реально подвергшихся сдвигу. Diff выравнивается на уровне кодовых точек, а для переписанных фраз (где длины ввода и вывода различаются) использует выравнивание по наибольшей общей подпоследовательности, чтобы подсвеченные участки оставались осмысленными, а не «размазывали» изменение по всей строке.
Какое направление выбрать, если текст смешанный?#
Выберите направление большинства. Конвертер не умеет автоматически определять написание — корректный авто-детект для смешанного текста требует больше контекста, чем даёт таблица символов. Если у вас традиционный документ с вклеенными упрощёнными цитатами, гоните Традиционный → Упрощённый; упрощённые цитаты просто пройдут без изменений.