Инструменты
Руководства

Конвертер китайских иероглифов в пиньинь

Конвертация

Преобразует китайские иероглифы (ханьцзы) в пиньинь сразу в трёх формах — знаки тона, цифры тонов и без тонов. Распознаёт многозначные иероглифы и поддерживает режим фамилии.

100 % на клиенте Без бэкенда
Ввод
Вывод
Знаки тона
Цифры тонов
Без тонов
Кандидаты многозначных иероглифов
Введите китайские иероглифы для преобразования.
На этой странице

Что такое пиньинь?#

Пиньинь — официальная система записи звуков путунхуа (мандаринского китайского) латинским алфавитом. Каждый китайский иероглиф (ханьцзы) отображается в один слог, который записывается инициалом (согласным), финалом (группой гласных) и тоном — одним из четырёх контуров высоты (плюс нейтральный тон), меняющих смысл. mā (мама), má (конопля), mǎ (лошадь) и mà (ругать) — четыре совершенно разных слова, различающихся только тоном.

Конвертер ханьцзы в пиньинь берёт китайский текст и выдаёт его фонетическую транскрипцию. Трудность не в самом написании, а в устранении неоднозначности. Многие иероглифы — многозначные (多音字): один иероглиф читается по-разному в зависимости от слова, в которое входит. 重 — это zhòng в 重要 (важный), но chóng в 重庆 (Чунцин, «двойной праздник»). Наивный словарный поиск делает такие случаи неправильно; этот инструмент прогоняет каждый иероглиф через контекстно-зависимый движок и дополнительно отмечает каждый найденный многозначный иероглиф, поэтому все кандидаты видны с одного взгляда.

Эта страница отрисовывает сразу три нотации тонов — знаки тона (nǐ hǎo), цифры тонов (ni3 hao3) и без тонов (ni hao) — поэтому, какой бы формат ни ждала ваша нижележащая система (карточки, субтитры, поисковые индексы, романизированные имена файлов), вы можете скопировать его напрямую, без двойного преобразования.

Как пользоваться#

  1. Вставьте китайский текст в поле Ввод слева. Любой ханьцзы (упрощённый или традиционный) преобразуется; латинские буквы, цифры, знаки препинания и пробелы проходят нетронутыми, поэтому можно свободно смешивать Hello 你好 123.
  2. Правая панель заполняется тремя строками: Знаки тона (знаки над гласными), Цифры (завершающие цифры 1–4) и Без тонов. Используйте кнопку Копировать рядом с каждой строкой.
  3. Отметьте Режим фамилии, если первые символы — это фамилия. Это важно, потому что у некоторых фамилий нестандартное чтение: 单 обычно читается dān, но как фамилия — Shàn; 区 обычно qū, но как фамилия — Ōu.
  4. Таблица многозначных иероглифов перечисляет каждый иероглиф вашего ввода, у которого есть больше одного возможного чтения, со всеми кандидатами в форме со знаками тона. Удобно для проверки неоднозначных иероглифов.
  5. Копировать всё забирает сразу все три режима тонов; Пример загружает демо; Очистить опустошает ввод.

Ключевые возможности#

  • Три режима тонов за один проход. Знаки / цифры / без тонов вычисляются вместе одним вызовом движка, поэтому три строки всегда согласованы — нет риска, что цифры не соответствуют знакам.
  • Обнаружение многозначных иероглифов (多音字). Каждый ханьцзы повторно опрашивается на все его чтения; любой иероглиф с более чем одним чтением выводится со всеми кандидатами, поэтому можно убедиться, что движок выбрал правильный для вашего контекста.
  • Режим фамилии. Включает фамильно-ориентированный путь движка для первых символов, исправляя имена вроде 单 (Shàn), 区 (Ōu), 解 (Xiè), 朴 (Piáo), которые наивный поиск делает неверно.
  • Безопасный подсчёт суррогатов. Счётчик символов идёт по кодовым точкам Unicode, а не по UTF-16 единицам, поэтому редкие идеографы Extension-B (4-байтовые) считаются правильно.
  • Словарь встроен в страницу. CJK-словарь поставляется в составе страницы — никакого сетевого запроса, никакого API-ключа, ничего не покидает ваш браузер.

Разбор примера#

Введите 你好世界 («привет, мир»):

Знаки:      nǐ hǎo shì jiè
Цифры:      ni3 hao3 shi4 jie4
Без тонов:  ni hao shi jie
Многозначн.: 好 → hǎo / hào

Таблица многозначных уже отмечает 好 с двумя чтениями (hǎo «хороший» и hào «любить»). Здесь движок правильно выбрал hǎo по контексту — таблица нужна, чтобы показать альтернативы и позволить изменить выбор в необычном контексте.

Теперь попробуйте 重庆 (город Чунцин). Здесь движок читает 重 как chóng, а не более частое zhòng:

Знаки:      chóng qìng
Цифры:      chong2 qing4
Без тонов:  chong qing
Многозначн.: 重 → chóng / zhòng

Чтобы увидеть режим фамилии в действии, введите 单先生 («господин Шань»). С неотмеченной галочкой движок читает 单 как обычное dān; отметьте Режим фамилии — и оно переключается на фамильное shàn:

Режим фамилии выкл.:  dān xiān shēng
Режим фамилии вкл.:   shàn xiān shēng

FAQ#

Почему один иероглиф иногда имеет два чтения?#

Потому что это многозначный иероглиф (多音字) — одна письменная форма, несколько устных форм, выбираемых по слову, в которое он входит. 的 читается четырьмя способами: de (притяжательное 的), dí (的确 «действительно»), dì (目的 «цель»), dī (的士 «такси»). Движок выбирает наиболее вероятное чтение по окружающему контексту, а таблица многозначных показывает альтернативы, чтобы вы могли её переопределить в необычном контексте.

Какой формат тонов мне выбрать?#

Зависит от того, куда пойдёт текст. Знаки тонов подходят для отображения людям и для всего, что будут читать изучающие. Цифры тонов ожидают старые поисковые системы, некоторые форматы импорта карточек и код сортировки пиньиня. Без тонов подходит там, где тон не важен, — романизированные имена файлов, URL-слаги, грубый фонетический индекс. Эта страница даёт все три, чтобы не пришлось конвертировать дважды.

Поддерживается кантонский или другие диалекты?#

Нет — этот инструмент транскрибирует только пиньинь путунхуа (мандаринского). Кантонский jyutping, тайваньский бопомофо (чжуинь) и другие романизации — отдельные системы со своими словарями. Если вам нужно переключить текст между упрощённым и традиционным написанием, а не звучанием, используйте конвертер упрощённого ↔ традиционного.

Что именно считает счётчик символов?#

Он считает кодовые точки ханьцзы — китайские идеографы, — а не байты или UTF-16 единицы, и корректно обрабатывает 4-байтовые символы дополнительных плоскостей. 你好 считается как 2, и пара редких символов Extension-B тоже считается как 2, тогда как JavaScript string.length выдал бы 4. Знаки препинания и латиница в вашем вводе счётчиком игнорируются.