Конвертер Unicode
Проверяет кодовые точки Unicode, байтовые последовательности UTF-8 и категории символов для любого текста.
Текст → Unicode-информация
Поиск по кодовой точке
Об этом инструменте
Unicode-конвертер анализирует любой текст и возвращает кодовую точку Unicode (U+XXXX), последовательность байтов UTF-8 и категорию для каждого символа.
UTF-8 — кодировка переменной длины: ASCII (U+0000–U+007F) занимает 1 байт, U+0080–U+07FF — 2 байта, U+0800–U+FFFF (CJK, арабский, хангыль) — 3 байта, U+10000+ (большинство эмодзи) — 4 байта.
Как использовать
- Введите или вставьте текст в поле анализа и нажмите «Анализировать».
- Таблица показывает символ, кодовую точку, байты UTF-8 и категорию для каждого символа.
- Для поиска конкретного символа введите его кодовую точку (например, U+1F600) в поле поиска.
- Нажмите «Найти», чтобы увидеть символ и подробности кодирования.
Случаи использования
Разработчики отлаживают проблемы кодировки символов в строках. Веб-разработчики проверяют правильность кодировки спецсимволов. Исследователи безопасности анализируют Unicode-символы в гомографических атаках.
Частые вопросы
- Что такое кодовая точка Unicode? — Уникальный номер, присвоенный каждому символу стандарта Unicode, записывается как U+XXXX в шестнадцатеричном формате (например, U+0041 = 'A').
- Что такое UTF-8? — Кодировка переменной длины, представляющая кодовые точки Unicode как 1–4 байта. Это доминирующая кодировка в веб.
- Почему эмодзи занимают 4 байта в UTF-8? — Эмодзи находятся в дополнительной многоязычной плоскости Unicode (U+10000+), для которой требуется 4 байта в UTF-8.