TL
툴랩
💰후원하기
💰후원하기

유니코드 변환기

텍스트의 유니코드 코드 포인트, UTF-8 바이트 시퀀스, 문자 카테고리를 확인합니다.

텍스트 → 유니코드 정보
코드 포인트 조회

이 도구 소개

유니코드 변환기는 텍스트의 각 문자에 대해 유니코드 코드 포인트(U+XXXX), UTF-8 바이트 시퀀스, 문자 카테고리를 분석합니다.

UTF-8은 가변 폭 인코딩입니다. ASCII(U+0000-U+007F)는 1바이트, U+0080-U+07FF는 2바이트, U+0800-U+FFFF(CJK, 아랍어, 한글)는 3바이트, U+10000+(이모지 포함)는 4바이트를 사용합니다.

사용 방법

  1. 텍스트 분석 필드에 텍스트를 입력하고 분석 버튼을 클릭합니다.
  2. 표에서 각 문자의 코드 포인트, UTF-8 바이트, 카테고리를 확인합니다.
  3. 특정 문자를 조회하려면 코드 포인트 조회 필드에 코드 포인트(예: U+1F600)를 입력합니다.
  4. 조회 버튼을 클릭하면 해당 문자와 인코딩 정보가 표시됩니다.

활용 사례

개발자는 예상치 못한 기호나 손상된 텍스트의 문자 인코딩 문제를 디버깅합니다. 국제화 엔지니어는 CJK 및 RTL 문자의 코드 포인트를 확인합니다. 보안 연구자는 호모그래프 공격에 사용되는 유니코드 문자를 분석합니다.

자주 묻는 질문

  • 유니코드 코드 포인트란 무엇인가요?유니코드 표준에서 모든 문자에 부여된 고유 번호로, 16진수로 U+XXXX 형식으로 표기됩니다(예: U+0041 = 'A').
  • UTF-8이란 무엇인가요?유니코드 코드 포인트를 1~4바이트로 나타내는 가변 폭 문자 인코딩으로, 웹에서 가장 널리 쓰입니다.
  • 이모지가 UTF-8에서 4바이트를 차지하는 이유는 무엇인가요?이모지는 유니코드 보조 다국어 평면(U+10000+)에 속하며, UTF-8 인코딩에서 4바이트가 필요합니다.