목차▾
중국어 글자수 세기란?
중국어 글자수 세기는 간체자(简体)·번체자(繁體) 텍스트의 글자수와 바이트수를 실시간으로 계산합니다. 중국어는 글자 사이에 띄어쓰기가 없어, 분량을 셀 때는 대개 한자 개수(字数)를 기준으로 합니다.
모든 계산은 브라우저에서만 이뤄지며, 입력한 텍스트는 저장되지 않습니다.
간체·번체 바이트
간체자·번체자 모두 UTF-8에서 3바이트입니다. 형태만 다를 뿐 바이트 수는 같습니다.
"你好世界" → 4자, 12바이트
"我爱你" → 3자, 9바이트
"国 / 國" → 각각 1자, 3바이트 (간체·번체)
글자(字) vs 단어(词)
중국어 분량은 글자(字)와 단어(词) 두 단위로 나뉘지만, 실무에서는 대부분 글자수를 씁니다.
- 글자수(字数) — 한자 개수. 띄어쓰기가 없어 계산이 명확. HSK 작문·원고 기준
- 단어수(词数) — 「电脑」처럼 여러 글자가 한 단어. 형태소 분석이 필요해 일반 카운터로는 어려움
중국어 분량 기준
| 채널 | 한도 | 비고 |
|---|---|---|
| 웨이보(微博) | 140자~2,000자 | 기본 140 → 확장 |
| 트위터(X) | 약 140자 | CJK 2 가중치 |
| HSK 작문 | 글자수 기준 | 급수별 상이 |
바이트 계산 (GB·Big5 vs UTF-8)
옛 인코딩인 GB2312·GBK(간체)와 Big5(번체)는 한자를 2바이트로 저장했습니다. 현대 표준인 UTF-8은 3바이트입니다. 레거시 DB나 시스템에 넣을 때는 인코딩 기준을 확인해야 바이트 초과를 피할 수 있습니다.
중국어 자수 함정
전각 문장부호(,。!?) — 각각 1자, 3바이트. 반각 부호와 섞으면 바이트가 달라집니다.
병음 성조 기호(ā, í) — 라틴+성조 결합 문자라 대개 2바이트. 한자와 바이트 수가 다릅니다.
자주 묻는 질문
중국어 1글자는 몇 바이트인가요?▾
간체자(简体)·번체자(繁體) 모두 UTF-8에서 3바이트입니다. "国"(간체)과 "國"(번체)의 바이트 수는 같습니다. 옛 GB2312·Big5 인코딩에서는 한자가 2바이트였습니다.
간체자와 번체자는 글자수 계산이 다른가요?▾
아니요. 형태만 다를 뿐 둘 다 한 글자로 세고 UTF-8 3바이트를 차지합니다. 다만 한 단어를 이루는 글자 수는 다를 수 있습니다(예: 번체 「電腦」 2자 = 간체 「电脑」 2자).
중국어에서 글자(字)와 단어(词)는 어떻게 세나요?▾
중국어는 글자 사이에 띄어쓰기가 없어, 보통 한자 개수(字数)로 분량을 셉니다. 단어(词) 단위 계산은 형태소 분석이 필요해 일반 카운터로는 어렵습니다. HSK 작문 등도 대부분 글자수(字) 기준입니다.
웨이보(微博)의 글자 제한은 몇 자인가요?▾
웨이보 기본 게시글은 오랫동안 140자(汉字) 제한으로 유명했고, 이후 2,000자까지 확장되었습니다. 짧은 글 문화가 남아 있어 여전히 140자 안팎으로 쓰는 이용자가 많습니다.
중국어 문장부호도 글자수에 포함되나요?▾
네. 전각 문장부호(,。!?)는 각각 한 글자로 세고 UTF-8 3바이트를 차지합니다. 반각 부호(,.!?)와 섞어 쓰면 바이트가 달라지므로, 정식 중국어 문서는 전각 부호로 통일하는 것이 일반적입니다.
병음(pīnyīn) 성조 기호가 있는 글자는 어떻게 세나요?▾
성조가 붙은 병음 문자(ā, í, ǔ 같은)는 라틴 문자에 성조 부호가 결합한 형태로, UTF-8에서 2바이트인 경우가 많습니다. 한자(3바이트)와는 바이트 수가 다르니, 한자·병음을 섞을 때 바이트 계산에 유의하세요.
인코딩·플랫폼 기준은 시스템에 따라 다를 수 있으니, 바이트 제한을 만나면 어느 인코딩인지 먼저 확인하세요.