목차▾
중국어 글자수 세기란?
중국어 글자수 세기는 간체자(简体)·번체자(繁體) 텍스트의 글자수와 바이트수를 실시간으로 계산합니다. 중국어는 글자 사이에 띄어쓰기가 없어, 분량을 셀 때는 대개 한자 개수(字数)를 기준으로 합니다.
모든 계산은 브라우저에서만 이뤄지며, 입력한 텍스트는 저장되지 않습니다.
간체·번체 바이트
간체자·번체자 모두 UTF-8에서 3바이트입니다. 형태만 다를 뿐 바이트 수는 같습니다.
"你好世界" → 4자, 12바이트
"我爱你" → 3자, 9바이트
"国 / 國" → 각각 1자, 3바이트 (간체·번체)
글자(字) vs 단어(词)
중국어 분량은 글자(字)와 단어(词) 두 단위로 나뉘지만, 실무에서는 대부분 글자수를 씁니다.
- 글자수(字数) — 한자 개수. 띄어쓰기가 없어 계산이 명확. HSK 작문·원고 기준
- 단어수(词数) — 「电脑」처럼 여러 글자가 한 단어. 형태소 분석이 필요해 일반 카운터로는 어려움
중국어 분량 기준
| 채널 | 한도 | 비고 |
|---|---|---|
| 웨이보(微博) | 140자~2,000자 | 기본 140 → 확장 |
| 트위터(X) | 약 140자 | CJK 2 가중치 |
| HSK 작문 | 글자수 기준 | 급수별 상이 |
바이트 계산 (GB·Big5 vs UTF-8)
옛 인코딩인 GB2312·GBK(간체)와 Big5(번체)는 한자를 2바이트로 저장했습니다. 현대 표준인 UTF-8은 3바이트입니다. 레거시 DB나 시스템에 넣을 때는 인코딩 기준을 확인해야 바이트 초과를 피할 수 있습니다.
중국어 자수 함정
전각 문장부호(,。!?) — 각각 1자, 3바이트. 반각 부호와 섞으면 바이트가 달라집니다.
병음 성조 기호(ā, í) — 라틴+성조 결합 문자라 대개 2바이트. 한자와 바이트 수가 다릅니다.
자주 묻는 질문
Q. 중국어 1글자는 몇 바이트인가요?
간체자(简体)·번체자(繁體) 모두 UTF-8에서 3바이트입니다. "国"(간체)과 "國"(번체)의 바이트 수는 같습니다. 옛 GB2312·Big5 인코딩에서는 한자가 2바이트였습니다.
Q. 간체자와 번체자는 글자수 계산이 다른가요?
아니요. 형태만 다를 뿐 둘 다 한 글자로 세고 UTF-8 3바이트를 차지합니다. 다만 한 단어를 이루는 글자 수는 다를 수 있습니다(예: 번체 「電腦」 2자 = 간체 「电脑」 2자).
Q. 중국어에서 글자(字)와 단어(词)는 어떻게 세나요?
중국어는 글자 사이에 띄어쓰기가 없어, 보통 한자 개수(字数)로 분량을 셉니다. 단어(词) 단위 계산은 형태소 분석이 필요해 일반 카운터로는 어렵습니다. HSK 작문 등도 대부분 글자수(字) 기준입니다.
Q. 웨이보(微博)의 글자 제한은 몇 자인가요?
웨이보 기본 게시글은 오랫동안 140자(汉字) 제한으로 유명했고, 이후 2,000자까지 확장되었습니다. 짧은 글 문화가 남아 있어 여전히 140자 안팎으로 쓰는 이용자가 많습니다.
Q. 중국어 문장부호도 글자수에 포함되나요?
네. 전각 문장부호(,。!?)는 각각 한 글자로 세고 UTF-8 3바이트를 차지합니다. 반각 부호(,.!?)와 섞어 쓰면 바이트가 달라지므로, 정식 중국어 문서는 전각 부호로 통일하는 것이 일반적입니다.
Q. 병음(pīnyīn) 성조 기호가 있는 글자는 어떻게 세나요?
성조가 붙은 병음 문자(ā, í, ǔ 같은)는 라틴 문자에 성조 부호가 결합한 형태로, UTF-8에서 2바이트인 경우가 많습니다. 한자(3바이트)와는 바이트 수가 다르니, 한자·병음을 섞을 때 바이트 계산에 유의하세요.
인코딩·플랫폼 기준은 시스템에 따라 다를 수 있으니, 바이트 제한을 만나면 어느 인코딩인지 먼저 확인하세요.