목차▾
PDF OCR 변환이 필요한 경우
PDF 화면에는 글자가 보이는데 마우스로 드래그하거나 검색할 수 없다면 페이지가 이미지로 스캔된 PDF일 가능성이 큽니다. OCR(광학 문자 인식)은 이미지 속 글자 위치를 찾아 텍스트 레이어를 추가합니다.
결과 PDF는 원본 페이지 이미지를 보여주면서 글자 검색·선택·복사를 지원합니다. 번역기에 넣기 전, 오래된 문서를 검색하기 전, 스캔 계약서에서 문구를 찾기 전에 사용할 수 있습니다. OCR이 문장을 새로 인식하므로 중요한 숫자와 고유명사는 원본과 대조해야 합니다.
스캔 PDF OCR 사용 방법
- 스캔 PDF를 선택하고 OCR이 필요한 페이지만 체크합니다.
- 문서에 맞게 한국어+영어, 한국어 또는 영어를 고릅니다.
- 일반 문서는 표준, 작은 글자가 많으면 정밀 품질을 선택합니다.
- OCR 변환을 실행하고 페이지별 진행 상태를 기다립니다.
- 인식 텍스트를 확인한 뒤 검색 가능한 PDF 또는 TXT를 다운로드합니다.
텍스트 PDF와 스캔 PDF 차이
| 구분 | 텍스트 PDF | 스캔 PDF |
|---|---|---|
| 글자 드래그·검색 | 바로 가능 | OCR 전에는 불가 |
| 권장 도구 | PDF 텍스트 추출 | PDF OCR 변환 |
| 정확도 | 원래 텍스트를 읽어 높음 | 이미지를 새로 인식해 검수 필요 |
| 처리 시간 | 짧음 | 페이지·해상도에 따라 길어짐 |
글자가 이미 선택된다면 PDF 텍스트 추출을 사용하세요. 스캔 표를 Excel에서 다시 계산하려면 먼저 OCR 결과를 검수한 뒤 PDF 엑셀 변환의 지원 범위를 확인해야 합니다.
한글 OCR 정확도를 높이는 법
- 휴대폰으로 찍은 사진을 그대로 PDF로 만든 파일은 인식률이 크게 떨어집니다. 기울기·그림자·흐림이 겹치면 문장 대부분이 틀리게 인식될 수 있습니다. 스캐너나 문서 스캔 앱(모서리 보정·흑백 처리)으로 만든 PDF를 사용하세요.
- 페이지가 90도 돌아갔다면 먼저 방향을 바로잡습니다.
- 글자가 작거나 흐리면 정밀 품질을 선택합니다.
- 한국어 문장에 영문·숫자가 섞였다면 한국어+영어를 선택합니다.
- 그림자·구김·도장·밑줄이 글자와 겹치면 인식 오류를 예상합니다.
- 금액·날짜·계약 번호·이름은 반드시 원본과 대조합니다.
방향이 틀린 문서는 PDF 회전으로 먼저 수정하세요. 30페이지가 넘는 문서는 PDF 분할로 필요한 범위만 나누면 처리 시간과 메모리 사용을 줄일 수 있습니다.
브라우저 처리와 언어 모델
이 도구는 PDF.js로 페이지를 이미지화하고 Tesseract.js로 글자를 인식한 뒤 pdf-lib으로 페이지를 다시 묶습니다. 선택한 PDF와 인식 텍스트는 변환 서버로 보내지 않습니다. 다만 OCR 실행 코드와 한국어·영어 모델을 내려받기 위해 최초 실행 시 외부 네트워크 요청이 발생합니다.
언어 모델은 브라우저에 캐시될 수 있어 다음 실행이 빨라질 수 있습니다. OCR은 기기의 CPU와 메모리를 사용하므로 모바일이나 오래된 PC에서는 페이지를 나누어 처리하는 편이 안정적입니다. 결과 PDF가 커졌다면 PDF 용량 줄이기를 이어서 사용하세요.
자주 묻는 질문
OCR 변환을 하면 무엇이 달라지나요?▾
사진처럼 보이기만 하던 스캔 PDF에 글자 위치를 나타내는 텍스트 레이어가 추가됩니다. 결과 PDF에서 단어 검색, 글자 드래그와 복사가 가능해지며 원본 페이지 이미지는 그대로 보입니다.
한글도 인식할 수 있나요?▾
한국어 또는 한국어+영어를 선택할 수 있습니다. 인쇄체는 비교적 잘 인식하지만 흐린 스캔, 작은 글자, 복잡한 표, 도장과 겹친 글자, 손글씨는 오류가 생길 수 있으므로 결과를 반드시 확인하세요.
PDF 파일이 서버로 업로드되나요?▾
PDF 페이지 렌더링과 OCR 처리는 현재 브라우저에서 수행됩니다. 선택한 파일과 인식 결과는 변환 서버로 전송하지 않습니다. 다만 최초 실행 시 OCR 엔진과 선택한 언어 모델을 내려받기 위한 인터넷 연결이 필요합니다.
왜 처음 실행할 때 시간이 더 걸리나요?▾
브라우저가 OCR 엔진과 한국어·영어 언어 모델을 처음 내려받고 준비하기 때문입니다. 이후에는 브라우저 캐시를 활용할 수 있지만 캐시 삭제, 시크릿 모드, 기기 변경 시 다시 받을 수 있습니다.
텍스트 PDF도 OCR 해야 하나요?▾
이미 글자를 드래그하고 검색할 수 있다면 OCR이 필요 없습니다. 이 경우 PDF 텍스트 추출 도구를 쓰는 편이 더 빠르고 정확합니다. OCR은 글자가 이미지로 들어간 스캔 PDF에 사용하세요.
결과 PDF 용량이 커질 수 있나요?▾
네. 선택한 페이지를 표준 또는 정밀 해상도의 이미지로 다시 구성하므로 원본보다 커질 수 있습니다. 필요한 페이지만 처리하고, 결과가 크면 PDF 용량 줄이기를 이어서 사용하세요.
손글씨나 표도 정확히 변환되나요?▾
이 도구는 인쇄된 문장의 검색·복사를 위한 범용 OCR입니다. 손글씨 전문 인식이나 표의 행·열 구조 복원은 제공하지 않습니다. 표를 엑셀 형태로 다시 만들려면 결과를 검수한 뒤 별도 표 추출 과정이 필요합니다.
OCR 신뢰도는 참고값이며 문서의 법적·회계적 정확성을 보장하지 않습니다. 중요한 문서는 원본 PDF를 보관하고, 다운로드한 결과에서 이름·금액·날짜·계약 번호를 직접 확인하세요.