시험 다음 날, 지난 모의고사 해설지를 한글 파일로 만들어야 할 때. 학생들이 낸 서술형 답안지 수백 장을 채점 전에 정리해야 할 때. 우리는 늘 같은 벽에 부딪힙니다. 찍고 스캔하는 데는 1분이면 충분한데, 그 안의 내용을 다시 쓸 수 있는 형태로 꺼내는 일은 몇 시간짜리 노동이 됩니다.
그래서 검색창에는 '시험지 스캔', '시험지 OCR', '답안지 OCR' 같은 검색어가 꾸준히 입력되고, 최근에는 눈에 띄게 늘고 있습니다. 다만 정답은 하나가 아닙니다. 만들려는 것이 편집 가능한 문제지인지, 채점에 쓸 답안 데이터인지, 처리량이 개인 단위인지 기관 단위인지에 따라 맞는 방법이 달라집니다. 이 글에서는 실무에서 쓰는 세 가지 경로를 짚고, 내 상황에 맞는 방법을 고르는 기준까지 정리합니다.
이런 고민이라면 이 글이 도움이 됩니다
같은 '시험지 스캔'을 검색해도 필요는 제각각입니다. 매주 문제지와 교재를 만드는 학원 강사와 조교, 수식 많은 시험지 PDF를 한글 파일로 바꾸려는 분, 서술형 답안지를 데이터로 만들어 채점을 자동화하려는 학교와 교육기관 담당자, 그리고 손글씨 인식을 자체 서비스에 연동하려는 에듀테크 개발자까지 다양합니다. 그래서 이 글은 방법을 나열하기 전에, 상황별로 무엇이 맞는지부터 정리합니다.
핵심 요약
시험지 OCR은 스캔한 시험지의 글자를 읽는 데서 끝나지 않고, 수식·표·그림·손글씨까지 구조를 복원해야 완성됩니다.
문제지 제작이 목적이라면 교육 특화 서비스가, 가벼운 텍스트 복사라면 범용 도구가 먼저입니다.
답안 채점·대량 처리·개인정보 보안·시스템 연동이 필요해지는 지점부터 문서 AI 엔진 방식의 가치가 커집니다.
손글씨 답안은 '틀린 것을 틀린 그대로' 읽어야 하므로, 자동 보정하는 일반 OCR과는 요구 조건이 다릅니다.
내 상황에 맞는 방법 먼저 확인하기
내 상황 | 먼저 고려할 방법 |
|---|---|
시험지 PDF를 편집 가능한 한글 문제지로 | 교육 특화 서비스 |
인쇄체 텍스트 몇 개만 급히 복사 | 범용 무료 도구 |
손글씨 답안을 데이터로 만들어 채점에 활용 | 문서 AI 엔진 (손글씨 특화) |
답안지 수백~수천 장 대량 처리 | 문서 AI 기반 자동화 |
학생 개인정보 때문에 외부 업로드 불가 | On-Premise 문서 AI |
자체 시스템·LMS·문항 DB 연동 | 문서 AI + API |
시험지 OCR이란 무엇인가요?
OCR(Optical Character Recognition, 광학 문자 인식)은 이미지 속 글자를 컴퓨터가 읽을 수 있는 텍스트로 바꾸는 기술입니다. 다만 시험지는 글자만 읽어서는 절반도 해결되지 않습니다. 시험지를 온전히 데이터로 만들려면 세 단계가 필요합니다.
먼저 인식이 인쇄된 글자와 손으로 쓴 글자를 텍스트로 읽어냅니다. 다음으로 구조화가 문제 번호와 보기의 경계, 표의 칸, 수식의 기호 구조 같은 문서의 짜임새를 복원합니다. 마지막으로 출력이 그 결과를 한글(HWP)·엑셀, 또는 시스템이 읽는 JSON으로 내보냅니다. 최근에는 이 흐름 전체를 OCR보다 넓은 의미의 문서 AI(Document AI)라고 부릅니다. 기본 개념은 OCR이란? 강력해진 문자인식 기술 글에 정리해 두었습니다.
왜 시험지는 유독 어려울까요?
일반 OCR 도구에 시험지를 넣으면 결과가 무너지는 지점이 대체로 네 곳입니다. 수식은 분수·루트·첨자의 구조가 수식 편집기 문법으로 변환되어야 편집이 가능하고, 표는 병합된 칸의 선 구조를 읽지 못하면 내용이 섞이며, 그림과 그래프는 텍스트가 아니므로 별도 복원이 필요합니다. 그리고 손글씨, 특히 학생이 답안지에 쓴 글씨는 인쇄체와 완전히 다른 문제라 아래에서 따로 다룹니다.
"무료 OCR에 넣어봤는데 엉망으로 나왔다"는 경험담은 도구가 나빠서가 아니라, 시험지가 문서 중에서도 가장 어려운 축에 속하기 때문입니다.
아래와 같은 경우가 OCR이 실패하는 지점입니다.
방법 1. 교육 특화 서비스: 문제지 제작이라면 여기서 시작
문제지와 교재를 만드는 강사라면 이 길이 정답에 가깝습니다. 예를 들어 일타조교(마이일타)는 스캔한 시험지 PDF를 올리면 수식과 병합 표까지 타이핑된 편집 가능한 한글(HWPX) 파일로 돌려주는 서비스로, 문제·해설의 분할과 매칭, 저화질 그림 복원까지 교재 제작 워크플로 전체를 웹에서 처리합니다. 출시 200여 일 만에 강사 1,900명 이상이 사용하고 있다는 사실 자체가, 이 노동이 얼마나 보편적인 고통이었는지 보여줍니다. 매주 교재를 만드는 개인 강사나 소규모 학원이라면 이런 완성형 서비스를 먼저 검토하는 것이 합리적입니다.
방법 2. 범용 무료 도구: 인쇄체 소량이라면 충분
스마트폰 스캔 앱이나 포털 OCR은 인쇄체 위주의 짧은 텍스트를 급하게 복사할 때 충분합니다. 다만 위의 네 가지 어려움, 즉 수식·표·그림·손글씨 앞에서는 한계가 분명합니다. 시험지라는 용도에는 보조 수단으로 보는 것이 맞습니다.
방법 3. 문서 AI 엔진: 답안 데이터화·대량·보안·연동이 필요할 때
앞의 두 방법이 벽에 부딪히는 지점에서 등장하는 선택지가 문서 AI 엔진입니다. 완성된 앱이 아니라 인식 능력 그 자체를 API나 구축형(온프레미스)으로 제공하는 방식입니다. 이 길이 필요한 순간은 명확합니다. 처리량이 개인 단위를 넘어설 때, 결과를 한글 파일이 아니라 채점 시스템·LMS·문항 DB 같은 자체 시스템으로 받아야 할 때, 그리고 학생 개인정보가 담긴 답안지를 외부 서버에 올릴 수 없어 기관 내부에 설치해야 할 때입니다.
세 가지 방법 한눈에 비교
구분 | 교육 특화 서비스 | 범용 무료 도구 | 문서 AI 엔진 |
|---|---|---|---|
잘 맞는 상황 | 문제지·교재 제작 | 인쇄체 소량 복사 | 답안 데이터화·대량·보안 |
출력 형태 | 한글(HWPX) 문제집 | 텍스트 | JSON·시스템 연동 |
손글씨 답안 | 대상 아님 | 어려움 | 특화 엔진으로 가능 |
개인정보 보안 | 외부 업로드 | 외부 업로드 | On-Premise 가능 |
적합한 사람 | 강사·조교 | 개인 | 기관·에듀테크 개발팀 |
손글씨 답안은 왜 완전히 다른 문제일까요?
여기까지가 문제지, 즉 인쇄물 이야기였습니다. 그런데 교육 현장에서 시험지 스캔의 다음 질문은 반드시 이것으로 이어집니다. "학생이 쓴 답안지도 읽을 수 있나요?"
손글씨 답안 인식은 인쇄체와 난이도의 차원이 다릅니다. 글씨체가 학생마다 다르고, 흘려 쓰고, 지우고 고친 흔적이 있으며, 맞춤법이 틀린 채로 적혀 있기 때문입니다. 여기에 교육 평가만의 요구가 하나 더 붙습니다. 틀린 것을 틀린 그대로 읽어야 한다는 것입니다.
일반 OCR은 인식이 애매하면 문맥상 그럴듯한 단어로 보정하는 경향이 있습니다. 일상 문서라면 친절한 기능이지만 채점에서는 치명적입니다. 학생이 '빛의 굴졀'이라고 썼다면 그것은 '굴절'로 교정되어서는 안 됩니다. 그 오답이 채점의 근거이기 때문입니다. 그래서 서술형 자동 채점을 준비한다면, 채점 AI 이전에 그 입력 구간, 즉 손글씨를 보정 없이 원문 그대로 텍스트화하는 인식 엔진의 정확도부터 검증해야 합니다. 채점의 병목은 채점 로직이 아니라 입력 데이터의 품질에서 먼저 생깁니다.
도입 전 확인할 기준
문서 AI 방식을 검토한다면 다음을 미리 정리해 두면 판단이 빨라집니다. 답안지의 월 처리량, 손글씨와 인쇄체의 비중, 필요한 결과 형식(텍스트·JSON·채점 시스템 연동), 개인정보 처리 방침에 따른 배포 방식(클라우드·온프레미스), 그리고 무엇보다 실제 답안 샘플로 인식률을 직접 검증하는 절차입니다. 벤더가 제시하는 수치보다 내 데이터로 확인한 수치가 판단 기준이 되어야 합니다. 검증 절차의 설계는 AI PoC 검증 기준과 도입 체크리스트 글을 참고하실 수 있습니다.
한국딥러닝은 문서 업무를 대신하는 3 Zero AI Worker를 만듭니다
시험지와 답안을 읽는 것만으로 업무가 끝나지는 않습니다. 읽은 결과를 검증하고, 애매한 건을 골라내고, 시스템에 넣는 과정이 남습니다. 한국딥러닝은 이 과정 전체를 하나로 봅니다.
DEEP OCR이 스캔·이미지 문서의 문자를 읽고 — 한국어 손글씨를 자동 보정 없이 작성된 그대로 인식합니다 — DEEP Parser가 표와 문서 구조를 데이터로 정리하며, DEEP Agent가 추출부터 검증과 예외 분기, 시스템 연동까지 하나의 흐름으로 잇습니다. 이 기술은 공공·금융 등 대량 문서 현장에 도입되어 왔고, OCRBench v2 영어 부문 1위를 기록했습니다. 도입은 대개 기존 양식을 바꾸지 않고 평균 2주 안에 이뤄지며, 학생 개인정보가 걸린 환경을 위한 온프레미스 구축을 지원합니다.
자주 묻는 질문
Q1. 시험지 스캔은 어떤 장비로 해야 하나요?
일반 복합기 스캔이나 스마트폰 촬영으로 시작할 수 있습니다. 장비보다 해상도와 조명이 중요합니다. 300dpi 이상, 그림자 없는 평면 촬영이면 인식 엔진 대부분이 처리할 수 있는 품질이 됩니다.
Q2. 수식이 있는 시험지도 OCR이 되나요?
됩니다. 다만 일반 텍스트 OCR이 아니라 수식 인식을 지원하는 도구여야 하고, 편집 가능한 수식 문법으로 출력되는지 확인해야 합니다.
Q3. 손글씨 답안 인식의 정확도는 어느 정도인가요?
글씨 상태와 과목에 따라 편차가 큽니다. 그래서 도입 전에 실제 답안 샘플로 인식률을 직접 검증하는 절차가 표준입니다.
Q4. 학생 답안지를 외부 서비스에 올려도 되나요?
답안지에는 이름·학번 같은 개인정보가 포함되는 경우가 많아 기관 정책 확인이 먼저입니다. 외부 업로드가 불가한 기관은 내부 서버에 설치하는 온프레미스 방식을 검토합니다.
Q5. 시험지를 한글(HWP) 파일로 바로 받을 수 있나요?
교육 특화 서비스들이 그 출력에 최적화되어 있습니다. 반면 채점 시스템이나 DB 연동이 목적이라면 HWP가 아니라 구조화 데이터(JSON)로 받는 API 방식이 맞습니다.
정리
시험지 OCR에 하나의 정답은 없습니다. 문제지 제작이라면 교육 특화 서비스로, 인쇄체 소량이라면 범용 도구로 시작할 수 있습니다. 손글씨 답안을 데이터로 만들어야 하고, 양이 많아지며, 개인정보와 시스템 연동까지 걸려 있다면 그때부터 문서 AI 엔진 방식의 가치가 커집니다. 내 상황을 먼저 짚고, 필요하다면 실제 답안으로 결과를 확인해 보시길 권합니다.
내 시험지와 답안으로 인식 결과 확인하기
손글씨가 깨지지 않고 읽히는지 확인하는 가장 빠른 방법은 실제로 넣어 보는 것입니다. 시험지와 답안 샘플로 교육 문서 기준의 인식 결과를 확인해 보세요. 샘플 검증 문의하기