OCR Engine
문서를 읽는 것을 넘어
구조까지 이해합니다
비전·언어모델(VLM) 기반의 자체 문서 파싱 엔진입니다. 글자만 떼어내는 1세대 OCR과 달리, 시각적 레이아웃·텍스트 의미·문맥 관계를 한 번에 해석해 사람이 보는 그대로의 구조로 복원합니다. 종이와 스캔본에 갇혀 있던 문서가, 비로소 LLM이 읽고 근거로 쓸 수 있는 지식이 됩니다.
scan_등기부등본.pdfVLM 파싱 중
표제부· 토지의 표시
표시번호
접수
소재지번
지목
면적
1
(전 2)
(전 2)
1981년2월27일
서울특별시 구로구 시흥동 869-38
대
243㎡
2
서울특별시 금천구 시흥동 869-38
대
243㎡
표 구조 복원취소선·정정 인식오류 0건
끊김 없는 장문 파싱
긴 문서를 페이지로 쪼개지 않고 통째로
기존 OCR은 페이지 단위로 잘라 처리해, 페이지를 넘나드는 표·각주·참조 관계가 끊깁니다. 우리 엔진은 긴 문서를 한 번의 패스로 파싱해 문맥을 끝까지 유지합니다. 장문에서 흔한 반복·붕괴 없이 안정적으로 끝까지 읽습니다.
✓
페이지 간 맥락 유지: 표가 다음 장으로 이어져도 하나로 복원
✓
장문 안정성: 반복·루프 붕괴 없이 끝까지 일관
✓
검색 가능 데이터로 출력: 그대로 NEXUS 검색에 투입
페이지를 넘어가는 하나의 표
순위 등기목적 접수일
1소유권보존1998-03-12
2소유권이전2003-07-21
페이지 경계 · p.1 → p.2
3근저당권설정2009-05-04
4소유권이전2015-11-30
페이지 경계 · p.2 → p.3
5근저당권말소2021-02-18
페이지가 바뀌어도 표 헤더와 행이 하나로 이어집니다
읽어내는 문서 유형
1세대 OCR이 깨지던 모든 곳에서
필기체부터 셀 병합 표, 수식, 한자 고문서, 저조도 스캔까지. 실무에서 마주치는 까다로운 문서를 손상 없이 처리합니다.
서명 날인
필기체 · 서명
손글씨 메모·자필 진술·서명을 인식
표 · 병합셀
표 안의 표, 셀 병합까지 구조 보존
∑ ∫ √ x²
수식 · 기호
수식·통화·특수기호를 정확히 복원
契約 法
한자 · 고문서
국한문 혼용·옛 서식 문서를 인식
저조도 · 노이즈
저조도 · 흔들림
팩스 노이즈·기울어진 스캔도 보정
印도장
도장 · 직인
날인·직인 위치와 텍스트를 함께 인식
A4 · 2단 편집
복잡 레이아웃
다단·머리말·각주 등 편집 구조 분석
음성 · 녹취
음성 · 녹취
녹취 파일을 자동으로 텍스트화
인식 성능
숫자로 확인하는 정확도
공개 문서 인식 벤치마크 OmniDocBench로 직접 측정한 결과입니다. 한국어 문서에 맞춰 최적화한 엔진으로, 표·수식·읽기 순서 등 실무에서 까다로운 항목에서 특히 강합니다.
93점
종합 인식 정확도
94점
표 구조 복원
93점
수식 인식
최고수준
읽기 순서 정확도
* OmniDocBench 자체 측정 · 한국어 최적화 엔진 기준
정밀도 × 처리량
정확도와 속도,
둘 중 하나를 고르지 않습니다
높은 정밀도와 높은 처리량을 동시에 달성한 엔진입니다. 여기에 파라미터 조정만으로 동작점을 옮길 수 있어, 결과가 즉시 필요한 실시간 파싱부터 한 글자도 놓칠 수 없는 정밀 파싱까지 하나의 엔진으로 대응합니다.
✓
실시간 모드: 초저지연 응답으로 화면에서 바로 쓰는 파싱
✓
정밀 모드: 복잡한 표·수식·저품질 스캔까지 정교하게 복원
✓
대량 배치 처리: 수백만 페이지 규모 아카이브도 일정 품질로 소화
정밀도 · 처리 속도 분포
파라미터 조정으로 두 동작점 사이를 자유롭게 이동합니다
엔진 특장점
원본 그대로 검색 가능한 데이터로
멀티포맷 입력
PDF·이미지·스캔·HWP·음성을 형식 그대로 받습니다.
레이아웃 분석
제목·문단·표·도장·각주의 영역과 읽기 순서를 파악합니다.
통합 인식
텍스트·표·수식을 VLM으로 한 번에 해석해 구조를 복원합니다.
폐쇄망 내 처리
민감 문서를 외부로 내보내지 않고, 온프레미스·내부망 안에서 파싱합니다.
다국어 지원
국·영문 혼용과 다국어 문서를 하나의 엔진으로 처리합니다.
원문 출처 보존
추출 결과는 원문 위치와 연결되어, 답변마다 근거를 추적합니다.