Optical Character Recognition System Using The Document Form Identification

문서 양식 식별을 이용한 광학 문자 인식 시스템

  • 정원교 (고려대학교 정보경영공학부) ;
  • 박상성 (고려대학교 정보경영공학부) ;
  • 신영근 (고려대학교 정보경영공학부) ;
  • 안동규 (경민대학 인터넷비즈니스과) ;
  • 장동식 (고려대학교 정보경영공학부)
  • Published : 2008.06.30

Abstract

최근 들어 문서나 서류 등의 보관에 대한 중요성이 커짐에 따라 기존에 종이 형태로 관리하던 문서나 서류들을 편리하게 관리하기 위해 문서 전자화 시스템을 도입하고 있는 기업 및 기관들이 많아지고 있다. 과거에는 종이로 되어 있는 서류들을 전자화시키기 위해서 사람들이 해당 서류를 보고 컴퓨터에 데이터를 수작업으로 일일이 입력해야 하는 번거로움이 있었다. 현재는 이러한 번거로움을 줄이기 위해 문서나 서류를 스캔하고, 스캔한 이미지에서 광학문자 인식(OCR: Optical Character Recognition) 기술을 이용한 방법으로 종이 형태의 문서들을 전자화하고 있다. 그러나 OCR을 통해 문자 인식을 한 이후에도 인식된 전체 문서에서 필요한 부분과 필요하지 않은 부분을 일일이 수작업으로 분류해야 하는 번거로움이 있다는 것이 문제점으로 부각되고 있다. 본 논문에서는 이와 같은 문제점을 해결하기 위해 문서 양식과 인식이 필요한 부분을 미리 지정해 놓고 문자 인식을 하는 방법 및 시스템을 제안한다. 제안된 시스템은 문자 인식 속도를 향상시키고 보다 정확한 문자 인식이 가능하게 하여, 전체적으로 문자 인식의 효율을 향상시킬 수 있을 것이다. 또한 대량의 정형화된 문서의 문자 인식에도 효과적일 것으로 기대한다.

Keywords