A Web Crawler using Hyperlink Structure and Hypertext Categorization Method

Hyperlink구조와 Hypertext 분류방법을 이용한 Web Crawler

  • Lee, Dong-Won (School of Engineering Information and Communications University) ;
  • Hyun, Soon-J. (School of Engineering Information and Communications University)
  • 이동원 (한국정보통신대학교 공학부) ;
  • 현순주 (한국정보통신대학교 공학부)
  • Published : 2002.04.12

Abstract

웹 정보검색에서 웹 문서를 수집하고, 색인을 구축하는 작업에서 Web Crawler 의 역할은 매우 중요하다. 그러나, 웹 문서의 급속한 증가로 인하여 Web Crawler 가 모든 웹 문서를 수집하는 것은 불가능하며, 웹 정보검색의 정확성을 증가시키기 위한 방법으로 특정한 영역의 문서를 수집하는 focused web crawler에 대한 연구가 활발히 진행되어 왔다. 이와 함께, 웹 문서의 link구조를 이용하여 문서의 집합에서 중요한 문서를 찾는 연구들이 많이 진행되었다. 그러나, 기존의 연구에서는 문서의 link 구조에만 초점이 맞추어져 있으며, hypertext 전체의 연결 구조를 알아야 한다는 문제점이 있다. 본 연구에서는 hyperlink의 구조와 hypertext 분류방법을 이용하여 문서에 연결된 다른 문서 중 중요한 문서를 결정하는 방법을 제시하고 이를 이용한 web crawler 를 통하여 특정영역에서 정확한 문서를 수집함을 보였다.

Keywords