DOI QR코드

DOI QR Code

XML Document Clustering Technique by K-means algorithm through PCA

주성분 분석의 K 평균 알고리즘을 통한 XML 문서 군집화 기법

  • Received : 2011.06.28
  • Accepted : 2011.08.13
  • Published : 2011.10.31

Abstract

Recently, researches are studied in developing efficient techniques for accessing, querying, and storing XML documents which are frequently used in the Internet. In this paper, we propose a new method to cluster XML documents efficiently. We use a K-means algorithm with a Principal Component Analysis(PCA) to cluster XML documents after they are represented by vectors in the feature vector space by transferring them as names and levels of the elements of the corresponding trees. The experiment shows that our proposed method has a good result.

최근 들어 인터넷에서 많이 사용되는 XML 문서들을 효율적으로 접근, 질의, 저장하는 방법들이 연구된다. 본 논문은 XML 문서들을 효율적으로 군집화 하는 새로운 기법을 제안한다. XML 문서를 대응하는 트리 구조의 원소들의 이름과 레벨로 표현하여 특징 벡터 공간상의 벡터로 나타내고 주성분 분석을 통한 k 평균 알고리즘 기법을 사용하여 군집화를 시도한다. 실험 결과를 통하여 제안하는 기법이 좋은 결과를 얻을 수 있음을 보였다.

Keywords

References

  1. Yoon, J., Raghavan, "BitCube: Clustering and Statistical Analysis for XML Documents", Journal of Intelligent Information Systems, Vol.17, 2001.
  2. 김우생, "비트벡터에 기반한 XML 군집화 기법", 대한전자공학 회 논문지, 2010. 9.
  3. 이정원, 이기호, "유사성 기반 XML 문서 분석 기법", 정보과학회 논문지: 소프트웨어 및 응용 제 29권 제 5-6호, 2002. 6.
  4. 황정희, 류근호,"XML 문서의 공통 구조를 이용한 클러스터링 기법", 정보과학회논문지 D: 데이타베이스 제 32권 제 6호, 2005. 12.
  5. 황정희, "클러스터의 주요항목 가중치 기반 XML 문서 클러스터링", 한국정보처리학회 논문지 D- 데이터베이스, 2007.
  6. 이호석, "함수 변환과 FFT에 기반한 조정자가 없는 XML 문서 클러스터링 기법", 한국정보처리학회 논문지 D-, 2007.
  7. Gonzalez R.C., Woods R.E., "Digital Image Processing, Prentice-Hall, 2007.
  8. 오일석, 패턴인식, 교보문고, 2008.
  9. Niagara Query Engine, http://www.cs.wisc.edu/niagara/ data.html