DOI QR코드

DOI QR Code

A CNV detection algorithm based on statistical analysis of the aligned reads

정렬된 리드의 통계적 분석을 기반으로 하는 CNV 검색 알고리즘

  • 홍상균 (한림대학교 컴퓨터공학과) ;
  • 홍동완 (한림대학교 바이오메디컬학과) ;
  • 윤지희 (한림대학교 컴퓨터공학과) ;
  • 김백섭 (한림대학교 컴퓨터공학과) ;
  • 박상현 (연세대학교 컴퓨터과학과)
  • Published : 2009.10.31

Abstract

Recently it was found that various genetic structural variations such as CNV(copy number variation) exist in the human genome, and these variations are closely related with disease susceptibility, reaction to treatment, and genetic characteristics. In this paper we propose a new CNV detection algorithm using millions of short DNA sequences generated by giga-sequencing technology. Our method maps the DNA sequences onto the reference sequence, and obtains the occurrence frequency of each read in the reference sequence. And then it detects the statistically significant regions which are longer than 1Kbp as the candidate CNV regions by analyzing the distribution of the occurrence frequency. To select a proper read alignment method, several methods are employed in our algorithm, and the performances are compared. To verify the superiority of our approach, we performed extensive experiments. The result of simulation experiments (using a reference sequence, build 35 of NCBI) revealed that our approach successfully finds all the CNV regions that have various shapes and arbitrary length (small, intermediate, or large size).

인간의 유전체 서열에는 유전체 단위반복변위(copy number variation, CNV)를 포함하는 다양한 유전적 구조 변이(genetic structural variation)가 존재하며, 이는 기능적으로 질병에 대한 감수성, 치료에 대한 반응, 유전적 특성 등과 밀접한 관련이 있다. 본 논문에서는 기가 시퀀싱(giga sequencing)의 결과 산출되는 대량의 짧은 길이의 DNA 서열 데이터를 이용한 새로운 CNV 검색 방식을 제안한다. 제안하는 알고리즘에서는 레퍼런스 시퀀스에 DNA 서열 데이터를 서열 정렬시켜 각 레퍼런스 시퀀스의 위치에 대한 서열 데이터의 출현 빈도 정보를 얻은 후, 출현 빈도 정보의 패턴을 분석하여 통계적 유의성을 갖는 1kbp 이상의 연속 영역을 CNV 후보 영역으로 추출한다. 또한 제안된 알고리즘을 효율적으로 지원하기 위한 서열 정렬 방식에 대한 비교 및 분석을 수행한다. 제안된 기법의 유용성을 규명하기 위하여 다양한 실험을 수행하였다. 실험 결과에 의하면, 제안된 기법은 비교적 낮은 커버리지의 기가 시퀀싱 데이터를 이용하여 반복되거나 결실되는 다양한 형태의 CNV 영역을 효율적으로 검출하며, 또한 작은 사이즈의 CNV 영역에서부터 큰 사이즈의 CNV 영역까지 다양한 크기의 CNV 영역을 효율적으로 검출 할 수 있는 것으로 나타났다.

Keywords

References

  1. F. S. Robert, "The Race for the $1000 Genome," SCIENCE, Vol.311, pp.1544-1546, 2006. https://doi.org/10.1126/science.311.5767.1544
  2. R. Redon, et al, "Global variation in copy number in the human genome," Nature, Vol.444, pp.444-454, 2006. https://doi.org/10.1038/nature05329
  3. J. Sebat, B. Lakshmi, J. Troge, J. Alexander, J. Young, P. Lundin, S. Månér, H. Massa, M. Walker, M. Chi, N. Navin, R. Lucito, J. Healy, J. Hicks, K. Ye, A. Reiner, T. C. Gillian, B. Trask, N. Patterson, A. Zetterberg, and M. Wigler, "Large-Scale Copy Number Polymorphism in the Human Genome," Science, Vol.305, pp.525-528, 2004. https://doi.org/10.1126/science.1098918
  4. A. J. Iafrate, L. Feuk, M. N. Rivera, M. L. Listewnik, P. K. Donahoe, Y. Qi, S. W. Scherer, and C. Lee, "Detection of large-scale variation in the human genome," Nat. Genet., Vol.36, pp.949-951, 2004. https://doi.org/10.1038/ng1416
  5. E. Tuzun, A. J. Sharp, J. A. Bailey, R. Kaul, V. A. Morrison, L. M. Pertz, E. Haugen, H. Hayden, D. Albertson, D. Pinkel, M. V. Olson, and E. E. Eichler, "Fine-scale structural variation of the human genome," Nat. Genet., Vol.37, No.7, pp.727-732, 2005. https://doi.org/10.1038/ng1562
  6. R. E. Mills, C. T. Luttig, C. E. Larkins, A. Beauchamp, C. Tsui, W. S. Pittard, and S. E. Devine, "An initial map of insertion and deletion (INDEL) variation in the human genome," Genome Res., Vol.16, pp.1182–1190, 2006. https://doi.org/10.1101/gr.4565806
  7. R. Khaja, J. Zhang, J. R. MacDonal, H. Yongshu, M. J. Joseph-George, J. Wei, M. A. Rafiq, C. Qian, Shago M., L. Pantano, H. Aburatani, K. Jones, R. Redon, M. Hurles, L. Armengol, X. Estivill, R. J. Mural, C. Lee, S. W. Scherer, and L. Feuk, "Genome assembly comparison identifies structural variants in the human genome," Nat. Genet., Vol.38, No.12, pp.1413-1418, 2006. https://doi.org/10.1038/ng1921
  8. S. W. Schrer, C. Lee, E. Birney, D. M. Altshuler, E. E. Eichler, N. P. Carter, M. E. Hurles, and L. Feuk, "Challenges and standards in integrating surveys of structural variation," Nat. Genet., Vol.39, No.7, S7-S15, 2007. https://doi.org/10.1038/ng2093
  9. 홍상균, 홍동완, 윤지희, 김종일. “Short read 서열정렬에 의한 CNV 영역 추출,” In proceedings of KDBC 2008, pp.297-305, 2008.
  10. http://www.cbcb.umd.edu/software/RepeatFinder
  11. R. L. Warren, G. G. Sutton, S. J. Jones, and R. A. Holt, "Assembling millions of short DNA sequences using SSAKE," Bioinformatics Vol.23, No.4, pp.500-501, 2007. https://doi.org/10.1093/bioinformatics/btl629
  12. W. R. Jeck, J. A. Reinhardt, D. A. Baltrus, M. T. Hickenbotham, V. Magrini, E. R. Mardis, J. L. Dangl, and C. D. Jones, "Extending assembly of short DNA sequences to handle error," Bioinformatics Vol.23, No.21, pp.2942-2944, 2007. https://doi.org/10.1093/bioinformatics/btm451
  13. J. C. Dohm, C. Lottaz, T. Borodina, and H. Himmelbauer, "SHARCGS, a fast and highly accurate short-read assembly algorithm for de novo genomic sequencing," Genome Res. Vol.17, No.11, pp.1697-1706, 2007 https://doi.org/10.1101/gr.6435207
  14. http://www.illumina.com
  15. R. Li, et al, "SOAP: short oligonucleotide alignment program.," Bioinformatics Vol.24, No.5, pp.713-714, 2008. https://doi.org/10.1093/bioinformatics/btn025
  16. http://maq.sourceforge.net
  17. http://rulai.cshl.edu/rmap
  18. http://brainarray.mbni.med.umich. edu/Brainarray/SequenceAlignment/AQUESA
  19. P. Weiner, "Linear Pattern Matching Algorithms," Proc. 14th IEEE Annual Symp. on Switching and Automata Theory, pp.1-11, 1973. https://doi.org/10.1109/SWAT.1973.13
  20. U. Manber and G.e Myers, "Suffix arrays: a new method for on-line string searches," SIAM Journal on Computing, Vol.22, Issue 5, pp.935-948, 1993. https://doi.org/10.1137/0222058
  21. S. W. Schrer, C. Lee, E. Birney, D. M. Altshuler, E. E. Eichler, N. P. Carter, M. E. Hurles, and L. Feuk, "Challenges and standards in integrating surveys of structural variation," Nat. Genet., Vol.39, No.7, S7-S15, 2007. https://doi.org/10.1038/ng2093
  22. S. Altschul, T. Madden, A. Schaffer, J. Zhang, W. Miller, and D. Lipman, "Gapped BLAST and PSI-BLAST: A New Generation of Protein Data-base Search Programs," Nucleic Acids Research, Vol.25 No.17 pp.3389-3402, 1997. https://doi.org/10.1093/nar/25.17.3389
  23. W. J. Kent, "BLAT - The Blast - Like Alignment Tool," Genome Research, Vol.12, No.4, pp.656-664, 2002. https://doi.org/10.1101/gr.229202
  24. W. W. Daniel, "Biostatistics (8th ed.)," Wiley, 2005.
  25. D. L. Wheeler, C. Chappey, A. E. Lash, D. D. Leipe, T. L. Madden, G. D. Schuler, T. A. Tatusova and B. A. Rapp, "Database resources of the National Center for Biotechnology Information," Nucleic Acids Research, Vol.28 No.1 pp.10-14, 2000. https://doi.org/10.1093/nar/28.1.10
  26. http://projects.tcag.ca/variation
  27. S. Tada, R. Hankins, and J. Patel, "Practical Suffix Tree Construction," In Proceedings of the 30th VLDB Conference, pp.36-47, 2004.