Pseudo-Cepstral Representation of Speech Signal and Its Application to Speech Recognition

음성 신호의 의사 켑스트럼 표현 및 음성 인식에의 응용

  • 김홍국 (한국과학기술원 정보및 통신공학과) ;
  • 이황수 (한국과학기술원 정보및 통신공학과)
  • Published : 1994.01.01

Abstract

In this paper, we propose a pseudo-cepstral representation of line spectrum pair(LSP) frequencies and evaluate speech recognition performance with cepstral lift using the pseudo-cepstrum. The pseudo-cepstrum corresponding to LSP frequencies is derived by approxmating the relationship between LPC-cepstrum and LSP frequencies. Three cepstral liftering procedures are applied to the pseudo-cepstrum to improve the performance of speech recognition. They are the root-power-sums ligter, the general exponential lifter, and the bandpass lifter. Then, the liftered psedudo-cepstra are warped into a mel-frequency scale to obtain feature vectors for speech recognition. Among the three lifters, the general exponential lifter results in the best performance on speech recognition. When we use the proposed pseudo-cepstra feature vectors for recognizing noisy speech, the signal-to-noise ratio (SNR) improvement of about 5~10dB LSP is obtained.

본 논문에서는 line spectrum pair (LSP)의 의사 켑스트럼 표현을 제안하고 이 의사 켑스트럼에 켑스트럼 lifter를 적용하여 얻은 특징 벡타를 이용하는 음성 인식 시스템의 성능을 평가한다. 의사 켑스트럼 표현은 LSP와 LPC 켑스터럼 사이의 관계로부터 근사적으로 유도된다. 이때 음성 인식 시스템의 성능을 더욱 향상 시키기 위하여 root-power-sums lifter, general exponential lifter (GEL), 그리고 bandpass lifter 등과 같은 켑스터럼 liter가 의사 켑스터럼에 적용된다. 또한 mel 주파수로의 변환도 행해진다. 인식 결험 결과, GEL로 liftering된 mel 주파수 의사 켑스터럼이 가장 좋은 성능을 나타내며, LSP에 비해 5~6dB정도의 신도대잡음비의 개선을 얻을 수 있다.

Keywords