원거리 음성인식용 DNN-LSTM acoustic model 성능비교연구

초록

사용자가 apple 의 시리, google 의 google now 와 같은 intelligent personal assistants(IPA)을 구성하기 위하여 데이터 베이스, 유저 인터페이스(UI, user interface), 추론부에 대해서 STT 와 TTS 기술이 필요하다. 본 논문은 음성인식 분야에서 주로 사용되는 KALDI 와 MFCC 값을 통하여 Bottleneck DNN 및 LSTM 을 SiTEC Dict01 데이터베이스 상황에서 WER 을 측정 함으로써 IPA 의 STT 인 Acoustic Model 성능을 비교한다.

제목
원거리 음성인식용 DNN-LSTM acoustic model 성능비교연구
저자
장준혁이재홍
발행일
2017-06
유형
Proceeding
저널명
한국통신학회 학술대회논문집
페이지
811 ~ 811