中文

局部特征还是梅尔频率倒谱系数:哪种更适合基于 MLN 的孟加拉语语音识别?

计算与语言 2013-10-08 v1

摘要

本文讨论了作为多层神经网络 (MLN) 输入的局部特征 (LFs) 相对于梅尔频率倒谱系数 (MFCCs) 在孟加拉语输入语音中的优势。基于 LF 的方法包含三个阶段:(i) 从输入语音中提取 LF,(ii) 利用 MLN 从 LF 中提取音素概率,以及 (iii) 基于隐马尔可夫模型 (HMM) 的分类器以获得更准确的音素串。在我们准备的孟加拉语语音语料库上进行的实验表明,基于 LF 的自动语音识别 (ASR) 系统比基于 MFCC 的系统提供了更高的音素正确率。此外,所提出的系统在 HMM 中需要更少的混合分量。

关键词

引用

@article{arxiv.1310.1426,
  title  = {Local Feature or Mel Frequency Cepstral Coefficients - Which One is Better for MLN-Based Bangla Speech Recognition?},
  author = {Foyzul Hassan and Mohammed Rokibul Alam Kotwal and Md. Mostafizur Rahman and Mohammad Nasiruddin and Md. Abdul Latif and Mohammad Nurul Huda},
  journal= {arXiv preprint arXiv:1310.1426},
  year   = {2013}
}

备注

9 pages Advances in Computing and Communications (ACC) 2011