中文

利用共振峰和梅尔频率倒谱系数识别英语音素 /\textipa{@}/、/{\ae}/、/\textipa{A}:/ 和 /\textipa{2}/ 的发音

计算与语言 2017-02-24 v1 声音

摘要

本研究使用华盛顿大学的 Vocal Joystick 元音语料库,研究了以英语为母语者发出的单元音。本研究的目标是定量测量语音识别方法区分发音相似元音的程度。具体分析了音素 /\textipa{@}/、/{\ae}/、/\textipa{A}:/ 和 /\textipa{2}/。使用了语料库中的 748 个声音文件,对其应用线性预测编码 (LPC) 以计算共振峰,并应用梅尔频率倒谱系数 (MFCC) 算法以计算倒谱系数。使用决策树分类器构建了一个预测模型,该模型学习了数据集中测量的前两个共振峰的模式以及 13 个倒谱系数的模式。对于上述音素,使用共振峰的准确率为 70%。对于 MFCC 分析,准确率为 52%,而当忽略 /\textipa{@}/ 时准确率为 71%。所得结果表明,所研究的算法在模仿人类听觉区分声音细微差别的能力方面还相差甚远。

关键词

引用

@article{arxiv.1702.07071,
  title  = {Pronunciation recognition of English phonemes /\textipa{@}/, /{\ae}/, /\textipa{A}:/ and /\textipa{2}/ using Formants and Mel Frequency Cepstral Coefficients},
  author = {Keith Y. Patarroyo and Vladimir Vargas-Calderón},
  journal= {arXiv preprint arXiv:1702.07071},
  year   = {2017}
}

备注

11 pages, pre-print version