中文

面向普通话非母语错误发音校验的多视角方法

音频与语音处理 2020-09-10 v2 声音

摘要

传统上,非母语错误发音校验系统的性能依赖于对非母语语料库有效的音素级标注。本研究提出一种多视角方法,以融入判别性特征表示,从而减少对非母语普通话错误发音校验的标注需求。此处,模型被联合学习以嵌入声学序列与多源信息,用于语音属性与瓶颈特征。采用带对比损失的双向 LSTM 嵌入模型将声学序列与多源信息映射至固定维嵌入。声学嵌入之间的距离被视为音素间的相似度。相应地,错误发音音素的示例预期与其标准发音具有较小的相似度得分。该方法在错误发音校验任务中,相较基于 GOP 的方法诊断准确率提升 +11.23%,相较单视角方法提升 +1.47%。

关键词

引用

@article{arxiv.2009.02573,
  title  = {A multi-view approach for Mandarin non-native mispronunciation verification},
  author = {Zhenyu Wang and John H. L. Hansen and Yanlu Xie},
  journal= {arXiv preprint arXiv:2009.02573},
  year   = {2020}
}

备注

ICASSP 2020