中文

基于数据增强与注意力机制的非母语者英语词汇重音错误检测

音频与语音处理 2021-06-08 v2 声音

摘要

本文描述了两种新颖且互补的技术,可改进非母语(L2)英语语音中词汇重音错误的检测:基于注意力的特征提取与基于神经文本转语音(TTS)的数据增强。在经典方法中,音频特征通常从语音的固定区域(如音节核)提取。我们提出了一种基于注意力的深度学习模型,可从帧级与音素级音频特征中自动导出最优音节级表示。由于错误重音模式数量有限,训练该模型颇具挑战。为解决此问题,我们提出用神经 TTS 生成错误重音单词来扩充训练集。结合两种技术,在斯拉夫语与波罗的语使用者的 L2 英语语音中检测错误重音单词取得了 94.8% 准确率与 49.2% 召回率。

关键词

引用

@article{arxiv.2012.14788,
  title  = {Detection of Lexical Stress Errors in Non-Native (L2) English with Data Augmentation and Attention},
  author = {Daniel Korzekwa and Roberto Barra-Chicote and Szymon Zaporowski and Grzegorz Beringer and Jaime Lorenzo-Trueba and Alicja Serafinowicz and Jasha Droppo and Thomas Drugman and Bozena Kostek},
  journal= {arXiv preprint arXiv:2012.14788},
  year   = {2021}
}

备注

Accepted to Interspeech 2021