中文

夸张纠正性反馈的视觉语音合成

音频与语音处理 2020-12-16 v2 人工智能

摘要

为了给第二语言(L2)学习者提供更具判别性的反馈,以更好地识别其发音错误,我们提出了一种用于计算机辅助发音训练(CAPT)中的夸张视觉语音反馈方法。语音夸张通过基于 Tacotron 的强调语音生成神经网络实现,而视觉夸张则通过 ADC 视位混合完成,即增加运动幅度(Amplitude)、延长音素时长(Duration)并增强颜色对比度(Contrast)。用户研究表明,夸张反馈在帮助学习者进行发音识别和发音改善方面优于非夸张版本。

关键词

引用

@article{arxiv.2009.05748,
  title  = {Visual-speech Synthesis of Exaggerated Corrective Feedback},
  author = {Yaohua Bu and Weijun Li and Tianyi Ma and Shengqi Chen and Jia Jia and Kun Li and Xiaobo Lu},
  journal= {arXiv preprint arXiv:2009.05748},
  year   = {2020}
}