中文

基于注意力与编码器-解码器模型的不同语速下发音器官运动变换

音频与语音处理 2020-08-21 v2 机器学习 声音

摘要

在以不同语速说话时,发音器官(如舌头、嘴唇)的运动方式往往不同,且发音时长也不同。过去,仿射变换和DNN已被用于从中性语速到快速语速(N2F)以及从中性语速到慢速语速(N2S)的发音器官运动变换[1]。在本工作中,我们通过使用AstNet(一种带注意力的编码器-解码器框架)对语速特定的时长及其变换进行建模,改进了现有的变换技术。在当前工作中,我们提出一种使用LSTM的编码器-解码器架构,可生成更平滑的预测发音器官轨迹。为了建模不同语速间的时长变化,我们部署了注意力网络,从而消除了使用DTW对不同语速轨迹进行对齐的需要。我们进行了音素特定的时长分析,以检验所提出的AstNet对时长的变换效果。由于发音器官运动的范围与语速相关,我们还分析了不同语速下变换后发音器官运动的幅度与其原始对应运动的对比,以检验所提出的AstNet在N2F和N2S中预测发音器官运动程度的准确性。我们观察到,AstNet比现有变换技术能更好地建模发音器官运动的时长和程度,从而产生更准确的变换发音器官轨迹。

关键词

引用

@article{arxiv.2006.03107,
  title  = {Attention and Encoder-Decoder based models for transforming articulatory movements at different speaking rates},
  author = {Abhayjeet Singh and Aravind Illa and Prasanta Kumar Ghosh},
  journal= {arXiv preprint arXiv:2006.03107},
  year   = {2020}
}

备注

5 pages, 4 figures, InterSpeech 2020