利用Transformer网络估计语音产生中的发音运动
音频与语音处理
2021-06-15 v2 声音
摘要
我们从不同模态——声学与音素——估计语音产生中的发音运动。声学至发音反演(AAI)是一项序列到序列任务。另一方面,音素至发音(PTA)运动估计在可靠对齐文本与发音运动方面面临关键挑战。为应对该挑战,我们探索使用一种Transformer架构——FastSpeech,通过显式时长建模来学习音素与发音运动间的硬对齐。我们还在AAI上训练了一个Transformer模型。我们使用相关系数(CC)与均方根误差(rMSE)评估估计性能,并与现有方法在两项任务上比较。我们观察到在PTA估计中,采用受试者相关、合并与微调策略时CC分别有154%、11.8%与4.8%的相对提升。此外,在AAI任务上,相较于最先进基线,我们在相同设置下CC分别获得1.5%、3%与3.1%的相对增益。我们进一步展示了将Transformer架构作为表示模块的计算优势。
引用
@article{arxiv.2104.05017,
title = {Estimating articulatory movements in speech production with transformer networks},
author = {Sathvik Udupa and Anwesha Roy and Abhayjeet Singh and Aravind Illa and Prasanta Kumar Ghosh},
journal= {arXiv preprint arXiv:2104.05017},
year = {2021}
}
备注
accepted for oral presentation at INTERSPEECH 2021