中文

基于语音分解与辅助特征的声学至发音运动逆映射

声音 2022-04-05 v1 计算机视觉与模式识别 音频与语音处理

摘要

声学至发音运动逆映射(Acoustic-to-articulatory inversion, AAI)是从语音信号中获取发音器官运动的过程。迄今为止,由于数据有限,实现说话人无关的 AAI 仍是一项挑战。此外,当前大多数工作仅使用音频语音作为输入,造成了不可避免的性能瓶颈。为解决这些问题,我们首先预训练一个语音分解网络,将音频语音分解为说话人嵌入和内容嵌入,作为适应说话人无关情形的新个性化语音特征。其次,为了进一步改进 AAI,我们提出一种新颖的辅助特征网络,从上述个性化语音特征中估计唇部辅助特征。在三个公开数据集上的实验结果表明,与仅使用音频语音特征的现有最优方法相比,所提方法在说话人相关情形下平均 RMSE 降低了 0.25,平均相关系数提高了 2.0%。更重要的是,在说话人无关情形下平均 RMSE 降低了 0.29,平均相关系数提高了 5.0%。

关键词

引用

@article{arxiv.2204.00873,
  title  = {Acoustic-to-articulatory Inversion based on Speech Decomposition and Auxiliary Feature},
  author = {Jianrong Wang and Jinyu Liu and Longxuan Zhao and Shanyu Wang and Ruiguo Yu and Li Liu},
  journal= {arXiv preprint arXiv:2204.00873},
  year   = {2022}
}