中文

用于说话人无关声学至发音逆映射的双流联合训练

声音 2023-02-28 v1 多媒体 音频与语音处理

摘要

声学至发音逆映射(AAI)旨在从语音音频估计发音器官的参数。AAI 面临两个常见挑战:数据有限,以及在说话人无关场景下性能不佳。当前多数工作专注于直接从语音中提取特征,忽视了音素信息的重要性,这可能限制了 AAI 的性能。为此,我们提出了一种称为 SPN 的新颖网络,使用两个不同的流来完成 AAI 任务。首先,为提升说话人无关实验的性能,我们提出一种新的音素流网络,以音素特征来估计发音参数。据我们所知,这是首个从音素中提取说话人无关特征以提升 AAI 性能的工作。其次,为了更好地表示语音信息,我们训练了一个语音流网络,将局部特征与全局特征相结合。与当前最优(SOTA)相比,所提方法在说话人无关实验中将 RMSE 降低了 0.18mm,并将 Pearson 相关系数提升了 6.0%。代码已发布于 https://github.com/liujinyu123/AAINetwork-SPN。

关键词

引用

@article{arxiv.2302.13273,
  title  = {Two-Stream Joint-Training for Speaker Independent Acoustic-to-Articulatory Inversion},
  author = {Jianrong Wang and Jinyu Liu and Li Liu and Xuewei Li and Mei Yu and Jie Gao and Qiang Fang},
  journal= {arXiv preprint arXiv:2302.13273},
  year   = {2023}
}