说话人无关的声学至发音运动语音反演
音频与语音处理
2023-07-26 v2 声音
摘要
为了构建能够像人类一样自然处理语音的语音处理方法,研究者探索了多种从语音到可解释空间的可逆映射构建方式。发音运动空间是一个有前景的反演目标,因为该空间捕捉了语音产生的机制。为此,我们构建了一个声学至发音运动反演(AAI)模型,利用自监督学习泛化到未见过的说话人。我们的方法在电磁发音描记术(EMA)数据集上获得了 0.784 的相关性,将最优性能(SOTA)提升了 12.5%。此外,我们通过直接将估计表征的行为与语音产生行为进行比较,展示了这些表征的可解释性。最后,我们提出了一种基于重合成的 AAI 评估指标,该指标不依赖于发音运动标签,并用一个 18 人说话人数据集证明了其有效性。
引用
@article{arxiv.2302.06774,
title = {Speaker-Independent Acoustic-to-Articulatory Speech Inversion},
author = {Peter Wu and Li-Wei Chen and Cheol Jun Cho and Shinji Watanabe and Louis Goldstein and Alan W Black and Gopala K. Anumanchipalli},
journal= {arXiv preprint arXiv:2302.06774},
year = {2023}
}