跟我念:通过发声模仿的自监督声学至构音映射学习
声音
2022-04-06 v1 计算与语言
音频与语音处理
摘要
我们提出了一种语音产生的计算模型,结合了预训练的神经构音合成器(能够从一组有限的可解释构音参数复现复杂语音刺激)、基于 DNN 的内部前向模型(预测构音指令的感官后果),以及基于循环神经网络的内部逆模型(从声学语音输入恢复构音指令)。前向与逆模型均从不同说话人的原始纯声学语音数据中以自监督方式联合训练。模仿模拟从客观与主观上进行了评估,并展现出相当令人鼓舞的性能。
引用
@article{arxiv.2204.02269,
title = {Repeat after me: Self-supervised learning of acoustic-to-articulatory mapping by vocal imitation},
author = {Marc-Antoine Georges and Julien Diard and Laurent Girin and Jean-Luc Schwartz and Thomas Hueber},
journal= {arXiv preprint arXiv:2204.02269},
year = {2022}
}