面向非平行发音到声学语音合成的多视角时间对齐
声音
2021-01-01 v1 机器学习
音频与语音处理
摘要
发音到声学(A2A)合成是指从捕获的发音器官运动中生成可听语音。该技术有诸多应用,例如为因疾病或损伤而无法说话的人恢复口语交流。迄今为止大多数成功技术采用监督学习框架,其中使用时间同步的发音与语音记录来训练监督机器学习算法,之后可用于将发音器官运动映射为语音。然而,这在无法获得平行数据的情况下阻碍了 A2A 技术的应用,例如某人已丧失嗓音且只能捕获发音数据。本工作基于多视角学习理论提出该问题的解决方案。所提算法试图通过将非对齐的具有相同音素内容的发音与声学序列对投影到一个公共潜在空间(两视角在此最大化相关)并随后应用动态时间规整(dynamic time warping),来寻找它们之间的最优时间对齐。我们讨论并探索了该思想的若干变体。我们表明,在非对齐场景下生成的语音质量与平行场景下获得的语音质量相当。
引用
@article{arxiv.2012.15184,
title = {Multi-view Temporal Alignment for Non-parallel Articulatory-to-Acoustic Speech Synthesis},
author = {Jose A. Gonzalez-Lopez and Miriam Gonzalez-Atienza and Alejandro Gomez-Alanis and Jose L. Perez-Cordoba and Phil D. Green},
journal= {arXiv preprint arXiv:2012.15184},
year = {2021}
}