基于语音单元的可懂度唇语转语音合成
声音
2023-06-01 v1 计算机视觉与模式识别
音频与语音处理
摘要
本文提出一种新颖的唇语转语音合成(Lip-to-Speech synthesis, L2S)框架,用于从无声唇动视频合成可懂度语音。具体而言,为弥补先前 L2S 模型监督信号不足的问题,我们提出使用量化自监督语音表示(称为语音单元)作为 L2S 模型的附加预测目标。因此,所提 L2S 模型被训练为生成多目标,即梅尔频谱图与语音单元。由于语音单元是离散的而梅尔频谱图是连续的,所提多目标 L2S 模型可在不使用文本标注数据的情况下以强内容监督进行训练。此外,为准确地将合成的梅尔频谱图转换为波形,我们引入一种多输入声码器,其通过参考语音单元即使从模糊且含噪的梅尔频谱图也能生成清晰波形。大量实验结果证实了所提方法在 L2S 中的有效性。
引用
@article{arxiv.2305.19603,
title = {Intelligible Lip-to-Speech Synthesis with Speech Units},
author = {Jeongsoo Choi and Minsu Kim and Yong Man Ro},
journal= {arXiv preprint arXiv:2305.19603},
year = {2023}
}
备注
Interspeech 2023