基于多任务学习的野外唇语转语音合成
声音
2023-02-20 v1 计算机视觉与模式识别
机器学习
多媒体
音频与语音处理
摘要
近期研究表明,旨在仅从视觉信息重建语音的唇语转语音(Lip-to-speech)合成取得了令人印象深刻的性能。然而,由于指导模型推断正确内容的监督不足,它们一直难以在野外合成准确的语音。与先前方法不同,在本文中,我们开发了一种强大的Lip2Speech方法,即使是在野外环境中,也能从输入唇部运动重建具有正确内容的语音。为此,我们设计了多任务学习,利用多模态监督(即文本和音频)来引导模型,以补充声学特征重建损失中不足的词语表示。因此,所提出的框架带来了合成包含多个说话人无约束句子正确内容的语音的优势。我们使用LRS2、LRS3和LRW数据集验证了所提方法的有效性。
引用
@article{arxiv.2302.08841,
title = {Lip-to-Speech Synthesis in the Wild with Multi-task Learning},
author = {Minsu Kim and Joanna Hong and Yong Man Ro},
journal= {arXiv preprint arXiv:2302.08841},
year = {2023}
}
备注
Accepted at ICASSP 2023. Demo available: https://github.com/joannahong/Lip-to-Speech-Synthesis-in-the-Wild