Speech2Lip:基于短视频学习的高保真语音到唇形生成
计算机视觉与模式识别
2023-09-12 v1
摘要
根据给定语音合成逼真视频仍是一项开放挑战。先前的工作深受唇形生成不准确和图像质量差等问题的困扰。其关键原因在于,仅有有限面部区域(如唇部区域)的运动与外观主要由输入语音驱动。因此,直接学习从语音到整个头部图像的映射函数容易产生歧义,尤其在使用短视频训练时。为此,我们提出一种名为语音到唇形(Speech2Lip)的分解-合成-组合框架,该框架解耦语音敏感与语音不敏感的运动/外观,以促进从有限训练数据中有效学习,从而生成自然观感的视频。首先,给定固定头部姿态(即规范空间),我们提出一种语音驱动的隐式模型用于唇部图像生成,其专注于学习语音敏感的运动与外观。接下来,为建模主要语音不敏感运动(即头部运动),我们引入几何感知互显式映射(GAMEM)模块,在不同头部姿态间建立几何映射。这使我们能将规范空间下生成的唇部图像粘贴到任意姿态的头部图像上,并合成具有自然头部运动的说话视频。此外,引入 Blend-Net 与对比同步损失以增强整体合成性能。在三个基准上的定量与定性结果表明,我们的模型仅需几分钟长度的视频即可训练,并在视觉质量与语音-视觉同步方面达到最先进性能。代码:https://github.com/CVMI-Lab/Speech2Lip。
引用
@article{arxiv.2309.04814,
title = {Speech2Lip: High-fidelity Speech to Lip Generation by Learning from a Short Video},
author = {Xiuzhe Wu and Pengfei Hu and Yang Wu and Xiaoyang Lyu and Yan-Pei Cao and Ying Shan and Wenming Yang and Zhongqian Sun and Xiaojuan Qi},
journal= {arXiv preprint arXiv:2309.04814},
year = {2023}
}