中文

StableFace:说话人脸生成中运动稳定性的分析与改进

计算机视觉与模式识别 2022-08-31 v1 人工智能 机器学习 多媒体 声音

摘要

尽管以往的语音驱动说话人脸生成方法在提升合成视频的视觉质量与唇形同步质量方面取得了显著进展,但它们较少关注唇部运动抖动,而后者极大损害了说话人脸视频的真实感。是什么导致了运动抖动,又该如何缓解该问题?本文基于一个使用 3D 人脸表示来桥接输入音频与输出视频的最先进(SOTA)流水线,对运动抖动问题进行了系统分析,并通过一系列有效设计改进了运动稳定性。我们发现若干问题会导致合成说话人脸视频中的抖动:1)来自输入 3D 人脸表示的抖动;2)训练-推理不匹配;3)缺乏视频帧间的依赖建模。相应地,我们提出三种有效解决方案以应对该问题:1)我们提出基于高斯的自适应平滑模块来平滑 3D 人脸表示,以消除输入中的抖动;2)我们在训练时对神经渲染器的输入数据添加增强侵蚀,以模拟推理中的失真,从而减少不匹配;3)我们开发了音频融合 Transformer 生成器来建模视频帧间的依赖关系。此外,考虑到目前尚无现成指标用于衡量说话人脸视频中的运动抖动,我们设计了一种客观指标(运动稳定性指数,MSI),通过计加速度方差的倒数来定量衡量运动抖动。大量实验结果表明,我们的方法在运动稳定的人脸视频生成上具有优越性,质量优于以往系统。

关键词

引用

@article{arxiv.2208.13717,
  title  = {StableFace: Analyzing and Improving Motion Stability for Talking Face Generation},
  author = {Jun Ling and Xu Tan and Liyang Chen and Runnan Li and Yuchao Zhang and Sheng Zhao and Li Song},
  journal= {arXiv preprint arXiv:2208.13717},
  year   = {2022}
}

备注

12 pages,