VideoReTalking:基于音频的野外说话头视频编辑唇形同步方法
计算机视觉与模式识别
2022-11-29 v1
摘要
我们提出VideoReTalking,一种根据输入音频编辑真实世界说话头视频中人脸并生成高质量且唇形同步输出视频的新系统,即使表情不同也能做到。我们将该目标解耦为三个顺序任务:(1) 具有规范表情的人脸视频生成;(2) 音频驱动的唇形同步;(3) 用于提升真实感的人脸增强。给定一段说话头视频,我们首先使用表情编辑网络依据同一表情模板修改每一帧的表情,得到具有规范表情的视频。该视频与给定音频随后被送入唇同步网络以生成唇形同步视频。最后,我们通过身份感知的人脸增强网络与后处理提升合成人脸的真实感。我们在全部三个步骤中均采用基于学习的方法,且所有模块均可在无需任何用户干预的顺序流水线中处理。此外,我们的系统是一种通用方法,无需针对特定人物重新训练。在两个广泛使用的数据集及野外样本上的评估表明,我们的框架在唇形同步精度与视觉质量方面优于其他SOTA方法。
引用
@article{arxiv.2211.14758,
title = {VideoReTalking: Audio-based Lip Synchronization for Talking Head Video Editing In the Wild},
author = {Kun Cheng and Xiaodong Cun and Yong Zhang and Menghan Xia and Fei Yin and Mingrui Zhu and Xuan Wang and Jue Wang and Nannan Wang},
journal= {arXiv preprint arXiv:2211.14758},
year = {2022}
}
备注
Accepted by SIGGRAPH Asia 2022 Conference Proceedings. Project page: https://vinthony.github.io/video-retalking/