LipSync3D:利用姿态与光照归一化从视频中数据高效地学习个性化 3D 说话人脸
计算机视觉与模式识别
2021-06-09 v1
摘要
本文提出一种基于视频的学习框架,用于从音频驱动个性化 3D 说话人脸的动画生成。我们引入了两种训练期数据归一化方法,显著提升了数据样本效率。首先,我们将人脸隔离并在解耦 3D 几何、头部姿态与纹理的归一化空间中表征。这将预测问题分解为对 3D 人脸形状及相应 2D 纹理图集的回归。其次,我们利用面部对称性与皮肤近似反照率恒定来隔离并去除时空光照变化。这些归一化共同作用,使简单网络仅使用单个说话人特定视频训练,即可在新环境光照下生成高保真唇形同步视频。此外,为稳定时间动态,我们引入一种以模型先前视觉状态为条件的自回归方法。人工评分与客观指标表明,我们的方法在真实感、唇形同步与视觉质量分数上优于当前的 SOTA 音频驱动视频重演基准。我们展示了该框架所支持的若干应用。
引用
@article{arxiv.2106.04185,
title = {LipSync3D: Data-Efficient Learning of Personalized 3D Talking Faces from Video using Pose and Lighting Normalization},
author = {Avisek Lahiri and Vivek Kwatra and Christian Frueh and John Lewis and Chris Bregler},
journal= {arXiv preprint arXiv:2106.04185},
year = {2021}
}
备注
Accepted to IEEE CVPR 2021. Brief demo video available at: https://www.youtube.com/watch?v=L1StbX9OznY