ReliTalk:基于单目视频的可重打光说话人像生成
计算机视觉与模式识别
2023-09-06 v1 图形学
摘要
近年来,从单目视频创建生动音频驱动人像取得了巨大进展。然而,如何将所创建的视频化身无缝适配到具有不同背景和光照条件的其他场景仍待解决。另一方面,现有的重打光研究大多依赖动态光照或多视角数据,这对于创建视频人像而言过于昂贵。为弥补这一差距,我们提出ReliTalk,一种基于单目视频的可重打光音频驱动说话人像生成新框架。我们的核心思路是从隐式学习的音频驱动面部法线与图像中分解出人像的反射率。具体而言,我们利用由音频特征导出的3D面部先验,通过隐式函数预测精细法线图。这些初始预测的法线随后通过动态估计给定视频的光照条件,在反射率分解中发挥关键作用。此外,在模拟的多光照条件下使用身份一致性损失对立体人脸表征进行优化,以解决单目视频有限视角所导致的病态问题。大量实验在真实与合成数据集上验证了我们所提框架的优越性。我们的代码发布于https://github.com/arthur-qiu/ReliTalk。
引用
@article{arxiv.2309.02434,
title = {ReliTalk: Relightable Talking Portrait Generation from a Single Video},
author = {Haonan Qiu and Zhaoxi Chen and Yuming Jiang and Hang Zhou and Xiangyu Fan and Lei Yang and Wayne Wu and Ziwei Liu},
journal= {arXiv preprint arXiv:2309.02434},
year = {2023}
}