学习动态面部辐射场用于少样本说话头合成
计算机视觉与模式识别
2022-07-26 v1
摘要
说话头合成是一项新兴技术,在电影配音、虚拟化身和在线教育中有广泛应用。近期基于 NeRF 的方法生成了更自然的说话视频,因为它们更好地捕捉了面部的 3D 结构信息。然而,每个身份都需要用大数据集训练一个特定模型。本文中,我们提出动态面部辐射场(DFRF)用于少样本说话头合成,其能用少量训练数据快速泛化到未见身份。与现有直接将有特定人的 3D 几何和外观编码进网络的基于 NeRF 的方法不同,我们的 DFRF 将面部辐射场以 2D 外观图像为条件来学习人脸先验。因此面部辐射场可用少量参考图像灵活调整到新身份。此外,为更好地建模面部形变,我们提出一个以音频信号为条件的可微人脸扭曲模块,将所有参考图像扭曲到查询空间。大量实验表明,在仅数十秒训练片段可用的情况下,我们提出的 DFRF 能以仅 40k 次迭代为新身份合成自然且高质量的音频驱动说话头视频。我们强烈建议读者观看补充视频以进行直观比较。代码见 https://sstzal.github.io/DFRF/。
引用
@article{arxiv.2207.11770,
title = {Learning Dynamic Facial Radiance Fields for Few-Shot Talking Head Synthesis},
author = {Shuai Shen and Wanhua Li and Zheng Zhu and Yueqi Duan and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2207.11770},
year = {2022}
}
备注
Accepted by ECCV 2022. Project page: https://sstzal.github.io/DFRF/