中文

Real3D-Portrait:单次逼真3D说话肖像合成

计算机视觉与模式识别 2024-03-26 v3

摘要

单次3D说话肖像生成旨在从未见过的图像中重建3D虚拟形象,然后使用参考视频或音频对其进行动画化,以生成说话肖像视频。现有方法无法同时实现精确的3D虚拟形象重建和稳定的说话人脸动画。此外,虽然现有工作主要关注头部部分的合成,但生成自然的躯干和背景片段以获得逼真的说话肖像视频也至关重要。为了解决这些局限性,我们提出了Real3D-Portrait框架,它(1)通过一个大型图像到平面模型改进了单次3D重建能力,该模型从3D人脸生成模型中蒸馏出3D先验知识;(2)通过高效的运动适配器促进了精确的运动条件动画;(3)使用头-躯干-背景超分辨率模型合成具有自然躯干运动和可切换背景的逼真视频;(4)通过可泛化的音频到运动模型支持单次音频驱动的说话人脸生成。大量实验表明,与先前方法相比,Real3D-Portrait能够很好地泛化到未见身份,并生成更逼真的说话肖像视频。视频样本和源代码见https://real3dportrait.github.io。

关键词

引用

@article{arxiv.2401.08503,
  title  = {Real3D-Portrait: One-shot Realistic 3D Talking Portrait Synthesis},
  author = {Zhenhui Ye and Tianyun Zhong and Yi Ren and Jiaqi Yang and Weichuang Li and Jiawei Huang and Ziyue Jiang and Jinzheng He and Rongjie Huang and Jinglin Liu and Chen Zhang and Xiang Yin and Zejun Ma and Zhou Zhao},
  journal= {arXiv preprint arXiv:2401.08503},
  year   = {2024}
}

备注

ICLR 2024 (Spotlight). Project page: https://real3dportrait.github.io