中文

通过三平面融合实现连贯的 3D 人像视频重建

计算机视觉与模式识别 2024-05-03 v1

摘要

单图像 3D 人像重建的最新突破使远程呈现系统能够实时从单个摄像头传输 3D 人像视频,有望使远程呈现大众化。然而,逐帧 3D 重建表现出时间不一致性,并且会遗忘用户的外观。另一方面,自我重演方法可以通过驱动个性化 3D 先验来渲染连贯的 3D 人像,但无法忠实地重建用户逐帧的外观(例如,面部表情和光照)。在本工作中,我们认识到需要同时保持连贯的身份和动态的逐帧外观,以实现最佳的真实感。为此,我们提出了一种新的基于融合的方法,将个性化 3D 主体先验与逐帧信息融合,生成时间稳定且忠实重建用户逐帧外观的 3D 视频。我们的基于编码器的方法仅使用由表情条件 3D GAN 生成的合成数据进行训练,在工作室内和野外数据集上均实现了 SOTA 的 3D 重建精度和时间一致性。

关键词

引用

@article{arxiv.2405.00794,
  title  = {Coherent 3D Portrait Video Reconstruction via Triplane Fusion},
  author = {Shengze Wang and Xueting Li and Chao Liu and Matthew Chan and Michael Stengel and Josef Spjut and Henry Fuchs and Shalini De Mello and Koki Nagano},
  journal= {arXiv preprint arXiv:2405.00794},
  year   = {2024}
}