中文

Coherent3D:通过三平面融合实现相干的三维人像视频重建

计算机视觉与模式识别 2024-12-13 v1 图像与视频处理

摘要

近期在单图像三维人像重建方面的进展,使得远程呈现系统能够通过单摄像头实时传输三维人像视频,从而实现了远程呈现的普及化。然而,逐帧重建存在时间不一致性,并且会遗忘用户的身份特征。另一方面,自我重演方法可以通过从单张参考图像构建的三维化身来渲染相干的三维人像,但无法忠实保留用户逐帧的外观(如瞬时的面部表情和光照)。因此,这两种框架都不是实现普及化三维远程呈现的理想方案。在本研究中,我们提出了一种新颖的解决方案来解决这一困境,在保持连贯身份的同时,保留动态的逐帧外观,以实现最佳的真实感。为此,我们提出了一种融合方法,结合了两者的优点:将来自参考视图的规范三维先验与来自逐帧输入视图的动态外观相融合,生成时间上连贯的三维视频,并忠实重建用户的逐帧外观。我们的编码器方法仅使用由表情条件三维生成对抗网络生成的合成数据进行训练,在演播室和野外数据集上都实现了最先进的三维重建和时间一致性。

关键词

引用

@article{arxiv.2412.08684,
  title  = {Coherent3D: Coherent 3D Portrait Video Reconstruction via Triplane Fusion},
  author = {Shengze Wang and Xueting Li and Chao Liu and Matthew Chan and Michael Stengel and Henry Fuchs and Shalini De Mello and Koki Nagano},
  journal= {arXiv preprint arXiv:2412.08684},
  year   = {2024}
}

备注

arXiv admin note: substantial text overlap with arXiv:2405.00794