中文

猜未见:从部分2D一瞥进行动态3D场景重建

计算机视觉与模式识别 2024-04-23 v1

摘要

本文提出了一种从单目视频输入中重建世界和多个动态人体3D的方法。关键思想是使用新兴的3D高斯泼溅(3D-GS)表示来表示世界和多个动态人体,从而方便高效地组合和渲染它们。我们特别解决了3D人体重建中严重有限和稀疏观测的场景,这是现实世界中常见的挑战。为了应对这一挑战,我们引入了一种新颖的方法,通过融合公共空间中的稀疏线索来优化规范空间中的3D-GS表示,其中我们利用预训练的2D扩散模型合成未见视图,同时保持与观测到的2D外观的一致性。我们展示了该方法可以在各种具有挑战性的示例中重建高质量的可动画3D人体,包括遮挡、图像裁剪、少样本和极其稀疏的观测。重建后,我们的方法不仅能够在任意时间实例的新视图中渲染场景,还可以通过移除单个个体或为每个个体应用不同运动来编辑3D场景。通过多种实验,我们证明了我们的方法相对于现有替代方法的质量和效率。

关键词

引用

@article{arxiv.2404.14410,
  title  = {Guess The Unseen: Dynamic 3D Scene Reconstruction from Partial 2D Glimpses},
  author = {Inhee Lee and Byungjun Kim and Hanbyul Joo},
  journal= {arXiv preprint arXiv:2404.14410},
  year   = {2024}
}

备注

The project page is available at https://snuvclab.github.io/gtu/