中文

像素的价值远超单个 3D 高斯:单视角 3D 重建中的层次化喷溅图像

计算机视觉与模式识别 2024-06-04 v3

摘要

从单视图图像学习 3D 场景表示是计算机视觉中的一个长期存在的根本问题,由于输入视角不可见内容的内在歧义。基于最近提出的 3D 高斯溅写(3DGS),Splatter Image 方法通过为每个像素学习一个 3D 高斯来实现快速单图像新视角合成,但其表达能力有限,无法表示输入视角中不可见的遮挡组件。为此,本文提出层次化喷溅图像方法,其中每个像素的价值超过一个 3D 高斯。具体而言,每个像素由一个父级 3D 高斯和少量子级 3D 高斯组成。父级 3D 高斯按原始 Splatter Image 方法学习,子级 3D 高斯 通过轻量级多层感知器(MLP)学习,输入为父级 3D 高斯的投影图像特征以及目标相机视角的嵌入。父子 3D 高斯 以阶段性方式端到端学习。输入图像特征来自父级高斯的“眼睛”以及目标相机位置的联合条件,有助于学习子级高斯分配以“看见不可见之物”,恢复父级高斯常忽略的遮挡细节。在实验中,我们在 ShapeNet-SRN 和 CO3D 数据集上测试了所提方法,取得了 state-of-the-art 的性能,尤其在输入视角中重建遮挡内容方面表现突出。

关键词

引用

@article{arxiv.2405.20310,
  title  = {A Pixel Is Worth More Than One 3D Gaussians in Single-View 3D Reconstruction},
  author = {Jianghao Shen and Nan Xue and Tianfu Wu},
  journal= {arXiv preprint arXiv:2405.20310},
  year   = {2024}
}

备注

preprint, under review