像素的价值远超单个 3D 高斯:单视角 3D 重建中的层次化喷溅图像
计算机视觉与模式识别
2024-06-04 v3
摘要
从单视图图像学习 3D 场景表示是计算机视觉中的一个长期存在的根本问题,由于输入视角不可见内容的内在歧义。基于最近提出的 3D 高斯溅写(3DGS),Splatter Image 方法通过为每个像素学习一个 3D 高斯来实现快速单图像新视角合成,但其表达能力有限,无法表示输入视角中不可见的遮挡组件。为此,本文提出层次化喷溅图像方法,其中每个像素的价值超过一个 3D 高斯。具体而言,每个像素由一个父级 3D 高斯和少量子级 3D 高斯组成。父级 3D 高斯按原始 Splatter Image 方法学习,子级 3D 高斯 通过轻量级多层感知器(MLP)学习,输入为父级 3D 高斯的投影图像特征以及目标相机视角的嵌入。父子 3D 高斯 以阶段性方式端到端学习。输入图像特征来自父级高斯的“眼睛”以及目标相机位置的联合条件,有助于学习子级高斯分配以“看见不可见之物”,恢复父级高斯常忽略的遮挡细节。在实验中,我们在 ShapeNet-SRN 和 CO3D 数据集上测试了所提方法,取得了 state-of-the-art 的性能,尤其在输入视角中重建遮挡内容方面表现突出。
引用
@article{arxiv.2405.20310,
title = {A Pixel Is Worth More Than One 3D Gaussians in Single-View 3D Reconstruction},
author = {Jianghao Shen and Nan Xue and Tianfu Wu},
journal= {arXiv preprint arXiv:2405.20310},
year = {2024}
}
备注
preprint, under review