中文

VoRTX:基于Transformer的体素级视图选择与融合三维体素重建

计算机视觉与模式识别 2021-12-02 v1 机器学习

摘要

近期的体素三维重建方法可以生成非常精确的结果,即使对于未观测到的表面也能给出合理的几何结构。然而,在多视图融合方面它们面临一个不理想的权衡。它们可以通过全局平均融合所有可用视图信息,从而丢失精细细节,或者可以通过启发式聚类视图进行局部融合,从而限制其联合考虑所有视图的能力。我们的核心见解是,通过学习的、以相机位姿和图像内容为条件的视图融合函数,可以在不限制视图多样性的情况下保留更多细节。我们提出使用transformer学习这种多视图融合。为此,我们引入了VoRTX,一种端到端的体素三维重建网络,使用transformers进行宽基线多视图特征融合。我们的模型具有遮挡感知能力,利用transformer架构预测初始的投影场景几何估计。该估计用于避免将图像特征反向投影穿过表面进入被遮挡区域。我们在ScanNet上训练模型,并表明其生成的重建结果优于最先进的方法。我们还展示了无需任何微调的泛化能力,在TUM-RGBD和ICL-NUIM另外两个数据集上优于相同的最先进方法。

关键词

引用

@article{arxiv.2112.00236,
  title  = {VoRTX: Volumetric 3D Reconstruction With Transformers for Voxelwise View Selection and Fusion},
  author = {Noah Stier and Alexander Rich and Pradeep Sen and Tobias Höllerer},
  journal= {arXiv preprint arXiv:2112.00236},
  year   = {2021}
}

备注

3DV 2021