中文

Atlas:基于位姿图像端到端的 3D 场景重建

计算机视觉与模式识别 2020-10-15 v3

摘要

我们提出了一种通过对一组带位姿的 RGB 图像直接回归截断符号距离函数(TSDF)来实现场景端到端 3D 重建的方法。传统的 3D 重建方法依赖于深度图的中间表示,然后再估计场景的完整 3D 模型。我们假设直接回归到 3D 更为有效。一个 2D CNN 独立地从每幅图像中提取特征,随后利用相机内参和外参将这些特征反投影并累加到体素体中。累加之后,一个 3D CNN 对累加的特征进行细化并预测 TSDF 值。此外,无需大量计算即可获得 3D 模型的语义分割。该方法在 Scannet 数据集上进行了评估,在定量和定性上均显著优于最先进的基线方法(深度多视立体匹配后接传统 TSDF 融合)。我们将 3D 语义分割与先前使用深度传感器的方法进行比较,因为此前没有工作仅以 RGB 输入尝试该问题。

关键词

引用

@article{arxiv.2003.10432,
  title  = {Atlas: End-to-End 3D Scene Reconstruction from Posed Images},
  author = {Zak Murez and Tarrence van As and James Bartolozzi and Ayan Sinha and Vijay Badrinarayanan and Andrew Rabinovich},
  journal= {arXiv preprint arXiv:2003.10432},
  year   = {2020}
}