Atlas:基于位姿图像端到端的 3D 场景重建
计算机视觉与模式识别
2020-10-15 v3
摘要
我们提出了一种通过对一组带位姿的 RGB 图像直接回归截断符号距离函数(TSDF)来实现场景端到端 3D 重建的方法。传统的 3D 重建方法依赖于深度图的中间表示,然后再估计场景的完整 3D 模型。我们假设直接回归到 3D 更为有效。一个 2D CNN 独立地从每幅图像中提取特征,随后利用相机内参和外参将这些特征反投影并累加到体素体中。累加之后,一个 3D CNN 对累加的特征进行细化并预测 TSDF 值。此外,无需大量计算即可获得 3D 模型的语义分割。该方法在 Scannet 数据集上进行了评估,在定量和定性上均显著优于最先进的基线方法(深度多视立体匹配后接传统 TSDF 融合)。我们将 3D 语义分割与先前使用深度传感器的方法进行比较,因为此前没有工作仅以 RGB 输入尝试该问题。
引用
@article{arxiv.2003.10432,
title = {Atlas: End-to-End 3D Scene Reconstruction from Posed Images},
author = {Zak Murez and Tarrence van As and James Bartolozzi and Ayan Sinha and Vijay Badrinarayanan and Andrew Rabinovich},
journal= {arXiv preprint arXiv:2003.10432},
year = {2020}
}