3D Former:基于 3D SDF Transformer 的单目场景重建
计算机视觉与模式识别
2023-03-10 v2 人工智能
摘要
从带位姿图像进行单目场景重建由于大型环境的复杂性而具有挑战性。近期的体素方法学习直接预测 TSDF 体素,并在此任务中展示了有前景的结果。然而,大多数方法聚焦于如何提取并融合 2D 特征到 3D 特征体素,却无一改进 3D 体素聚合的方式。在本工作中,我们提出一个 SDF transformer 网络,以替代 3D CNN 的作用从而实现更好的 3D 特征聚合。为降低 3D 多头注意力的爆炸式计算复杂度,我们提出一个稀疏窗口注意力模块,其中注意力仅在局部窗口内非空体素之间计算。随后构建了一个自顶向下-自底向上的 3D 注意力网络用于 3D 特征聚合,其中提出了膨胀注意力结构以防止几何退化,并采用两个全局模块以具备全局感受野。在多个数据集上的实验表明,该 3D transformer 网络生成了更准确且更完整的重建,大幅优于先前方法。值得注意的是,在 ScanNet 数据集上网格精度提升了 41.8%,网格完整度提升了 25.3%。项目页面:https://weihaosky.github.io/sdfformer。
引用
@article{arxiv.2301.13510,
title = {3D Former: Monocular Scene Reconstruction with 3D SDF Transformers},
author = {Weihao Yuan and Xiaodong Gu and Heng Li and Zilong Dong and Siyu Zhu},
journal= {arXiv preprint arXiv:2301.13510},
year = {2023}
}
备注
Accepted to ICLR 2023