DeCoTR:利用 2D 与 3D 注意力增强深度补全
计算机视觉与模式识别
2024-03-20 v1
摘要
在本文中,我们引入了一种新颖的方法,该方法同时利用 2D 和 3D 注意力来实现高精度的深度补全,而无需迭代的空间传播。具体来说,我们首先通过在瓶颈层和跳跃连接中对 2D 特征应用注意力来增强一个基线卷积深度补全模型。这有效提升了该简单网络的性能,使其与最新的复杂 Transformer 模型不相上下。利用该网络生成的初始深度和特征,我们将 2D 特征提升以形成 3D 点云,并构建一个 3D 点 Transformer 对其进行处理,使模型能够显式地学习和利用 3D 几何特征。此外,我们提出了处理点云的归一化技术,这改善了学习过程,并比直接使用现成的点 Transformer 获得了更好的精度。我们还对下采样的点云特征引入了全局注意力,这实现了长程上下文感知,同时仍保持计算可行性。我们在包括 NYU Depth V2 和 KITTI 在内的既定深度补全基准上评估了我们的方法 DeCoTR,展示了其设定了新的最先进性能。我们进一步在 ScanNet 和 DDAD 基准上进行了零样本评估,证明 DeCoTR 与现有方法相比具有卓越的泛化能力。
引用
@article{arxiv.2403.12202,
title = {DeCoTR: Enhancing Depth Completion with 2D and 3D Attentions},
author = {Yunxiao Shi and Manish Kumar Singh and Hong Cai and Fatih Porikli},
journal= {arXiv preprint arXiv:2403.12202},
year = {2024}
}
备注
Accepted at CVPR 2024