中文

用于通用深度完成的尺度传播网络

计算机视觉与模式识别 2024-10-25 v1

摘要

深度完成(depth completion)指从稀疏测量推断稠密深度图,是实现稳健三维感知的关键任务。尽管深度学习方法在该问题上取得了显著进展,但这些模型无法很好地跨越训练中未观察到的不同场景,这一问题尚未得到解决。对现有深度神经网络架构进行仔细分析,这些架构大多借鉴了用于图像分析任务成功的主干网络,发现关键设计瓶颈实际上存在于常规归一化层中。这些归一化层一方面旨在使训练更稳定,另一方面旨在构建跨场景尺度的视觉不变性。然而在深度完成中,尺度实际上正是我们希望稳健估计的东西,以便更好地泛化到未见的场景。为此,我们提出了一种新颖的尺度传播归一化(SP-Norm)方法,用于从输入传播尺度,同时保持归一化算子以便于收敛。具体而言,我们使用来自单个感知机的学习特征对输入进行缩放,而不是像常规归一化层那样直接归一化输入。我们然后基于 SP-Norm 和 ConvNeXt V2 主干网络开发了新的网络架构。我们探索了各种基本模块和架构的组合,以实现通用深度完成的卓越性能和高效推理。在六个未见数据集上进行了大量实验,涉及各种类型的稀疏深度图,即随机抽取的 0.1\%/1\%/10\% 有效像素、4/8/16/32/64 行激光点,以及结构光中的孔洞。我们的模型在与 SOTA 方法相比时,始终以更好的精度、更快的速度和更低的内存占用实现最佳性能。

关键词

引用

@article{arxiv.2410.18408,
  title  = {Scale Propagation Network for Generalizable Depth Completion},
  author = {Haotian Wang and Meng Yang and Xinhu Zheng and Gang Hua},
  journal= {arXiv preprint arXiv:2410.18408},
  year   = {2024}
}

备注

Major revision in IEEE Transactions on Pattern Analysis and Machine Intelligence