中文

CCNeXt:一种有效的自监督立体深度估计方法

计算机视觉与模式识别 2025-09-29 v1

摘要

深度估计在机器人、自动驾驶车辆和增强现实等近期应用中扮演着至关重要的角色。这些场景通常在计算能力所施加的约束下运行。立体图像对为深度估计提供了一种有效的解决方案,因为它只需估计图像对中像素的视差即可在已知的校正系统中确定深度。由于在各种场景下难以获取可靠的真实深度数据,自监督技术成为一种解决方案,特别是在有大量未标注数据集可用时。我们提出了一种新颖的自监督卷积方法,它在平衡计算成本的同时,性能优于现有的最先进卷积神经网络(CNN)和视觉 Transformer(ViT)。所提出的 CCNeXt 架构在编码器中采用现代 CNN 特征提取器与新颖的窗口化极线交叉注意力模块,并对深度估计解码器进行了全面重新设计。我们的实验表明,CCNeXt 在 KITTI Eigen Split 测试数据上取得了具有竞争力的指标,同时比当前最佳模型快 10.18×\times 倍,并且与近期提出的技术相比,在 KITTI Eigen Split 改进真实数据和 Driving Stereo 数据集上的所有指标均取得了最先进的结果。为确保完全可复现性,我们的项目可在 \href{https://github.com/alelopes/CCNext}{\texttt{https://github.com/alelopes/CCNext}} 访问。

关键词

引用

@article{arxiv.2509.22627,
  title  = {CCNeXt: An Effective Self-Supervised Stereo Depth Estimation Approach},
  author = {Alexandre Lopes and Roberto Souza and Helio Pedrini},
  journal= {arXiv preprint arXiv:2509.22627},
  year   = {2025}
}