自适应深度转换尺度卷积用于自监督单目深度估计
计算机视觉与模式识别
2026-04-10 v1
摘要
自监督单目深度估计 (MDE) 在过去几年中受到日益关注。场景中的物体,包括物体大小以及不同物体之间的关系,是提取场景结构的主要线索。然而,先前的工作缺乏对由于深度变化导致物体大小变化的显式处理。尤其是在单目视频中,同一物体的大小持续变化,导致大小与深度的歧义。为解决此问题,我们提出一种深度转换尺度卷积 (DcSConv) 增强的单目深度估计框架,通过融合物体深度与物体尺度之间的先验关系,从合适的卷积感受野尺度上提取特征。所提出的 DcSConv 关注卷积滤波器的自适应尺度,而非其局部形状变形。我们证明,卷积滤波器的尺度与其局部变形同样重要(甚至在所评估任务中更为重要)。此外,我们开发了一种深度转换尺度感知融合 (DcS-F),用于自适应融合 DcSConv 特征与常规卷积特征。我们的 DcSConv 增强的单目深度估计框架可作为插即式模块置于现有基于 CNN 的方法之上,以增强常规卷积模块。针对 KITTI 数据集上的 extensive 实验表明,我们的方法在不同基线上取得最佳结果,SqRel 指标提升最高可达 11.6%。消融实验也验证了每个提议模块的有效性。
引用
@article{arxiv.2604.07665,
title = {Adaptive Depth-converted-Scale Convolution for Self-supervised Monocular Depth Estimation},
author = {Yanbo Gao and Huibin Bai and Huasong Zhou and Xingyu Gao and Shuai Li and Xun Cai and Hui Yuan and Wei Hua and Tian Xie},
journal= {arXiv preprint arXiv:2604.07665},
year = {2026}
}
备注
Accepted by IEEE Transactions on Circuits and Systems for Video Technology