中文

用于监督式环视深度估计的邻视Transformer

计算机视觉与模式识别 2025-11-13 v4

摘要

深度估计已被广泛研究,并作为机器人与自动驾驶中三维感知的基础步骤。尽管过去几十年在单目深度估计方面取得了显著进展,但这些尝试主要在仅配备前视相机的KITTI基准上进行,忽略了环视相机间的相关性。本文提出一种用于监督式环视深度估计的邻视Transformer(AVT-SSDepth),以联合预测多个环视相机的深度图。具体而言,我们采用全局到局部的特征提取模块,将CNN与Transformer层结合以获得丰富的表示。此外,提出邻视注意力机制以实现视内与视间特征传播:前者由每个视角内的自注意力模块完成,后者由邻视注意力模块实现,该模块计算多相机间的注意力以在环视特征图间交换多尺度表示。此外,AVT-SSDepth具有强跨数据集泛化能力。大量实验表明,我们的方法在DDAD与nuScenes数据集上均优于现有SOTA方法。代码见 https://github.com/XiandaGuo/SSDepth。

关键词

引用

@article{arxiv.2303.07759,
  title  = {Adjacent-view Transformers for Supervised Surround-view Depth Estimation},
  author = {Xianda Guo and Wenjie Yuan and Yunpeng Zhang and Tian Yang and Chenming Zhang and Zheng Zhu and Qin Zou and Long Chen},
  journal= {arXiv preprint arXiv:2303.07759},
  year   = {2025}
}

备注

This paper has been accepted by IROS 2025