中文

用于单目深度估计的深度相对自注意力

计算机视觉与模式识别 2023-04-26 v1

摘要

单目深度估计非常具有挑战性,因为单张RGB图像中精确深度的线索是不完整的。为克服该限制,深度神经网络依赖于从RGB信息中提取的各种视觉提示,如大小、阴影和纹理。然而,我们观察到,如果过度利用此类提示,网络可能会偏向RGB信息而忽略综合视角。我们提出了一种名为相对深度Transformer(RElative Depth Transformer, RED-T)的新型深度估计模型,该模型在自注意力中使用相对深度作为引导。具体而言,模型对较近深度的像素赋予高注意力权重,对较远深度的像素赋予低注意力权重。结果,相似深度的特征彼此更可能相似,从而不易被误用的视觉提示干扰。我们表明所提模型在单目深度估计基准上取得了有竞争力的结果,且对RGB信息的偏向更小。此外,我们提出了一种新型单目深度估计基准,在训练期间限制可观测深度范围,以评估模型对未见深度的鲁棒性。

关键词

引用

@article{arxiv.2304.12849,
  title  = {Depth-Relative Self Attention for Monocular Depth Estimation},
  author = {Kyuhong Shim and Jiyoung Kim and Gusang Lee and Byonghyo Shim},
  journal= {arXiv preprint arXiv:2304.12849},
  year   = {2023}
}

备注

Accepted for IJCAI 2023