中文

未知相机内参下自监督单目深度估计中的 Transformer 应用

计算机视觉与模式识别 2023-02-03 v1 人工智能

摘要

自动驾驶与高级驾驶辅助系统的出现需要计算机视觉在 3D 场景理解方面持续发展。自监督单目深度估计——一种无需真实标签即可从单相机进行物体像素级距离估计的方法——是 3D 场景理解中的一项重要任务。然而,该任务的现有方法局限于卷积神经网络(CNN)架构。与使用局部线性运算且跨层丢失特征分辨率的 CNN 不同,视觉 Transformer 在每个阶段以恒定分辨率处理并具全局感受野。尽管近期工作已比较了 Transformer 与 CNN 对应方法在图像分类等任务上的表现,尚无研究考察使用 Transformer 进行自监督单目深度估计的影响。在此,我们首先展示如何使视觉 Transformer 适应自监督单目深度估计。此后,我们比较 Transformer 与基于 CNN 的架构在 KITTI 深度预测基准上的性能,以及它们对自然损坏和对抗攻击的鲁棒性,包括在相机内参未知时。我们的研究表明,基于 Transformer 的架构尽管运行效率较低,却取得了可比性能且更具鲁棒性与泛化性。

关键词

引用

@article{arxiv.2202.03131,
  title  = {Transformers in Self-Supervised Monocular Depth Estimation with Unknown Camera Intrinsics},
  author = {Arnav Varma and Hemang Chawla and Bahram Zonooz and Elahe Arani},
  journal= {arXiv preprint arXiv:2202.03131},
  year   = {2023}
}

备注

Published in 17th International Conference on Computer Vision Theory and Applications (VISAP, 2022)