中文

无监督运动恢复结构中的 Transformer

计算机视觉与模式识别 2023-12-19 v1 人工智能

摘要

Transformer 凭借其提升的性能以及对自然损坏和对抗攻击的鲁棒性,彻底改变了基于深度学习的计算机视觉。Transformer 主要用于 2D 视觉任务,包括图像分类、语义分割和目标检测。然而,机器人和高级驾驶辅助系统也需要通过提取运动恢复结构(SfM)来进行 3D 场景理解以做出决策。我们提出了一种基于 Transformer 的鲁棒单目 SfM 方法,该方法学习同时预测单像素级深度、自车平移与旋转,以及相机焦距和主点。通过在 KITTI 和 DDAD 数据集上的实验,我们展示了如何适配不同的视觉 Transformer,并将其与当代基于 CNN 的方法进行比较。我们的研究表明,基于 Transformer 的架构虽然在运行时效率较低,但实现了可比的性能,同时对自然损坏以及无目标和有目标攻击具有更强的鲁棒性。

关键词

引用

@article{arxiv.2312.10529,
  title  = {Transformers in Unsupervised Structure-from-Motion},
  author = {Hemang Chawla and Arnav Varma and Elahe Arani and Bahram Zonooz},
  journal= {arXiv preprint arXiv:2312.10529},
  year   = {2023}
}

备注

International Joint Conference on Computer Vision, Imaging and Computer Graphics. Cham: Springer Nature Switzerland, 2022. Published at "Communications in Computer and Information Science, vol 1815. Springer Nature". arXiv admin note: text overlap with arXiv:2202.03131