中文

ObjCAViT:利用自然语言模型与图像-物体交叉注意力改进单目深度估计

计算机视觉与模式识别 2022-12-01 v1 机器学习

摘要

尽管单目深度估计(MDE)是计算机视觉中的一个重要问题,但由于将 3D 场景压缩为仅 2 个维度所带来的歧义性,它十分困难。该领域的常见做法是将之视为简单的图像到图像翻译,而不考虑场景及其内物体的语义。相比之下,人类和动物已被证明使用更高层次的信息来解决 MDE:关于场景中物体性质、其位置及彼此间可能构型的先验知识,以及其表观尺寸,均已被证明有助于消除该歧义。在本文中,我们提出一种新方法,通过鼓励利用关于场景中物体语义及物体间关系的已知有用信息来提升 MDE 性能。我们新颖的 ObjCAViT 模块从语言模型中获取世界知识,并使用 transformer 注意力在 MDE 问题背景下学习物体间关系,同时纳入表观尺寸信息。我们的方法生成高度准确的深度图,并在 NYUv2 和 KITTI 数据集上取得了具竞争力的结果。我们的消融实验表明,在 ObjCAViT 模块中使用语言和交叉注意力提升了性能。代码发布于 https://github.com/DylanAuty/ObjCAViT。

关键词

引用

@article{arxiv.2211.17232,
  title  = {ObjCAViT: Improving Monocular Depth Estimation Using Natural Language Models And Image-Object Cross-Attention},
  author = {Dylan Auty and Krystian Mikolajczyk},
  journal= {arXiv preprint arXiv:2211.17232},
  year   = {2022}
}

备注

9 pages, 4 figures. Code is released at https://github.com/DylanAuty/ObjCAViT