中文

基于语言的深度提示用于单目深度估计

计算机视觉与模式识别 2024-03-26 v1 人工智能

摘要

单目深度估计(MDE)本质上是模糊的,因为给定图像可能源自许多不同的3D场景,反之亦然。为解决这种模糊性,MDE系统必须对给定输入最可能的3D场景做出假设。这些假设可以是显式的或隐式的。在这项工作中,我们展示了使用自然语言作为关于世界结构的显式先验来源。假设人类语言编码了各种物体在深度空间中的可能分布。我们首先表明,语言模型在训练过程中编码了这种隐式偏差,并且可以通过一种非常简单的学习方法提取出来。然后,我们表明,这种预测可以作为显式假设来源提供给MDE系统,使用现成的实例分割模型提供语言模型输入的标签。我们在NYUD2数据集上展示了我们方法的性能,与基线和随机对照相比有所改进。

关键词

引用

@article{arxiv.2403.15551,
  title  = {Language-Based Depth Hints for Monocular Depth Estimation},
  author = {Dylan Auty and Krystian Mikolajczyk},
  journal= {arXiv preprint arXiv:2403.15551},
  year   = {2024}
}

备注

8 pages, 1 figure. Work originally done in June 2022