中文

语言能理解深度吗?

计算机视觉与模式识别 2022-09-07 v3 计算与语言 多媒体

摘要

除图像分类外,对比语言-图像预训练(CLIP)在包括目标级与 3D 空间理解在内的广泛视觉任务中取得了非凡成功。然而,将 CLIP 学到的语义知识迁移至更具量化目标的复杂任务(如带几何信息的深度估计)仍具挑战。本文中,我们提出将 CLIP 用于零样本单目深度估计,称为 DepthCLIP。我们发现输入图像的块可对某一语义距离词元作出响应,进而被投影至量化深度区间以进行粗估计。无需任何训练,我们的 DepthCLIP 超越了现有无监督方法,甚至接近早期全监督网络。据我们所知,我们首次实现了从语义语言知识到量化下游任务的零样本适配,并完成了零样本单目深度估计。我们希望本工作能为未来研究照亮方向。代码见 https://github.com/Adonis-galaxy/DepthCLIP。

关键词

引用

@article{arxiv.2207.01077,
  title  = {Can Language Understand Depth?},
  author = {Renrui Zhang and Ziyao Zeng and Ziyu Guo and Yafeng Li},
  journal= {arXiv preprint arXiv:2207.01077},
  year   = {2022}
}