语言能理解深度吗?
计算机视觉与模式识别
2022-09-07 v3 计算与语言
多媒体
摘要
除图像分类外,对比语言-图像预训练(CLIP)在包括目标级与 3D 空间理解在内的广泛视觉任务中取得了非凡成功。然而,将 CLIP 学到的语义知识迁移至更具量化目标的复杂任务(如带几何信息的深度估计)仍具挑战。本文中,我们提出将 CLIP 用于零样本单目深度估计,称为 DepthCLIP。我们发现输入图像的块可对某一语义距离词元作出响应,进而被投影至量化深度区间以进行粗估计。无需任何训练,我们的 DepthCLIP 超越了现有无监督方法,甚至接近早期全监督网络。据我们所知,我们首次实现了从语义语言知识到量化下游任务的零样本适配,并完成了零样本单目深度估计。我们希望本工作能为未来研究照亮方向。代码见 https://github.com/Adonis-galaxy/DepthCLIP。
引用
@article{arxiv.2207.01077,
title = {Can Language Understand Depth?},
author = {Renrui Zhang and Ziyao Zeng and Ziyu Guo and Yafeng Li},
journal= {arXiv preprint arXiv:2207.01077},
year = {2022}
}