中文

SPACE-CLIP:基于自适应 CLIP 嵌入的单目深度估计空间感知

计算机视觉与模式识别 2026-03-24 v3

摘要

机器人和自主系统需要密集的空间线索,但许多单目深度模型笨重、任务特定或难以融合到现有的多模态堆栈中。CLIP 提供了强大的语义表示,但大多数基于 CLIP 的深度方法仍依赖文本提示或背部更新,这些方法在集成控制管道中部署复杂。我们提出 SPACE-CLIP,一个仅使用解码器的深度框架,从冻结的 CLIP 视觉编码器中直接读取几何线索,在推理时绕过文本编码器。该模型将来自深层 FiLM 条件语义特征与来自浅层结构特征相结合,以恢复全局场景布局和局部几何细节。在 TFI-FB 约束下(文本自由推理和冻结视觉背bone),SPACE-CLIP 在 KITTI 上达到 AbsRel 0.0901,在 NYU Depth V2 上达到 0.1042,相同的双路径解码器也能转移到冻结的 SigLIP 背bone并取得相当结果。这些发现表明,紧凑的解码器可以将共享基础模型背bone 转化为为具身 AI 和自主机器人系统提供的可重用空间感知模块。我们的模型可在 https://github.com/taewan2002/space-clip 获取。

关键词

引用

@article{arxiv.2601.17657,
  title  = {SPACE-CLIP: Spatial Perception via Adaptive CLIP Embeddings for Monocular Depth Estimation},
  author = {Taewan Cho and Taeryang Kim and Andrew Jaeyong Choi},
  journal= {arXiv preprint arXiv:2601.17657},
  year   = {2026}
}