中文

消失深度:一种带位置深度编码的深度适配器用于通用图像编码器

计算机视觉与模式识别 2025-03-27 v1 人工智能

摘要

广义的度量深度理解是精确视觉引导机器人必不可少的能力,而当前最先进(SOTA)视觉编码器并不支持这一能力。为此,我们提出了消失深度,这是一种自监督训练方法,可将预训练的RGB编码器扩展以整合并对齐度量深度到其特征嵌入中。基于我们新颖的位置深度编码,我们实现了稳定的深度密度和深度分布不变的特征提取。我们在一系列相关RGBD下游任务上实现了性能提升和SOTA结果——无需对编码器进行微调。最显著的是,我们在SUN-RGBD分割上达到了56.05 mIoU,在Void的深度完成上达到88.3 RMSE,在NYUv2场景分类上达到83.8 Top 1准确率。在6D物体姿态估计中,我们超过了DinoV2、EVA-02和Omnivore的前辈,并在多个相关RGBD下游任务中实现了非微调编码器的SOTA结果。

关键词

引用

@article{arxiv.2503.19947,
  title  = {Vanishing Depth: A Depth Adapter with Positional Depth Encoding for Generalized Image Encoders},
  author = {Paul Koch and Jörg Krüger and Ankit Chowdhury and Oliver Heimann},
  journal= {arXiv preprint arXiv:2503.19947},
  year   = {2025}
}

备注

Preprint