混合粒度特征聚合与由粗到细语言引导的自监督单目深度估计
计算机视觉与模式识别
2025-10-13 v1
摘要
当前的自监督单目深度估计(MDE)方法由于语义-空间知识提取不足而面临性能瓶颈。为应对这一挑战,我们提出 Hybrid-depth,一个新颖框架,系统地整合基础模型(如 CLIP 和 DINO)以提取视觉先验并获取 MDE 所需的充分上下文信息。我们的方法引入了一种由粗到细的渐进学习框架:1)首先,我们在对比语言引导下聚合来自 CLIP(全局语义)和 DINO(局部空间细节)的多粒度特征。设计了一个比较近距图像块的代理任务,利用文本提示强制深度感知特征对齐;2)接下来,基于粗特征,我们整合相机位姿信息和逐像素语言对齐以细化深度预测。该模块可作为即插即用的深度编码器无缝集成到现有的自监督 MDE 流水线(如 Monodepth2、ManyDepth)中,增强连续深度估计。通过语言引导聚合 CLIP 的语义上下文和 DINO 的空间细节,我们的方法有效解决了特征粒度不匹配问题。在 KITTI 基准上的大量实验表明,我们的方法在所有指标上显著优于 SOTA 方法,这也确实有利于 BEV 感知等下游任务。代码可在 https://github.com/Zhangwenyao1/Hybrid-depth 获取。
引用
@article{arxiv.2510.09320,
title = {Hybrid-grained Feature Aggregation with Coarse-to-fine Language Guidance for Self-supervised Monocular Depth Estimation},
author = {Wenyao Zhang and Hongsi Liu and Bohan Li and Jiawei He and Zekun Qi and Yunnan Wang and Shengyang Zhao and Xinqiang Yu and Wenjun Zeng and Xin Jin},
journal= {arXiv preprint arXiv:2510.09320},
year = {2025}
}
备注
ICCV 2025