中文

可聚焦单目深度估计

计算机视觉与模式识别 2026-05-13 v1 人工智能

摘要

单目深度基础模型在不同场景中具有良好的泛化能力,但它们通常使用均匀的像素级目标进行优化,不区分用户指定或任务相关的目标区域与周围环境。因此,我们引入了可聚焦单目深度估计(FDE),这是一个区域感知的深度估计任务,要求在给定指定目标区域的情况下,模型需优先考虑前景深度精度、保持清晰的边界过渡,并维持连贯的全局场景几何。为优先处理任务关键区域的建模,我们提出了FocusDepth,一个基于提示条件的单目相对深度估计框架,通过边界框/文本提示引导深度建模聚焦于目标区域。FocusDepth中的核心组件多尺度空间对齐融合(MSSA)将来自Segment Anything Model 3的多尺度特征与Depth Anything系列模型进行空间对齐,并通过尺度特定的门控条件融合将其注入。这使得密集的提示线索注入成为可能,而不会破坏几何表示,从而赋予深度估计模型聚焦感知的能力。为研究FDE,我们建立了FDE-Bench,这是一个以目标为中心的单目相对深度基准,由来自五个数据集的图像-目标-深度三元组构建而成,包含252.9K/72.5K的训练/验证三元组和972个类别,涵盖真实世界和具身仿真环境。在FDE-Bench上,FocusDepth在边界框和文本提示下,均持续优于全局微调的DA2/DA3基线模型,最大的增益出现在目标边界和前景区域,同时保持了全局场景几何。消融研究表明,MSSA的空间对齐是关键设计因素,因为破坏提示与几何的对应关系会导致AbsRel增加高达13.8%。

关键词

引用

@article{arxiv.2605.11756,
  title  = {Focusable Monocular Depth Estimation},
  author = {Yuxin Du and Tao Lin and Zile Zhong and Runting Li and Xiyao Chen and Jiting Liu and Chenglin Liu and Ying-Cong Chen and Yuqian Fu and Bo Zhao},
  journal= {arXiv preprint arXiv:2605.11756},
  year   = {2026}
}