中文

面向全围栏单目深度的尺度不变与视角关系表征学习

计算机视觉与模式识别 2025-12-10 v1

摘要

最近的基础模型在单目深度估计中表现出强大的泛化能力。然而,直接将这些模型应用于全围栏单目深度估计 (FSMDE) 面临两个主要挑战:(1) 高计算成本限制了实时性能,(2) 难以估计计量尺度深度,因为这些模型通常仅训练以预测相对深度。为此,我们提出了一种新颖的知识蒸馏策略,将来自基础模型的鲁棒深度知识蒸馏到轻量级 FSMDE 网络。我们的方法利用一种混合回归框架,将知识蒸馏方案——通常用于分类——与深度分箱模块结合以增强尺度一致性。具体而言,我们引入一种交叉互动知识蒸馏方案,将基础模型的尺度不变深度概率分布蒸馏到学生网络,同时引导其从真实深度中推断计量尺度深度 bin 中心。此外,我们提出了视角关系知识蒸馿,该方法编码相邻相机视角之间的结构关系,并将其传递以增强跨视图深度一致性。在 DDAD 和 nuScenes 上的实验表明,我们的方法优于常规监督方法和现有知识蒸馈方法。此外,我们的方法在性能和效率之间实现了有利的权衡,满足实时要求。

关键词

引用

@article{arxiv.2512.08700,
  title  = {Scale-invariant and View-relational Representation Learning for Full Surround Monocular Depth},
  author = {Kyumin Hwang and Wonhyeok Choi and Kiljoon Han and Wonjoon Choi and Minwoo Choi and Yongcheon Na and Minwoo Park and Sunghoon Im},
  journal= {arXiv preprint arXiv:2512.08700},
  year   = {2025}
}

备注

Accepted at IEEE Robotics and Automation Letters (RA-L) 2026