中文

基于最后一层的特征重组合:在 DINOv3 中释放3D几何知识用于单目深度估计

计算机视觉与模式识别 2026-04-30 v1

摘要

单目深度估计(MDE)是一项基本且固有难题。最近的视觉基础模型(VFMs),特别是基于 DINO 的变换器,显著提高了密集预测的准确性和泛化能力。先前的工作通常遵循统一范式:在均匀间隔采样固定的一组中间变换层以构建多尺度特征。这种常见做法隐式假设几何信息在各层中均匀分布,可能未充分利用 VFMs 中编码的结构3D线索。在本研究中,我们对 DINOv3 进行系统的层级分析,揭示3D信息分布非均匀:更深的层显示出更强的深度可预测性和更好地捕捉样本间的几何变异。针对这一发现,我们引入最后一层中心特征重组合(Last-Layer-Centric Feature Recombination, LFR)模块以增强几何表达性。LFR 将最终层作为几何锚点,并根据最小相似性准则自适应选择互补中间层。选取的特征通过紧凑的线性适配器与最后一层表示融合。大量实验表明,LFR 模块持续改善了 MDE 的准确性,并实现了最先进的性能。我们的分析阐明了几何知识在 VFMs 中的组织方式,并为在密集3D任务中释放其潜能提供了一种有效策略。

关键词

引用

@article{arxiv.2604.26454,
  title  = {Last-Layer-Centric Feature Recombination: Unleashing 3D Geometric Knowledge in DINOv3 for Monocular Depth Estimation},
  author = {Gongshu Wang and Zhirui Wang and Kan Yang},
  journal= {arXiv preprint arXiv:2604.26454},
  year   = {2026}
}

备注

18page, 6 figure, 6 table