中文

利用多源辅助任务增强单目深度估计

计算机视觉与模式识别 2025-04-14 v1

摘要

单目深度估计 (MDE) 是计算机视觉中的一项具有挑战性的任务,通常受到高质量标注数据集的成本和稀缺性的阻碍。我们使用来自相关视觉任务的辅助数据集来解决这一挑战,采用基于预训练视觉基础模型构建的共享解码器进行交替训练方案,同时赋予 MDE 更高的权重。通过广泛的实验,我们证明了纳入各种域内辅助数据集和任务可将 MDE 质量平均提高约 11%。我们的实验分析表明,辅助任务具有不同的影响,证实了任务选择的重要性,并强调仅仅添加数据并不能带来质量提升。值得注意的是,我们的研究表明,将语义分割数据集用作多标签密集分类 (MLDC) 通常会带来额外的质量提升。最后,我们的方法显著提高了所考虑的 MDE 数据集的数据效率,在将其规模减少至少 80% 的同时提高了其质量。这为在高质量标注数据可用性有限的情况下,利用来自相关任务的辅助数据来提高 MDE 质量铺平了道路。代码可在 https://jugit.fz-juelich.de/ias-8/mdeaux 获取。

关键词

引用

@article{arxiv.2501.12824,
  title  = {Enhancing Monocular Depth Estimation with Multi-Source Auxiliary Tasks},
  author = {Alessio Quercia and Erenus Yildiz and Zhuo Cao and Kai Krajsek and Abigail Morrison and Ira Assent and Hanno Scharr},
  journal= {arXiv preprint arXiv:2501.12824},
  year   = {2025}
}

备注

Paper accepted at WACV 2025