中文

遮挡边界与深度:基于多任务学习的相互增强

计算机视觉与模式识别 2025-12-01 v3

摘要

遮挡边界估计(Occlusion Boundary Estimation, OBE)旨在识别由物体间遮挡及单个物体内部自遮挡所产生的边界。该任务与从单张图像推断深度的单目深度估计(Monocular Depth Estimation, MDE)密切相关,因为遮挡边界(Occlusion Boundaries, OBs)为解决深度歧义提供了关键的几何线索,反之,深度亦能细化遮挡推理。本文旨在系统地建模并利用这种互惠关系。为此,我们提出了 MoDOT,一种用于联合估计深度与遮挡边界的新框架,该框架引入了全新的交叉注意力条带模块(Cross-Attention Strip Module, CASM)以利用中层 OB 特征进行深度预测,并提出了全新的 OB-Depth 约束损失(OB-Depth Constraint Loss, OBDCL)以强制几何一致性。为促进本研究,我们贡献了 OB-Hypersim,一个具有精确深度及处理了自遮挡的 OB 标注的大规模真实感数据集。在两个合成数据集和 NYUD-v2 上的大量实验表明,MoDOT 的性能显著优于单任务基线及多任务竞争方法。此外,仅在合成数据上训练的模型在无需微调的情况下,对真实场景展现出强大的泛化能力,生成的深度图具有更清晰的边界和更高的几何保真度。总而言之,这些结果突显了联合建模 OBs 与深度的显著优势。代码与资源可在 https://github.com/xul-ops/MoDOT 获取。

关键词

引用

@article{arxiv.2505.21231,
  title  = {Occlusion Boundary and Depth: Mutual Enhancement via Multi-Task Learning},
  author = {Lintao Xu and Yinghao Wang and Chaohui Wang},
  journal= {arXiv preprint arXiv:2505.21231},
  year   = {2025}
}

备注

WACV 2026