Amodal Depth Anything:野外的非对称深度估计
计算机视觉与模式识别
2024-12-04 v1
摘要
非对称深度估计旨在预测场景中被遮挡(不可见)物体部分的深度。这一任务旨在探讨模型能否基于可见线索有效感知遮挡区域的几何结构。以往方法主要依赖合成数据集,专注于度量深度估计,由于领域迁移和可扩展性挑战,限制了其在现实世界环境中的泛化。在本文中,我们提出了野外非对称深度估计的新型表述,专注于相对深度预测以提高模型在多样化自然图像上的泛化。我们引入一个大规模数据集,野外非对称深度(ADIW),通过可扩展的管道利用分割数据集和合成技术创建。深度图使用大型预训练深度模型生成,采用比例与偏移对齐策略对深度预测进行细化和混合,以确保ground-truth标注的一致性。为解决非对称深度任务,我们提出了两种互补框架:基于Depth Anything V2的确定性模型Amodal-DAV2,以及集成条件流匹配原理的生成模型Amodal-DepthFM。我们提出的框架有效利用了大型预训练模型的能力,仅需轻微修改即可实现高质量的非对称深度预测。实验验证了我们的设计选择,展示了模型在生成遮挡区域多样化、合理深度结构方面的灵活性。我们的方法在ADIW数据集上实现了比以前SOTA的69.5%精度提升。
引用
@article{arxiv.2412.02336,
title = {Amodal Depth Anything: Amodal Depth Estimation in the Wild},
author = {Zhenyu Li and Mykola Lavreniuk and Jian Shi and Shariq Farooq Bhat and Peter Wonka},
journal= {arXiv preprint arXiv:2412.02336},
year = {2024}
}