基于掩码对象建模的单目逐物体距离估计
计算机视觉与模式识别
2025-02-05 v2
摘要
逐物体距离估计在监控和自动驾驶等安全至关重要的场景中至关重要。虽然现有方法依赖于几何特征或深度监督特征,但利用自监督学习的尝试寥寥无几。在这方面,本文从掩码图像建模 (MiM) 中汲取灵感,并将其扩展到多物体任务。虽然 MiM 专注于提取全局图像级表示,但在处理图像中的单个物体时却显得力不从心。这对距离估计是不利的,因为远处的物体仅对应图像中微不足道的部分。相反,我们的策略称为掩码对象建模 (MoM),实现了一种新颖的掩码技术应用。简而言之,我们设计了一个辅助目标,用于重建场景中检测到的物体所属的图像部分。训练阶段在单一的统一阶段进行,同时优化掩码目标和下游损失(即距离估计)。我们在标准 KITTI、NuScenes 和 MOTSynth 数据集上的新型参考架构 (DistFormer) 上评估了 MoM 的有效性。我们的评估表明,我们的框架超越了最先进技术 (SoTA),并突出了其强大的正则化特性。MoM 策略增强了从零样本到少样本的能力,涵盖了从合成域到真实域的场景。最后,它进一步提高了模型在存在遮挡或检测不佳物体时的鲁棒性。代码地址:https://github.com/apanariello4/DistFormer
引用
@article{arxiv.2401.03191,
title = {Monocular Per-Object Distance Estimation with Masked Object Modeling},
author = {Aniello Panariello and Gianluca Mancusi and Fedy Haj Ali and Angelo Porrello and Simone Calderara and Rita Cucchiara},
journal= {arXiv preprint arXiv:2401.03191},
year = {2025}
}
备注
Accepted for publication in Computer Vision and Image Understanding (CVIU) 2025