DID-M3D:解耦实例深度用于单目3D目标检测
计算机视觉与模式识别
2022-07-25 v2
摘要
单目3D检测因其低成本与设置简便而受到社区广泛关注。它以RGB图像为输入并在3D空间中预测3D框。最具挑战性的子任务在于实例深度估计。以往工作通常采用直接估计方法。然而,本文指出RGB图像上的实例深度是非直观的。它由视觉深度线索与实例属性线索耦合而成,难以在网络中直接学习。因此,我们提出将实例深度重构为实例视觉表面深度(视觉深度)与实例属性深度(属性深度)的组合。视觉深度与物体在图像上的外观和位置相关。相比之下,属性深度依赖于物体的固有属性,其对图像上物体的仿射变换保持不变。相应地,我们将3D定位不确定性解耦为视觉深度不确定性与属性深度不确定性。通过组合不同类型的深度及关联不确定性,可获得最终实例深度。此外,由于物理本质限制,单目3D检测中的数据增强通常受限,阻碍了性能提升。基于所提出的实例深度解耦策略,我们可缓解该问题。在KITTI上评估,我们的方法取得了新的SOTA结果,且大量消融研究验证了方法中各组件的有效性。代码发布于https://github.com/SPengLiang/DID-M3D。
引用
@article{arxiv.2207.08531,
title = {DID-M3D: Decoupling Instance Depth for Monocular 3D Object Detection},
author = {Liang Peng and Xiaopei Wu and Zheng Yang and Haifeng Liu and Deng Cai},
journal= {arXiv preprint arXiv:2207.08531},
year = {2022}
}
备注
ECCV 2022