中文

MonoPlace3D:面向3D单目检测的3D感知对象放置学习

计算机视觉与模式识别 2025-04-11 v2

摘要

当前的单目3D检测器受限于真实世界数据集的多样性和规模。虽然数据增强当然有所帮助,但为户外场景生成逼真的场景感知增强数据尤其困难。大多数当前的合成数据生成方法侧重于通过改进渲染技术实现逼真的物体外观。然而,我们表明,物体的位置和放置方式对训练有效的3D单目检测器至关重要。关键难题在于自动确定逼真的对象放置参数——包括位置、尺寸和方向性对齐 when 将合成物体引入实际场景。为此,我们提出MonoPlace3D,一个考虑3D场景内容以创建逼真增强数据的新系统。具体地,给定背景场景,MonoPlace3D学习一组合理3D边界框的分布。随后,我们根据从该分布中采样的位置渲染逼真的物体并进行放置。我们在两个标准数据集KITTI和NuScenes上的全面评估表明,MonoPlace3D显著提高了多个现有单目3D检测器的准确率,同时数据效率极高。

关键词

引用

@article{arxiv.2504.06801,
  title  = {MonoPlace3D: Learning 3D-Aware Object Placement for 3D Monocular Detection},
  author = {Rishubh Parihar and Srinjay Sarkar and Sarthak Vora and Jogendra Kundu and R. Venkatesh Babu},
  journal= {arXiv preprint arXiv:2504.06801},
  year   = {2025}
}

备注

CVPR 2025 Camera Ready. Project page - https://rishubhpar.github.io/monoplace3D