面向数据高效的单目 3D 目标检测的对象-场景-相机分解与重组
计算机视觉与模式识别
2026-03-10 v1 机器人学
摘要
单目 3D 目标检测 (M3OD) 本质上是不确定的,因此训练高性能基于深度学习的 M3OD 模型需要大量来自多样化场景、各种对象和相机姿态的复杂视觉变化的标记数据。然而,我们注意到由于强烈的人类偏见,三个独立实体,即对象、场景和相机姿态,总是以紧密 entanglement 的方式出现在构建训练数据时。更具体地说,特定的 3D 对象总是以特定场景和固定相机姿态捕获的,从而缺乏必要的多样性。这种紧密的 entanglement 导致了样本不足和对统一训练数据的过拟合等挑战性问题。为缓解此问题,我们提出了一种用于更高效利用训练数据的在线对象-场景-相机分解与重组数据操作方案。我们首先以高效的计算和存储方式将训练图像完全分解为带纹理的 3D 对象点模型和背景场景。随后,我们通过将 3D 对象插入背景场景的自由空间并使用来自带纹理 3D 点表示的扰动相机姿态进行渲染,在每个 epoch 持续重组新的训练图像。如此一来,所有 epoch 中的刷新后训练数据可覆盖对象、场景和相机姿态组合的完整范畴。这一方案可作为插即用组件来提升 M3OD 模型,灵活适用于完全监督和稀疏监督两种设置。在稀疏监督设置中,对所有实例最靠近 ego 摄像机的对象进行稀疏标注。我们然后可以灵活地控制标注对象的数量以控制标注成本。对于验证,我们的方法广泛应用于五个代表性 M3OD 模型,并在 KITTI 和更复杂的 Waymo 数据集上进行评估。
关键词
引用
@article{arxiv.2602.20627,
title = {Object-Scene-Camera Decomposition and Recomposition for Data-Efficient Monocular 3D Object Detection},
author = {Zhaonian Kuang and Rui Ding and Meng Yang and Xinhu Zheng and Gang Hua},
journal= {arXiv preprint arXiv:2602.20627},
year = {2026}
}
备注
IJCV