中文

PLOT:基于视频对象跟踪的伪标签生成用于可扩展的单目3D目标检测

计算机视觉与模式识别 2025-07-08 v1 图形学

摘要

单目3D目标检测(M3OD)长期面临数据稀缺的挑战,这源于高标注成本和固有的2D到3D 模糊。虽然提出了各种弱监督方法和伪标签方法来解决这些问题,但它们大多受限于特定领域的学习,或仅依赖单次观察的形状信息。在本文中,我们提出了一种新型伪标签框架,只使用视频数据且对遮挡更鲁棒,不需要多视角设置、额外传感器、相机姿态或特定领域的训练。具体而言,我们探索了一种技术,用于聚合静态和动态对象在相邻时间帧中的伪 LiDAR,以实现在无法获取3D数据获取的场景中的3D属性提取。广泛的实验表明,我们的方法确保了可靠的准确性和强大的可扩展性,使其成为 M3OD 的实用且有效的解决方案。

关键词

引用

@article{arxiv.2507.02393,
  title  = {PLOT: Pseudo-Labeling via Video Object Tracking for Scalable Monocular 3D Object Detection},
  author = {Seokyeong Lee and Sithu Aung and Junyong Choi and Seungryong Kim and Ig-Jae Kim and Junghyun Cho},
  journal= {arXiv preprint arXiv:2507.02393},
  year   = {2025}
}

备注

18 pages, 16 figures