中文

MonoSOWA:一种无需人类标注的可扩展单目 3D 目标检测器

计算机视觉与模式识别 2025-06-23 v3 人工智能 机器学习

摘要

从单一 RGB 相机推断物体的 3D 位置和姿态是计算机视觉中的一项基础性任务,具有众多重要应用。传统的 3D 目标检测方法在完全监督的设置下进行训练,需要 LiDAR 和大量人类标注,这些标注工作繁琐、昂贵,且难以适应不断增长的数据。我们提出了一种 novel 方法,通过单一 RGB 相机训练 3D 目标检测器,而无需领域特定的人类标注,从而使更多数据可用于训练。该方法采用新提出的 Local Object Motion Model 来分离物体运动来源于后续帧之间,速度约为前工作的 700 倍,并补偿相机焦距差异以聚合多个数据集。该方法在三个公开数据集上进行评估,尽管未使用人类标签,仍显著优于先前工作。它还显示出作为 fully-supervised 训练的 pre-training 工具的灵活性,并表明将来自多个数据集的伪标签组合可实现与单一数据集的人类标签相当的准确率。源代码和模型均可在 https://github.com/jskvrna/MonoSOWA 获取。

关键词

引用

@article{arxiv.2501.09481,
  title  = {MonoSOWA: Scalable monocular 3D Object detector Without human Annotations},
  author = {Jan Skvrna and Lukas Neumann},
  journal= {arXiv preprint arXiv:2501.09481},
  year   = {2025}
}