基于无标签视频学习移动物体检测器:MOD-UV 方法
计算机视觉与模式识别
2024-08-01 v3
摘要
具身智能体必须检测并定位感兴趣的物体,例如自动驾驶汽车中的交通参与者。此任务的监督形式为边界框极其昂贵。因此,先前的工作关注无监督的实例检测和分割,但在缺乏标记边界框的情况下,像素如何分组到物体以及哪些物体值得关注尚不明确。这导致过度或不足分割以及无关物体。受人类视觉系统和实际应用的启发,我们认为,无监督检测的关键缺失线索是运动:值得关注的物体通常是频繁移动的物体,其运动可指定独立的实例。本文我们提出 MOD-UV,即从无标签视频中学习的移动物体检测器。我们首先获得由运动分割派生的实例伪标签,但引入一种新颖的训练范式,以逐步发现被运动分割遗漏的小型物体和静止但可移动的物体。结果是,虽然仅从无标签视频中学习,MOD-UV 仍能从单张静态图像中检测并分割移动物体。经验上,我们在 Waymo Open、nuScenes 和 KITTI 数据集上实现了无监督移动物体检测的状态优异性能,期间未使用任何外部数据或监督模型。代码已公开于 https://github.com/YihongSun/MOD-UV。
引用
@article{arxiv.2405.14841,
title = {MOD-UV: Learning Mobile Object Detectors from Unlabeled Videos},
author = {Yihong Sun and Bharath Hariharan},
journal= {arXiv preprint arXiv:2405.14841},
year = {2024}
}
备注
ECCV 2024