中文

4D 通用视频对象提议

计算机视觉与模式识别 2020-05-22 v3 机器人学

摘要

许多高层视频理解方法需要以对象提议的形式作为输入。目前,这类提议主要由为检测和分割一组已知对象类别而训练的网络生成,这限制了它们在所有感兴趣对象都出现在训练集中的情况之外的适用性。对于自动驾驶场景而言,这是一个限制,因为未知对象可能频繁出现。我们提出了一种方法,能够从立体视频中可靠地提取已知和未知对象类别的时空对象提议。我们的 4D 通用视频管(4D-GVT)方法利用运动线索、立体数据和对象实例分割,计算出一组紧凑的视频对象提议,精确地在三维空间和时间中定位对象候选及其轮廓。我们表明,在仅给定少量标注数据的情况下,我们的 4D-GVT 提议生成器能很好地泛化到出现未知类别的真实场景。它优于那些试图通过将在训练集中的类别数量增加到数千来检测尽可能多对象的方法。

关键词

引用

@article{arxiv.1901.09260,
  title  = {4D Generic Video Object Proposals},
  author = {Aljosa Osep and Paul Voigtlaender and Mark Weber and Jonathon Luiten and Bastian Leibe},
  journal= {arXiv preprint arXiv:1901.09260},
  year   = {2020}
}

备注

ICRA 2020