中文

学习具有物体恒存性的跟踪

计算机视觉与模式识别 2021-10-04 v2

摘要

检测式跟踪是在线多目标跟踪的主流方法,它在定位与关联步骤之间交替进行。因此,它强烈依赖于瞬时观测的质量,常在被跟踪物体未完全可见时失效。相比之下,人类的跟踪以物体恒存性概念为基础:一旦识别出某个物体,我们便意识到其物理存在,并能在完全遮挡下对其位置进行近似定位。在本工作中,我们提出一种端到端可训练的联合物体检测与跟踪方法,能够进行此类推理。我们基于近期的 CenterTrack 架构构建,该架构以成对帧作为输入,并将其扩展至任意长度的视频。为此,我们为模型增加了一个时空循环记忆模块,使其能利用全部历史信息推理当前帧中物体的位置与身份。然而,如何训练这样的方法并不显然。我们在一个新的大规模合成多目标跟踪数据集上研究该问题,该数据集为不可见物体提供真值标注,并提出了几种在遮挡下监督跟踪的方法。我们的模型在合成与真实数据上联合训练,凭借其对遮挡的鲁棒性,在 KITTI 和 MOT17 数据集上优于当前最优方法。

关键词

引用

@article{arxiv.2103.14258,
  title  = {Learning to Track with Object Permanence},
  author = {Pavel Tokmakov and Jie Li and Wolfram Burgard and Adrien Gaidon},
  journal= {arXiv preprint arXiv:2103.14258},
  year   = {2021}
}