基于跨输入一致性的自监督多目标跟踪
计算机视觉与模式识别
2021-11-12 v1
摘要
本文提出一种自监督学习流程,用于在仅给定无标签视频的情况下训练鲁棒的多目标跟踪(MOT)模型。尽管先前单目标跟踪工作已提出若干自监督学习信号,如颜色传播与循环一致性,这些信号无法直接用于训练RNN模型(而准确MOT需要RNN):它们会产生退化模型,例如总是将新检测与具有最近初始检测的轨迹匹配。我们提出一种称为跨输入一致性的新自监督信号:我们为同一视频序列构建两个不同的输入,在每个输入中隐藏关于该序列的不同信息。然后通过对每个输入独立应用RNN模型计算该序列中的轨迹,并训练模型在两个输入间产生一致的轨迹。我们在MOT17和KITTI上评估无监督方法——令人惊讶的是,我们发现尽管仅在无标签视频上训练,我们的无监督方法优于过去1–2年发表的四种监督方法,包括Tracktor++、FAMNet、GSM和mmMOT。
引用
@article{arxiv.2111.05943,
title = {Self-Supervised Multi-Object Tracking with Cross-Input Consistency},
author = {Favyen Bastani and Songtao He and Sam Madden},
journal= {arXiv preprint arXiv:2111.05943},
year = {2021}
}
备注
NeurIPS 2021