基于帧间运动与表观的实时多目标跟踪
计算机视觉与模式识别
2019-05-08 v1
摘要
多目标跟踪(MOT)的主要挑战在于视频帧间不定数量目标关联的效率。跟踪中使用的标准运动估计器(如长短期记忆网络(LSTM))仅处理单个目标,而基于重识别(Re-ID)的方法穷举比较目标表观。当扩展到大量目标时,这两种方法计算代价都很高,使得实时 MOT 极为困难。为解决这些问题,我们提出一种高效深度神经网络(DNN),可同时建模不定数量目标间的关联。该 DNN 的推理计算不随目标数量增加而增长。我们的方法——帧间运动与表观(FMA)——计算两帧间的帧间运动场(FMF),从而实现大量目标边界框间非常快速且可靠的匹配。利用辅助信息修正不确定匹配,帧间表观特征(FAF)与 FMF 并行学习。在 MOT17 基准上的大量实验表明,我们的方法以实时 MOT 取得了与最先进方法相竞争的成果。
引用
@article{arxiv.1905.02292,
title = {Frame-wise Motion and Appearance for Real-time Multiple Object Tracking},
author = {Jimuyang Zhang and Sanping Zhou and Jinjun Wang and Dong Huang},
journal= {arXiv preprint arXiv:1905.02292},
year = {2019}
}
备注
13 pages, 4 figures, 4 tables