TGCN:用于多目标跟踪的时域图卷积网络
计算机视觉与模式识别
2021-01-07 v1 机器学习
摘要
多目标跟踪旨在为视频中每个目标分配一个 id。其难点在于如何匹配同一帧中的预测目标与检测目标。匹配特征包括外观特征、位置特征等。预测目标的这些特征基本基于若干先前帧。然而,鲜有论文描述先前帧特征与当前帧特征之间在时域上的关系。本文中,我们提出了一种用于多目标跟踪的时域图卷积网络。该模型主要分为两部分:首先使用卷积神经网络(CNN)提取行人外观特征,这是深度学习中处理图像的常规操作;随后使用 GCN 对若干过去帧的外观特征建模,以得到当前帧的预测外观特征。借助这一扩展,我们可根据过去若干帧之间的关系获得当前帧的姿态特征。实验评估表明,我们的扩展在 MOT16 上将 MOTA 提升了 1.3,在高帧率下取得了总体具竞争力的性能。
引用
@article{arxiv.2101.01861,
title = {TGCN: Time Domain Graph Convolutional Network for Multiple Objects Tracking},
author = {Jie Zhang},
journal= {arXiv preprint arXiv:2101.01861},
year = {2021}
}