中文

一种基于Transformer自注意力机制的改进端到端多目标跟踪方法

计算机视觉与模式识别 2022-11-14 v1

摘要

本研究提出一种基于Transformer编码器-解码器结构自注意力机制、适应多视角多尺度场景的改进端到端多目标跟踪算法。将多维特征提取骨干网络与自建语义栅格地图相结合,存入编码器中进行关联,生成目标位置编码与多维特征向量。解码器融合了四种方法:多视角目标的空间聚类与语义滤波、多维特征的动态匹配、基于时空逻辑的多目标跟踪,以及基于时空收敛网络(STCN)的参数传递。通过多种解码方式的融合,从时间逻辑、空间逻辑与特征匹配三个维度对多相机目标进行跟踪。在MOT17数据集上,本研究的MOTA(Multiple Object Tracking Accuracy,多目标跟踪准确度)指标达0.836,较当前最优方法MiniTrackV2[49]显著提升2.2%。此外,本研究首次提出回溯机制,并采用逆序处理方法优化历史误标目标,以提升IDF1(Identification F1-score,识别F1分数)。在自建数据集OVIT-MOT01上,IDF1由0.948提升至0.967,MCTA(Multi-camera Tracking Accuracy,多相机跟踪准确度)由0.878提升至0.909,显著提升了连续跟踪精度与场景适应性。该研究方法引入了一种新的注意力跟踪范式,能够在多目标跟踪(MOT17与OVIT-MOT01)任务上取得最优性能。

关键词

引用

@article{arxiv.2211.06001,
  title  = {An Improved End-to-End Multi-Target Tracking Method Based on Transformer Self-Attention},
  author = {Yong Hong and Deren Li and Shupei Luo and Xin Chen and Yi Yang and Mi Wang},
  journal= {arXiv preprint arXiv:2211.06001},
  year   = {2022}
}