中文

将目标作为像素级分布进行跟踪

计算机视觉与模式识别 2022-07-18 v2 人工智能 机器学习

摘要

多目标跟踪(MOT)需要在帧间检测并关联目标。与通过检测边界框或将点作为目标进行跟踪不同,我们提出将目标作为像素级分布进行跟踪。我们在基于 transformer 的架构 P3AFormer 上实现了这一思想,该架构具有像素级传播、预测与关联。P3AFormer 在流信息引导下传播像素级特征,以在帧间传递消息。此外,P3AFormer 采用一种元架构来生成多尺度目标特征图。在推理阶段,提出一种像素级关联流程,基于像素级预测来恢复跨帧的目标连接。P3AFormer 在 MOT17 基准上取得了 81.2% 的 MOTA——这是所有 transformer 网络中首个在文献中达到 80% MOTA 的方法。P3AFormer 在 MOT20 和 KITTI 基准上也优于当前最优方法(state-of-the-arts)。

关键词

引用

@article{arxiv.2207.05518,
  title  = {Tracking Objects as Pixel-wise Distributions},
  author = {Zelin Zhao and Ze Wu and Yueqing Zhuang and Boxun Li and Jiaya Jia},
  journal= {arXiv preprint arXiv:2207.05518},
  year   = {2022}
}

备注

Accepted in ECCV22 as an oral presentation paper. The code&project page is at https://github.com/dvlab-research/ECCV22-P3AFormer-Tracking-Objects-as-Pixel-wise-Distributions