中文

通过稠密时空位置编码跟踪目标

计算机视觉与模式识别 2022-10-19 v1 人工智能

摘要

在这项工作中,我们提出了一种利用 transformer 对视频中目标跟踪任务里目标位置进行编码的新范式。所提出的范式——稠密时空(DST)位置编码,以逐像素的稠密方式编码时空位置信息。所提供的位置编码通过比较两个边界框中的对象,除外观匹配外还提供位置信息以关联跨帧目标。与典型的 transformer 位置编码相比,我们提出的编码应用于 2D CNN 特征而非投影后的特征向量,以避免丢失位置信息。此外,所设计的 DST 编码能够统一表示单帧对象的位置以及轨迹位置在帧间的演化。结合 DST 编码,我们构建了一个基于 transformer 的多目标跟踪模型。该模型以视频片段为输入并在片段内执行目标关联,也可通过将已有轨迹与新到帧中的对象进行关联来实现在线推理。在视频多目标跟踪(MOT)与多目标跟踪与分割(MOTS)数据集上的实验证明了所提 DST 位置编码的有效性。

关键词

引用

@article{arxiv.2210.09455,
  title  = {Track Targets by Dense Spatio-Temporal Position Encoding},
  author = {Jinkun Cao and Hao Wu and Kris Kitani},
  journal= {arXiv preprint arXiv:2210.09455},
  year   = {2022}
}

备注

10 pages, 3 figures, accepted by BMVC 2022 (oral)