中文

基于多查询 Transformer 的端到端目标跟踪

计算机视觉与模式识别 2022-10-27 v1

摘要

多目标跟踪是一项具有挑战性的任务,需要随时间推移对场景中对象的位置、外观和身份进行同步推理。本文旨在超越在已知对象类别数据集上表现良好的逐检测跟踪方法,转向在未知对象类别上同样表现良好的类无关跟踪。为此,我们做出以下三项贡献:首先,我们引入了语义检测器查询,使得对象可以通过指定其近似位置、或其外观、或两者兼有来进行定位;其次,我们在自回归跟踪框架内使用这些查询,并提出了一个多查询跟踪 Transformer 模型,用于基于具有可变形注意力的 Transformer 架构进行同步跟踪和基于外观的重新识别。该公式化使跟踪器能够以类无关的方式运行,且模型可进行端到端训练;最后,我们证明了 MQT 在标准 MOT 基准上具有竞争力,在广义 MOT 上优于所有基线,并能很好地泛化到更困难的跟踪问题,例如在 TAO 数据集上跟踪任意对象。

关键词

引用

@article{arxiv.2210.14601,
  title  = {End-to-end Tracking with a Multi-query Transformer},
  author = {Bruno Korbar and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2210.14601},
  year   = {2022}
}