中文

AR-MOT:自回归式多目标跟踪

计算机视觉与模式识别 2026-01-06 v1

摘要

随着多目标跟踪 (MOT) 任务不断演进 toward更通用和多模态的场景,现有MOT方法的刚性且任务特定的架构日益阻碍其在不同任务之间的适用性,并限制了灵活地适应新跟踪表述的能力。大多数方法依赖固定的输出头和专门的跟踪管线,使其难以扩展到更复杂或指令驱动的任务。为此,我们提出AR-MOT,一种新型自回归范式,将MOT 建模为大语言模型 (LLM) 框架下的序列生成任务。该设计使模型能够通过灵活的序列构建输出结构,无需任何任务特定的头。为增强区域级别的视觉感知,我们引入基于预训练检测器的对象标记器 (Object Tokenizer)。为缓解全局特征与区域特征之间的错位,我们提出区域感知对齐 (Region-Aware Alignment, RAA) 模块;为支持长期跟踪,我们设计了时间记忆融合 (Temporal Memory Fusion, TMF) 模块,该模块缓存历史对象标记。AR-MOT 具有强大的可扩展性,新的模态或指令可通过仅修改输出序列格式而无需更改模型架构来集成。 在 MOT17 和 DanceTrack 上进行的大量实验表明,我们的方法在性能上与最先进的方法相当,同时为更通用和灵活的 MOT 系统奠定了基础。

关键词

引用

@article{arxiv.2601.01925,
  title  = {AR-MOT: Autoregressive Multi-object Tracking},
  author = {Lianjie Jia and Yuhan Wu and Binghao Ran and Yifan Wang and Lijun Wang and Huchuan Lu},
  journal= {arXiv preprint arXiv:2601.01925},
  year   = {2026}
}

备注

12 pages, 5 figures