中文

面向通用模态跟踪:基于在线稠密时间token学习的通用视频级模态感知跟踪模型

计算机视觉与模式识别 2025-07-30 v1 多媒体

摘要

我们提出了一种通用的视频级模态感知跟踪模型,采用在线稠密时间token学习(称为{\modaltracker}),旨在支持包括RGB、RGB+热成像、RGB+深度和RGB+事件在内的各种跟踪任务,采用相同的模型架构和参数。具体而言,本模型设计了三个核心目标:\textbf{视频级抽样}。我们将模型的输入扩展到视频序列层级,旨在从近全局视角获取更丰富的视频上下文。\textbf{视频级关联}。进一步,我们引入两种简单而有效的在线稠密时间token关联机制,以视频流方式传递目标的外观和运动轨迹信息。\textbf{模态可扩展}。我们提出两种新型门控感知器,通过门控注意力机制自适应学习跨模态表示,并通过一次性训练压缩到相同的模型参数集合中,以实现多任务推理。这种新方法带来了以下好处:(i)精炼后的token序列可作为下一视频帧推理的时序提示,利用先前信息指导后续推理。(ii)与需要独立训练的多模态跟踪器不同,我们的一次性训练方案不仅减轻了训练负担,也提升了模型表示。大量实验在可见和多模态基准测试上显示,我们的{\modaltracker}实现了新的\textit{SOTA}性能。代码将发布于 https://github.com/GXNU-ZhongLab/ODTrack。

关键词

引用

@article{arxiv.2507.20177,
  title  = {Towards Universal Modal Tracking with Online Dense Temporal Token Learning},
  author = {Yaozong Zheng and Bineng Zhong and Qihua Liang and Shengping Zhang and Guorong Li and Xianxian Li and Rongrong Ji},
  journal= {arXiv preprint arXiv:2507.20177},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2401.01686