中文

面向多模态目标跟踪的自适应感知统一框架

计算机视觉与模式识别 2025-02-11 v1

摘要

最近许多多模态跟踪器将 RGB 作为主导模态, treating 其他模态为辅助,并单独微调各种多模态任务。这种模态依赖性不平衡限制了方法在复杂场景下动态利用各模态互补信息的能力,使得在多模态跟踪任务中充分发挥多模态优势具有挑战性。因此,常规的统一参数模型在各种多模态跟踪任务中往往表现不佳。为解决此问题,我们提出了 APTrack,一种用于多模态自适应感知的新型统一跟踪器。与以往方法不同,APTrack 通过等效建模策略探索统一表示。该策略使模型能够在无需在不同任务之间进行额外微调的情况下动态适应各种模态和任务。此外,我们的跟踪器集成了自适应模态交互(AMI)模块,通过生成可学习的标记高效地桥接跨模态交互。在针对五个多样化多模态数据集(RGBT234、LasHeR、VisEvent、DepthTrack 和 VOT-RGBD2022)进行的实验表明,APTrack 不仅超越了现有的领先统一多模态跟踪器,还在针对特定多模态任务设计的跟踪器方面表现更佳。

关键词

引用

@article{arxiv.2502.06583,
  title  = {Adaptive Perception for Unified Visual Multi-modal Object Tracking},
  author = {Xiantao Hu and Bineng Zhong and Qihua Liang and Zhiyi Mo and Liangtao Shi and Ying Tai and Jian Yang},
  journal= {arXiv preprint arXiv:2502.06583},
  year   = {2025}
}