中文

SEATrack:简单、高效且自适应的多模态跟踪器

计算机视觉与模式识别 2026-04-15 v1 人工智能

摘要

参数高效微调(PEFT)在多模态跟踪中揭示出一种令人担忧的趋势,即最近的性能提升往往以膨胀参数预算为代价,这从根本上削弱了PEFT的效率承诺。本文引入SEATrack,一个简单、高效且自适应的双流多模态跟踪器,从两个互补的角度解决性能与效率之间的困境。首先,我们优先考虑匹配响应的跨模态对齐,这一尚未被充分探索却至关重要的因素,我们认为这对于打破这种权衡至关重要。具体而言,我们观察到现有双流方法中特定模态的偏差会生成相互冲突的匹配注意力图,从而阻碍有效的联合表示学习。为缓解这一问题,我们提出了AMG-LoRA,将领域适应的低秩适应(LoRA)与自适应相互引导(AMG)无缝集成,以动态细化和对齐跨模态的注意力图。随后,我们摆脱传统的局部融合方法,引入层次化专家混合(HMoE),以高效地进行全局关系建模,有效平衡跨模态融合中的表达性和计算效率。凭借这些创新,SEATrack在RGB-T、RGB-D和RGB-E跟踪任务中显著优于现有最先进方法,在性能与效率之间取得了显著进展。

关键词

引用

@article{arxiv.2604.12502,
  title  = {SEATrack: Simple, Efficient, and Adaptive Multimodal Tracker},
  author = {Junbin Su and Ziteng Xue and Shihui Zhang and Kun Chen and Weiming Hu and Zhipeng Zhang},
  journal= {arXiv preprint arXiv:2604.12502},
  year   = {2026}
}

备注

Accepted as a CVPR 2026 Oral