中文

探索融合策略以实现精准 RGBT 视觉目标跟踪

计算机视觉与模式识别 2022-01-24 v1

摘要

我们解决视频中的多模态目标跟踪问题,并探索融合可见光(RGB)与热红外(TIR)模态所传达互补信息的多种选项,包括像素级、特征级和决策级融合。具体而言,不同于现有方法,像素级融合借鉴了图像融合任务的范式。特征级融合通过注意力机制实现,通道可选择性激活。此外,在决策级,由于简单的平均配置已展现出优越性,我们提出了一种新颖的融合策略。所提决策级融合策略的有效性源于若干创新性贡献,包括 RGB 与 TIR 贡献的动态加权以及线性模板更新操作。其一种变体在视觉目标跟踪挑战赛 2020(VOT-RGBT2020)中获得了冠军跟踪器。对创新性像素级与特征级融合策略的同步探索凸显了所提决策级融合方法的优势。在 GTOT、VOT-RGBT2019 和 VOT-RGBT2020 三个具有挑战性数据集上的大量实验结果表明,与最先进方法相比,所提方法具有有效性和鲁棒性。代码将于 \textcolor{blue}{\emph{https://github.com/Zhangyong-Tang/DFAT}} 分享。

关键词

引用

@article{arxiv.2201.08673,
  title  = {Exploring Fusion Strategies for Accurate RGBT Visual Object Tracking},
  author = {Zhangyong Tang and Tianyang Xu and Hui Li and Xiao-Jun Wu and Xuefeng Zhu and Josef Kittler},
  journal= {arXiv preprint arXiv:2201.08673},
  year   = {2022}
}

备注

13 pages, 10 figures