中文

通过渐进融合 Transformer 与动态引导学习实现 RGBT 跟踪

计算机视觉与模式识别 2023-04-25 v2

摘要

现有的基于 Transformer 的 RGBT 跟踪方法要么使用交叉注意力融合两种模态,要么使用自注意力与交叉注意力对模态特定与模态共享信息建模。然而,模态间显著的外观差异限制了融合过程中某些模态的特征表示能力。为解决此问题,我们提出一种称为 ProFormer 的新型渐进融合 Transformer,其将单模态信息逐步整合进多模态表示以实现鲁棒 RGBT 跟踪。具体而言,ProFormer 首先使用自注意力模块协同提取多模态表示,然后使用两个交叉注意力模块分别将其与双模态特征交互。如此,模态特定信息可在多模态表示中被充分激活。最后,使用前馈网络融合两个交互后的多模态表示以进一步增强最终多模态表示。此外,现有 RGBT 跟踪器的学习方法要么将多模态特征融合为一个用于最终分类,要么通过竞争学习策略利用单模态分支与融合分支间的关系。然而,它们要么忽略单模态分支的学习,要么导致某一分支无法良好优化。为解决这些问题,我们提出一种动态引导学习算法,自适应地利用表现良好的分支引导其他分支学习,以增强各分支的表示能力。大量实验表明,我们提出的 ProFormer 在 RGBT210、RGBT234、LasHeR 和 VTUAV 数据集上确立了新的 SOTA 性能。

关键词

引用

@article{arxiv.2303.14778,
  title  = {RGBT Tracking via Progressive Fusion Transformer with Dynamically Guided Learning},
  author = {Yabin Zhu and Chenglong Li and Xiao Wang and Jin Tang and Zhixiang Huang},
  journal= {arXiv preprint arXiv:2303.14778},
  year   = {2023}
}

备注

Incorrect experimental setup on the LasHeR dataset