基于时空多模态令牌的Transformer RGBT跟踪
计算机视觉与模式识别
2024-01-04 v1
摘要
许多RGBT跟踪研究主要关注模态融合设计,而忽略了对目标外观变化的有效处理。虽然一些方法引入了历史帧或融合并替换初始模板以融入时间信息,但它们存在破坏原始目标外观并随时间累积误差的风险。为缓解这些局限性,我们提出了一种新颖的Transformer RGBT跟踪方法,该方法在Transformer中混合来自静态多模态模板和多模态搜索区域的时空多模态令牌,以处理目标外观变化,实现鲁棒的RGBT跟踪。我们引入独立的动态模板令牌与搜索区域交互,嵌入时间信息以应对外观变化,同时保留初始静态模板令牌参与联合特征提取过程,以确保保留原始可靠的目标外观信息,防止因传统时间更新导致的目标外观偏离。我们还利用注意力机制,通过融入补充模态线索来增强多模态模板令牌的目标特征,并通过注意力机制使多模态搜索区域令牌与多模态动态模板令牌交互,这有助于传递多模态增强的目标变化信息。我们的模块插入到Transformer骨干网络中,并继承了联合特征提取、搜索-模板匹配和跨模态交互。在三个RGBT基准数据集上的大量实验表明,所提出的方法在保持与其他最先进跟踪算法竞争性能的同时,运行速度达到39.1 FPS。
引用
@article{arxiv.2401.01674,
title = {Transformer RGBT Tracking with Spatio-Temporal Multimodal Tokens},
author = {Dengdi Sun and Yajie Pan and Andong Lu and Chenglong Li and Bin Luo},
journal= {arXiv preprint arXiv:2401.01674},
year = {2024}
}