基于Transformer的RGB-T跟踪与通道和空间特征融合
计算机视觉与模式识别
2025-06-24 v3
摘要
RGB-T跟踪的主要问题是如何正确且最优地融合可见光和热成像图像的跨模态特征。以往的一些方法要么没有充分利用RGB和TIR信息进行通道和空间特征融合的潜力,要么缺乏模板与搜索区域之间的直接交互,这限制了模型充分利用两种模态原始语义信息的能力。为了解决这些局限性,我们研究了如何在RGB-T跟踪中实现跨模态通道和空间特征的直接融合,并提出了CSTNet。它使用Vision Transformer(ViT)作为骨干网络,并在Transformer块之间集成了联合空间和通道融合模块(JSCFM)和空间融合模块(SFM),以促进跨模态特征交互。JSCFM模块实现了通道和多级空间特征的联合建模。SFM模块包含类似交叉注意力的架构,用于RGB和TIR特征的交叉建模和联合学习。综合实验表明,CSTNet达到了最先进的性能。为了增强实用性,我们在没有JSCFM和SFM模块的情况下重新训练模型,并使用CSNet作为预训练权重,提出了CSTNet-small,其速度提升了50%,而SR和PR性能平均下降1-2%。CSTNet和CSTNet-small在Nvidia Jetson Xavier上分别达到21 fps和33 fps的实时速度,满足实际部署需求。代码可在https://github.com/LiYunfengLYF/CSTNet获取。
引用
@article{arxiv.2405.03177,
title = {Transformer-based RGB-T Tracking with Channel and Spatial Feature Fusion},
author = {Yunfeng Li and Bo Wang and Ye Li},
journal= {arXiv preprint arXiv:2405.03177},
year = {2025}
}
备注
This work has been submitted to the IEEE for possible publication