通过可学习视觉傅里叶提示微调与模态融合提示生成的鲁棒 RGB-T 跟踪
计算机视觉与模式识别
2025-09-25 v1
摘要
最近,视觉提示微调被引入 RGB-Thermal(RGB-T)跟踪中作为一种参数高效微调(PEFT)方法。然而,这些基于 PEFT 的 RGB-T 跟踪方法通常仅依赖空间域信息作为特征提取的提示。因此,它们常常由于忽视提示学习中频率域信息的关键作用而未能达到最优性能。为了解决这一问题,我们提出了一种高效的视觉傅里叶提示跟踪方法(命名为 VFPTrack),通过快速傅里叶变换(FFT)学习与模态相关的提示。我们的方法由共享参数的对称特征提取编码器、视觉傅里叶提示以及模态融合提示生成器组成,后者通过多模态特征融合生成双向交互提示。具体而言,我们首先使用冻结的特征提取编码器提取 RGB 和热红外(TIR)模态特征。然后,我们将空间域中的视觉提示与通过 FFT 获得的频率域提示相结合,从而从不同域信息中充分提取和理解模态特征。最后,与之前的融合方法不同,我们使用的模态融合提示生成模块将不同模态的特征结合以生成融合的模态提示。该模态提示与每个单独模态进行交互,以充分实现不同模态之间的特征交互。在三个流行的 RGB-T 跟踪基准上进行的广泛实验表明,我们的方法展现了出色的性能。
引用
@article{arxiv.2509.19733,
title = {Robust RGB-T Tracking via Learnable Visual Fourier Prompt Fine-tuning and Modality Fusion Prompt Generation},
author = {Hongtao Yang and Bineng Zhong and Qihua Liang and Zhiruo Zhu and Yaozong Zheng and Ning Li},
journal= {arXiv preprint arXiv:2509.19733},
year = {2025}
}
备注
Accepted by TMM2025