模态引导的动态图融合与时序扩散用于自监督RGB-T跟踪
计算机视觉与模式识别
2025-05-07 v1
摘要
为减少对大规模标注的依赖,自监督RGB-T跟踪方法已引起广泛关注。然而,错误伪标签导致的目标区域遗漏或背景噪声的引入会影响模态融合的效率,而由相似物体噪声引发的伪标签噪声则会进一步影响跟踪性能。本文提出GDSTrack,一种引入动态图融合与时序扩散的新方法,以应对自监督RGB-T跟踪中的上述挑战。GDSTrack动态融合相邻帧的模态,将其视为干扰噪声,并利用生成模型的去噪能力。具体而言,通过邻接矩阵生成器(AMG)构建邻接矩阵,所提出的模态引导动态图融合(MDGF)模块利用动态邻接矩阵引导图注意力,聚焦并融合目标的一致区域。时序图信息扩散(TGID)将邻近帧的MDGF特征建模为干扰,从而提升对相似物体噪声的鲁棒性。在四个公开RGB-T跟踪数据集上进行的大量实验表明,GDSTrack优于现有最先进方法。源代码可在 https://github.com/LiShenglana/GDSTrack 获取。
引用
@article{arxiv.2505.03507,
title = {Modality-Guided Dynamic Graph Fusion and Temporal Diffusion for Self-Supervised RGB-T Tracking},
author = {Shenglan Li and Rui Yao and Yong Zhou and Hancheng Zhu and Kunyang Sun and Bing Liu and Zhiwen Shao and Jiaqi Zhao},
journal= {arXiv preprint arXiv:2505.03507},
year = {2025}
}
备注
Accepted by the 34th International Joint Conference on Artificial Intelligence (IJCAI 2025)