融合视觉、深度与热信号的多模态跟踪:数据集与算法
计算机视觉与模式识别
2026-03-17 v3
摘要
现有的多模态目标跟踪方法主要关注双模态范式,如RGB-Depth或RGB-Thermal,然而由于输入模态有限,在复杂场景中仍面临挑战。为弥补这一空白,本研究引入了一项新颖的多模态跟踪任务,利用三种互补模态,包括可见RGB、深度(D)和热红外(TIR),旨在增强复杂场景下的鲁棒性。为支持该任务,我们构建了一个新的多模态跟踪数据集,命名为RGBDT500,包含500个视频,三种模态的帧同步。每一帧提供空间对齐的RGB、深度和热红外图像,并带有精确的目标边界框标注。此外,我们提出了一种新颖的多模态跟踪器,命名为RDTTrack。RDTTrack利用预训练的纯RGB跟踪模型和提示学习技术,集成三模态信息以实现鲁棒跟踪。具体而言,RDTTrack在提出的正交投影约束下融合热红外和深度模态,然后将它们作为提示与RGB信号一起集成到预训练的基础跟踪模型中,有效地协调了三模态互补线索。实验结果证明了所提方法的有效性和优势,在复杂场景下的跟踪准确性和鲁棒性方面,相比现有的双模态方法有显著提升。数据集和源代码公开于 https://xuefeng-zhu5.github.io/RGBDT500。
引用
@article{arxiv.2509.24741,
title = {Collaborating Vision, Depth, and Thermal Signals for Multi-Modal Tracking: Dataset and Algorithm},
author = {Xue-Feng Zhu and Tianyang Xu and Yifan Pan and Jinjie Gu and Xi Li and Jiwen Lu and Xiao-Jun Wu and Josef Kittler},
journal= {arXiv preprint arXiv:2509.24741},
year = {2026}
}