中文

迈向通用多模态视觉跟踪

计算机视觉与模式识别 2025-03-17 v1

摘要

现有的多模态跟踪研究集中在双模态场景,如 RGB-热红外、RGB-事件和 RGB-语言。尽管通过利用来自不同来源的互补线索取得了有希望的跟踪性能,但由于双模态场景的局限性,在复杂场景中仍然具有挑战性。在这项工作中,我们引入了一项通用多模态视觉跟踪任务,充分利用四种模态的优势,包括 RGB、热红外、事件和语言,以在具有挑战性的条件下实现稳健跟踪。为了为通用多模态视觉跟踪提供全面的评估平台,我们构建了 QuadTrack600,这是一个大规模、高质量的基准,包含 600 个视频序列(总计 384.7K 高分辨率(640x480)帧组)。在每个帧组中,所有四种模态都在空间上对齐,并用边界框进行了细致的标注,同时提供了 21 个序列级别的挑战属性以进行详细的性能分析。尽管四模态数据提供了更丰富的信息,但模态间信息量的差异和四种模态带来的计算负担是融合四种模态时的两个具有挑战性的问题。为了处理这些问题,我们提出了一种名为 QuadFusion 的新方法,该方法结合了一个具有四种不同扫描尺度的高效多尺度融合 Mamba,以实现四种模态的充分交互,同时克服指数级的计算负担,用于通用多模态视觉跟踪。在 QuadTrack600 数据集和三个双模态跟踪数据集(包括 LasHeR、VisEvent 和 TNL2K)上的大量实验验证了我们的 QuadFusion 的有效性。

关键词

引用

@article{arxiv.2503.11218,
  title  = {Towards General Multimodal Visual Tracking},
  author = {Andong Lu and Mai Wen and Jinhu Wang and Yuanzhi Guo and Chenglong Li and Jin Tang and Bin Luo},
  journal= {arXiv preprint arXiv:2503.11218},
  year   = {2025}
}

备注

In peer review