视觉目标跟踪中多模态分析的全景综述
计算机视觉与模式识别
2026-03-18 v2
摘要
智慧城市的发展催生了海量多模态数据,这些数据服务于一系列任务,能够实现对智慧城市基础设施和服务的全面监控。本文从多模态分析的视角,对其中最关键的视觉任务之一——多模态视觉目标跟踪(MMVOT)进行了综述。总体而言,MMVOT 与单模态跟踪在四个关键方面存在差异:数据采集、模态对齐与标注、模型设计以及评估。据此,我们首先介绍相关数据模态,为其融合奠定基础。这自然引出了对多模态数据采集、对齐和标注挑战的讨论。随后,我们根据处理可见光(RGB)与 X 模态的不同方式,对现有 MMVOT 方法进行分类:即通过复制或非复制 RGB 分支的实验配置来编程辅助 X 分支。这里的 X 可以是热红外(T)、深度(D)、事件(E)、近红外(NIR)、语言(L)或声纳(S)。论文的最后部分讨论了评估与基准测试。总之,我们对多模态视觉目标跟踪(VOT)的各个方面进行了全景综述,涵盖了六种 MMVOT 任务,共引用 338 篇文献。此外,我们还探讨了一个根本性的反问:借助信息融合,多模态跟踪是否总能保证提供优于单模态跟踪的解决方案?如果不能,在何种情况下其应用才是有益的?并且,我们首次在该领域分析了现有 MMVOT 数据集中目标类别的分布,揭示了其显著的分布长尾特性,以及与 RGB 数据集相比,动物类别的明显缺失。
引用
@article{arxiv.2508.13000,
title = {Omni Survey for Multimodality Analysis in Visual Object Tracking},
author = {Zhangyong Tang and Tianyang Xu and Xuefeng Zhu and Hui Li and Shaochuan Zhao and Tao Zhou and Chunyang Cheng and Xiaojun Wu and Josef Kittler},
journal= {arXiv preprint arXiv:2508.13000},
year = {2026}
}
备注
The first comprehensive survey for multi-modal visual object tracking; 6 multi-modal tasks; 338 references