中文

单模型且任意模态的视频目标跟踪

计算机视觉与模式识别 2024-04-01 v3

摘要

在视频目标跟踪领域,深度、热成像或事件数据等辅助模态已成为补充RGB跟踪器的宝贵资产。实践中,多数现有RGB跟踪器学习单组参数以跨数据集与应用使用。然而,多模态跟踪的类似单模型统一面临若干挑战。这些挑战源于输入的固有异质性——各具模态特定表示、多模态数据集稀缺,以及并非始终具备所有模态。在本工作中,我们引入Un-Track,一种用于任意模态的单组参数统一跟踪器。为处理任意模态,我们的方法通过低秩分解与重建技术学习其公共潜空间。更重要的是,我们仅使用RGB-X对来学习该公共潜空间。这一独特共享表示将全部模态无缝绑定,实现有效统一并容纳任意缺失模态,且全部置于单一基于transformer的架构中。我们的Un-Track在DepthTrack数据集上通过简单而高效的提示策略,仅增加 +2.14(基于21.50)GFLOPs与 +6.6M(基于93M)参数,即取得 +8.1绝对F分数增益。在五个具不同模态的基准数据集上的大量比较表明,Un-Track超越SOTA统一跟踪器与模态特定对应模型,验证了我们的有效性与实用性。源代码公开于 https://github.com/Zongwei97/UnTrack。

关键词

引用

@article{arxiv.2311.15851,
  title  = {Single-Model and Any-Modality for Video Object Tracking},
  author = {Zongwei Wu and Jilai Zheng and Xiangxuan Ren and Florin-Alexandru Vasluianu and Chao Ma and Danda Pani Paudel and Luc Van Gool and Radu Timofte},
  journal= {arXiv preprint arXiv:2311.15851},
  year   = {2024}
}

备注

Accepted by CVPR2024