中文

你有什么,你就跟踪什么:自适应且鲁棒的多模态跟踪

计算机视觉与模式识别 2025-07-09 v1

摘要

已知多模态数据通过提高对外观变化的鲁棒性,有助于视觉跟踪。然而,传感器同步挑战常常损害数据可用性,特别是在视频设置中,短缺可能是时间性的。尽管其重要性,该领域仍未得到充分探索。在本文中,我们首次对时间上不完整的多模态数据下的跟踪器性能进行了全面研究。不出所料,在这种情况下,现有跟踪器表现出显著的性能下降,因为它们僵化的架构缺乏有效处理缺失模态所需的适应性。为了解决这些局限性,我们提出了一个用于鲁棒多模态跟踪的灵活框架。我们推测,跟踪器应根据缺失数据率动态激活计算单元。这是通过一种新颖的具有自适应复杂性的异构混合专家融合机制,结合视频级掩码策略实现的,该策略确保了时间一致性和空间完整性,这对于有效的视频跟踪至关重要。令人惊讶的是,我们的模型不仅适应不同的缺失率,还能适应场景复杂度。大量实验表明,我们的模型在 9 个基准测试中达到了 SOTA 性能,在传统的完整模态和缺失模态设置中均表现出色。代码和基准将公开发布在 https://github.com/supertyd/FlexTrack/tree/main。

关键词

引用

@article{arxiv.2507.05899,
  title  = {What You Have is What You Track: Adaptive and Robust Multimodal Tracking},
  author = {Yuedong Tan and Jiawei Shao and Eduard Zamfir and Ruanjun Li and Zhaochong An and Chao Ma and Danda Paudel and Luc Van Gool and Radu Timofte and Zongwei Wu},
  journal= {arXiv preprint arXiv:2507.05899},
  year   = {2025}
}

备注

ICCV2025 accepted