中文

XTrack:多模态训练提升 RGB-X 视频对象跟踪器

计算机视觉与模式识别 2024-12-02 v2

摘要

多模态感知已被证明对视觉跟踪具有重要价值,因为不同传感器类型在处理特定场景中(即物体外观发生变化的场景)各有优势。虽然一个能够利用所有模态的通用模型是理想的,但由于数据稀疏,实际中通常只能一次获得一种模态。因此,确保甚至实现在推理时某些模态不可用时,从多模态感知中获得的知识(例如识别相关特征和区域)能够有效共享至关重要。我们采用一种简单假设:来自不同模态的相似样本彼此之间拥有更多可共享的知识。为实现这一点,我们采用一个“弱”分类器,任务是区分不同模态。更具体地说,如果分类器未能准确识别给定样本的模态,则表明跨模态知识共享的机会。直观地看,只有当一个来自一个模态的样本在足够接近并与另一个模态的样本对齐时,知识传递才得以促进。技术上,我们通过在专为多模态视频对象跟踪设计的混合专家框架中,将来自一个模态的样本路由到其他专家,从而实现这一点。在推理时,选择该模态的专家,我们展示了这受益于在训练期间可用的所有多模态知识,归功于所提出的方法。通过使用仅包含 RGB-E、RGB-D 和 RGB-T 配对数据的全面实验,我们展示了该方法在推理时对 RGB-X 跟踪器的益处,平均提高了 3% 的精度。我们的源代码已公开 available at https://github.com/supertyd/XTrack/tree/main。

关键词

引用

@article{arxiv.2405.17773,
  title  = {XTrack: Multimodal Training Boosts RGB-X Video Object Trackers},
  author = {Yuedong Tan and Zongwei Wu and Yuqian Fu and Zhuyun Zhou and Guolei Sun and Eduard Zamfi and Chao Ma and Danda Pani Paudel and Luc Van Gool and Radu Timofte},
  journal= {arXiv preprint arXiv:2405.17773},
  year   = {2024}
}

备注

11pages, 5figs