中文

面向多模态跟踪的基于生成式的融合机制

计算机视觉与模式识别 2023-12-01 v3

摘要

生成模型(GMs)因其实现全面理解的卓越能力而受到越来越多的研究关注。然而,它们在多模态跟踪领域的潜在应用仍相对未被探索。在此背景下,我们力求发掘利用生成技术解决多模态跟踪中关键信息融合这一关键挑战的潜力。在本文中,我们深入研究了两种突出的 GM 技术,即条件生成对抗网络(CGANs)和扩散模型(DMs)。与将各模态特征直接输入融合模块的标准融合过程不同,我们在 GM 框架中用随机噪声条件化这些多模态特征,有效地将原始训练样本转化为更难的实例。该设计擅长从特征中提取判别性线索,提升最终的跟踪性能。为定量衡量我们方法的有效性,我们在两个多模态跟踪任务、三种基线方法和三个具有挑战性的基准上进行了大量实验。实验结果表明,所提出的基于生成式的融合机制取得了最先进的性能,在 LasHeR 和 RGBD1K 上创下新纪录。

关键词

引用

@article{arxiv.2309.01728,
  title  = {Generative-based Fusion Mechanism for Multi-Modal Tracking},
  author = {Zhangyong Tang and Tianyang Xu and Xuefeng Zhu and Xiao-Jun Wu and Josef Kittler},
  journal= {arXiv preprint arXiv:2309.01728},
  year   = {2023}
}