中文

MLS-Track: RMOT中的多级语义交互

计算机视觉与模式识别 2024-04-19 v1

摘要

多目标跟踪任务的新趋势是使用自然语言跟踪感兴趣的目标。然而,配对的提示-实例数据的稀缺阻碍了其进展。为了解决这一挑战,我们提出了一种基于虚幻引擎5的高质量低成本数据生成方法,并构建了一个全新的基准数据集,命名为Refer-UE-City,主要包含交叉路口监控视频场景,详细描述了人和车辆的外观和动作。具体来说,它提供了14个视频,共714个表达式,规模与Refer-KITTI数据集相当。此外,我们提出了一个名为MLS-Track的多级语义引导多目标框架,通过引入语义引导模块(SGM)和语义相关分支(SCB),逐层增强模型与文本之间的交互。在Refer-UE-City和Refer-KITTI数据集上的大量实验证明了我们提出框架的有效性,并且达到了最先进的性能。代码和数据集将公开。

关键词

引用

@article{arxiv.2404.12031,
  title  = {MLS-Track: Multilevel Semantic Interaction in RMOT},
  author = {Zeliang Ma and Song Yang and Zhe Cui and Zhicheng Zhao and Fei Su and Delong Liu and Jingyu Wang},
  journal= {arXiv preprint arXiv:2404.12031},
  year   = {2024}
}

备注

17 pages 8 figures