中文

面向低质量视频场景的视觉语义增强引导多目标跟踪方法 VSE-MOT

计算机视觉与模式识别 2025-09-18 v1

摘要

当前的多目标跟踪 (MOT)算法通常忽视低质量视频中固有的挑战,导致在面对真实图像退化情况时跟踪性能显著下降。因此,推动MOT算法在真实世界低质量视频场景中的应用,具有现实意义。为解决低质量场景带来的挑战,本文灵感来源于视觉语言模型,提出一种基于视觉语义增强的多目标跟踪框架 (VSE-MOT)。具体而言,我们首先设计三分支结构,利用视觉语言模型从图像中提取全局视觉语义信息并与查询向量融合。随后,为进一步提高视觉语义信息的利用,我们引入多目标跟踪适配器 (MOT-Adapter) 和视觉语义融合模块 (VSFM)。MOT-Adapter 将提取的全局视觉语义信息适配到多目标跟踪任务中,而VSFM提高特征融合的效果。通过大量实验,我们验证了该方法在真实世界低质量视频场景中的有效性与优越性。其跟踪性能指标相较于现有方法提升约 8%~20%,同时在传统场景中保持稳健性能。

关键词

引用

@article{arxiv.2509.14060,
  title  = {VSE-MOT: Multi-Object Tracking in Low-Quality Video Scenes Guided by Visual Semantic Enhancement},
  author = {Jun Du and Weiwei Xing and Ming Li and Fei Richard Yu},
  journal= {arXiv preprint arXiv:2509.14060},
  year   = {2025}
}