VSD-MOT:视觉语义蒸馏引导的低质量视频场景端到端多目标跟踪
计算机视觉与模式识别
2026-03-24 v1
摘要
现有的多目标跟踪算法通常无法充分解决低质量视频中的问题,导致在真实场景中图像质量下降时跟踪性能显著下降。这种性能下降主要是由于算法无法有效处理低质量图像中信息丢失所引起的问题。为应对低质量视频场景的挑战,受视觉-语言模型的启发,我们提出了一种由视觉语义蒸馏引导的多目标跟踪框架(VSD-MOT)。具体而言,我们引入CLIP图像编码器从图像中提取全局视觉语义信息,以补偿低质量图像中的信息损失。然而,直接集成会显著影响多目标跟踪算法的效率。因此,本文提出通过知识蒸馏从图像中提取视觉语义信息。该方法采用教师-学生学习框架,以CLIP图像编码器作为教师模型。为使 student 模型获得从教师模型中提取适合多目标跟踪任务的视觉语义信息的能力,我们设计了双约束语义蒸馏方法(DCSD)。此外,为解决低质量视频中帧质量的动态变化问题,我们提出了动态语义权重调节(DSWR)模块,该模块根据实时帧质量评估自适应分配融合权重。大量实验证明了所提方法在真实世界低质量视频场景中的有效性和优越性。同时,我们的方法在常规场景中也能保持良好的性能。
引用
@article{arxiv.2603.20731,
title = {VSD-MOT: End-to-End Multi-Object Tracking in Low-Quality Video Scenes Guided by Visual Semantic Distillation},
author = {Jun Du},
journal= {arXiv preprint arXiv:2603.20731},
year = {2026}
}