ReasoningTrack:面向长期视觉语言跟踪的链式思考推理方法
计算机视觉与模式识别
2025-08-08 v1 人工智能
机器学习
摘要
近年来,视觉语言跟踪受到广泛关注,因为文本信息能够有效解决指定目标对象进行跟踪时的僵化问题和不准确性。现有工作要么直接融合固定语言与视觉特征,要么仅通过注意力机制进行简单修改,但性能仍受限。最近一些研究者尝试利用文本生成以适应跟踪过程中目标的变化,但这些方法未能提供模型推理过程的洞见,亦未充分发挥大模型的优势,进而限制了整体性能。为此,本文提出一种基于预训练视觉语言模型 Qwen2.5-VL 的新颖推理驱动视觉语言跟踪框架,命名为 ReasoningTrack。我们采用监督微调(SFT)和强化学习 GRPO 对推理与语言生成进行优化。将更新后的语言描述嵌入模型,并输入统一的跟踪主干网络与视觉特征。随后,我们采用跟踪头预测目标对象的具体位置。此外,我们还构建了一个大规模长期视觉语言跟踪基准数据集,称为 TNLLT,包含 200 个视频序列。20 个基线视觉跟踪器在该数据集上重新训练评估,为视觉语言视觉跟踪任务奠定了坚实基础。在多个视觉语言跟踪基准数据集上的大量实验充分验证了我们所提出的基于推理的自然语言生成策略的有效性。本文的代码将发布于 https://github.com/Event-AHU/Open_VLTrack
引用
@article{arxiv.2508.05221,
title = {ReasoningTrack: Chain-of-Thought Reasoning for Long-term Vision-Language Tracking},
author = {Xiao Wang and Liye Jin and Xufeng Lou and Shiao Wang and Lan Chen and Bo Jiang and Zhipeng Zhang},
journal= {arXiv preprint arXiv:2508.05221},
year = {2025}
}