中文

R1-Track:将 MLLMs 直接应用于基于强化学习的视觉物体跟踪

计算机视觉与模式识别 2025-07-23 v3

摘要

视觉单目标跟踪旨在给定第一帧中的初始状态后,持续定位和估计后续视频帧中目标的尺度。这一任务传统上被建模为模板匹配问题,经历了相关滤波器、两流网络和单流网络等多个阶段并取得了显著进展。然而,这些方法通常需要显式的分类和回归建模,依赖大规模数据集的监督训练,且仅限于跟踪单一任务,缺乏灵活性。近年来,多模态大语言模型(MLLMs)取得了快速进展。像 Qwen2.5-VL 这样的开源模型具有强大的基础能力,在 grounding 任务中表现出色。这促使人们对将此类模型直接应用于视觉跟踪产生浓厚兴趣。然而,实验表明 Qwen2.5-VL 在图像对之间的模板匹配(即跟踪任务)方面存在困难。受 deepseek-R1 启发,我们在小规模数据集上使用基于组相对策略优化(GRPO)强化学习方法,对 Qwen2.5-VL 进行微调,构建了名为 R1-Track 的模型。在 GOT-10k 基准上实现了显著性能。R1-Track 支持通过边界框或文本描述进行灵活初始化,同时保留了原始模型大部分通用能力。我们进一步讨论了 R1-Track 的潜在改进。本篇粗糙的技术报告总结了我们至 2025 年 5 月的发现。

关键词

引用

@article{arxiv.2506.21980,
  title  = {R1-Track: Direct Application of MLLMs to Visual Object Tracking via Reinforcement Learning},
  author = {Biao Wang and Wenwen Li and Jiawei Ge},
  journal= {arXiv preprint arXiv:2506.21980},
  year   = {2025}
}

备注

7 pages, 2 figures