中文

Video-Thinker:通过强化学习激发“视频思考”

计算机视觉与模式识别 2025-10-28 v1

摘要

近期图像推理方法的进展,特别是“图像思考”,已在多模态大语言模型(MLLM)中取得了显著成功;然而,这种动态推理范式尚未扩展到视频推理任务。在本文中,我们提出了Video-Thinker,它通过自主利用模型内在的“定位”和“描述”能力,在整个推理过程中生成推理线索,从而赋予MLLM视频思考的能力。为激发这种能力,我们构建了Video-Thinker-10K,一个精心策划的数据集,其中包含在思维链推理序列中的自主工具使用。我们的训练策略首先使用监督微调(SFT)来学习推理格式,然后使用组相对策略优化(GRPO)来强化这种推理能力。通过这种方法,Video-Thinker使MLLM能够自主地导航定位和描述任务以进行视频推理,消除了构建和调用外部工具的需要。大量实验表明,Video-Thinker在域内任务和具有挑战性的域外视频推理基准测试(包括Video-Holmes、CG-Bench-Reasoning和VRBench)上均取得了显著的性能提升。我们的Video-Thinker-7B显著优于Video-R1等现有基线,并在7B规模的MLLM中建立了最先进的性能。

关键词

引用

@article{arxiv.2510.23473,
  title  = {Video-Thinker: Sparking "Thinking with Videos" via Reinforcement Learning},
  author = {Shijian Wang and Jiarui Jin and Xingjian Wang and Linxin Song and Runhao Fu and Hecheng Wang and Zongyuan Ge and Yuan Lu and Xuelian Cheng},
  journal= {arXiv preprint arXiv:2510.23473},
  year   = {2025}
}