中文

VideoChat-R1:通过强化微调增强时空感知

计算机视觉与模式识别 2025-11-12 v5

摘要

强化学习 (RL) 可为大语言模型 (LLM) 处理复杂推理提供帮助。以此为灵感,我们探索将时空特定奖励整合到多模态大语言模型 (MLLM) 中,以解决视频理解独特的挑战,如长程时序关联问题。本文研究如何将基于规则的奖励,特别是时序奖励,提高视频推理及其通用性。我们的研究提出了强化微调 (RFT) 作为一种提高特定任务视频推理的数据高效方法,而不牺牲原始能力。通过在多个时空感知任务上进行联合 RFT,我们开发了 VideoChat-R1,这是一个强大的视频 MLLM。VideoChat-R1 在时空感知方面实现了最先进的水平,在诸如时间定位 (+31.8) 和目标跟踪 (+31.2) 等任务上均取得显著改进,同时也提升了一般 QA 基准。增强的感知能力和保留的对话功能为构建更可靠的视频对话系统做出了贡献,导致我们提出了“时序线索驱动推理”推理架构。本工作为开发稳健的现实世界视频理解智能体奠定了基础。

关键词

引用

@article{arxiv.2504.06958,
  title  = {VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning},
  author = {Xinhao Li and Ziang Yan and Desen Meng and Lu Dong and Xiangyu Zeng and Yinan He and Yali Wang and Yu Qiao and Yi Wang and Limin Wang},
  journal= {arXiv preprint arXiv:2504.06958},
  year   = {2025}
}