中文

VideoCap-R1:通过结构化思维增强多模态大语言模型以实现视频字幕生成

计算机视觉与模式识别 2025-06-03 v1

摘要

尽管强化学习的近期进展显著增强了大型语言模型(LLM)的推理能力,但这些技术在用于视频字幕生成的多模态大语言模型(MLLM)中仍鲜有探索。本文首次系统研究了基于 GRPO 的强化学习后训练在视频 MLLM 中的应用,旨在增强视频 MLLM 描述视频中动作的能力。具体而言,我们开发了 VideoCap-R1,该模型被提示在生成完整字幕之前,首先执行结构化思维来分析视频主体及其属性和动作,并由两种专门的奖励机制提供支持:一个无需 LLM 的思维评分器用于评估结构化思维质量,一个 LLM 辅助的字幕评分器用于评估输出质量。该强化学习训练框架有效地建立了结构化推理与全面描述生成之间的联系,使模型能够生成包含更准确动作的字幕。我们的实验表明,VideoCap-R1 在多个视频字幕基准上使用有限样本(1.5k)即取得了相对于 Qwen2VL-7B 基线的显著提升(DREAM1K:+4.4 事件 F1,VDC:+4.2 准确率,CAREBENCH:+3.1 动作 F1,+6.9 物体 F1),同时始终优于 SFT 训练的对应模型,证实了 GRPO 在增强 MLLM 字幕生成能力方面的优越性。

关键词

引用

@article{arxiv.2506.01725,
  title  = {VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking},
  author = {Desen Meng and Rui Huang and Zhilin Dai and Xinhao Li and Yifan Xu and Jun Zhang and Zhenpeng Huang and Meng Zhang and Lingshu Zhang and Yi Liu and Limin Wang},
  journal= {arXiv preprint arXiv:2506.01725},
  year   = {2025}
}