中文

扩展强化学习至长视频

计算机视觉与模式识别 2025-10-01 v4 人工智能 计算与语言

摘要

我们介绍了一个完整的框架,通过强化学习扩展视觉语言模型(VLM)在长视频中的推理能力。我们通过集成三个关键组件来解决长视频推理的独特挑战:(1)一个大规模数据集 LongVideo-Reason,包含 104K 条长视频问答对,涵盖体育、游戏、vlog 等多样领域的高质量推理标注;(2)两个阶段的训练流程,将 VLMs 扩展为链条推理监督微调(CoT-SFT)和强化学习(RL);(3)针对长视频强化学习的训练基础设施,命名为 Multi-modal Reinforcement Sequence Parallelism(MR-SP),它集成了序列并行和针对长视频的 vLLM-based 引擎,使用缓存的视频嵌入实现高效的 rollout 和 prefilling。在实验中,LongVILA-R1-7B 在视频基准测试中取得优异性能,在 VideoMME 上的准确率分别为 65.1% 和 71.1%(带字幕),并在多个基准测试中持续超越 LongVILA-7B。此外,LongVILA-R1-7B 支持处理每段视频最高 8,192 个视频帧,并支持可配置的 FPS 设置。值得注意的是,我们的 MR-SP 系统在长视频强化学习训练中可实现最高 2.1 倍加速。此外,我们发布了我们的训练系统,可公开获取,支持 various 模式(video、text、audio)、various 模型(VILA 和 Qwen 系列),甚至图像和视频生成模型。在单节点 A100(8 GPU)上,支持处理时长为 1 小时的视频(例如,3,600 个视频帧)的强化学习训练。

关键词

引用

@article{arxiv.2507.07966,
  title  = {Scaling RL to Long Videos},
  author = {Yukang Chen and Wei Huang and Baifeng Shi and Qinghao Hu and Hanrong Ye and Ligeng Zhu and Zhijian Liu and Pavlo Molchanov and Jan Kautz and Xiaojuan Qi and Sifei Liu and Hongxu Yin and Yao Lu and Song Han},
  journal= {arXiv preprint arXiv:2507.07966},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025. Code at https://github.com/NVlabs/Long-RL and model at https://huggingface.co/Efficient-Large-Model/LongVILA-R1-7B