探索强化学习对视频理解的影响:来自 SEED-Bench-R1 的见解
计算机视觉与模式识别
2025-04-01 v1 人工智能
计算与语言
机器学习
摘要
近期在思维链 (COT) 生成方面的进展显著提升了大型语言模型 (LLM) 的推理能力,其中强化学习 (RL) 已成为一种有效的后训练方法。多模态大型语言模型 (MLLM) 继承了这种推理潜力,但在需要感知和逻辑推理的任务中仍未被充分探索。为了解决这一问题,我们引入了 SEED-Bench-R1,这是一个旨在系统评估 MLLM 在视频理解中的后训练方法的基准。它包含复杂的真实世界视频和以多项选择题形式呈现的复杂日常规划任务,需要精细的感知和推理能力。SEED-Bench-R1 通过三级层次结构评估泛化能力:分布内、跨环境和跨环境-任务场景,并配备了一个带有易于验证的真值答案的大规模训练数据集。使用 Qwen2-VL-Instruct-7B 作为基础模型,我们将 RL 与监督微调 (SFT) 进行了比较,证明了 RL 的数据效率及其在分布内和分布外任务上的优越性能,甚至在 LongVideoBench 等通用视频理解基准上也优于 SFT。我们的详细分析表明,RL 增强了视觉感知,但通常会产生逻辑连贯性较差的推理链。我们指出了关键局限性,例如不一致的推理和被忽略的视觉线索,并建议在未来改进基础模型推理、奖励建模以及 RL 对噪声信号的鲁棒性。
引用
@article{arxiv.2503.24376,
title = {Exploring the Effect of Reinforcement Learning on Video Understanding: Insights from SEED-Bench-R1},
author = {Yi Chen and Yuying Ge and Rui Wang and Yixiao Ge and Lu Qiu and Ying Shan and Xihui Liu},
journal= {arXiv preprint arXiv:2503.24376},
year = {2025}
}
备注
Technical Report (In Progress); Code released at: https://github.com/TencentARC/SEED-Bench-R1