中文

基于正交难度分解的视频课程强化学习

计算机视觉与模式识别 2026-01-06 v1

摘要

强化学习 (RL) 对赋予 VideoLLM 复杂时空推理能力至关重要。然而,当前 RL 范例主要依赖随机数据混洗或基于标量难度指标的粗糙课程策略。我们认为,标量指标无法消解视频理解中两个正交挑战:视觉时序感知负荷和认知推理深度。为此,我们提出 VideoCuRL 框架,将难度分解为这两个轴向。我们采用高效、训练-free 的代理方法——光流和关键帧熵用于视觉复杂度,校准惊讶值用于认知复杂度,将数据映射到二维课程网格中。随后,采用具备能力意识的对角波浪策略,从基础对齐到复杂推理进行训练 scheduling。进一步,我们引入动态稀疏 KL 散度和结构化重访,以稳定训练,防止奖励塌陷和灾难性遗忘。广泛实验表明,VideoCuRL 在推理 (+2.5 VSI-Bench) 和感知 (+2.9 VideoMME) 任务中超越强大的 RL 基线。值得注意的是,VideoCuRL 消除了基于生成课程的推理开销,提供了可扩展的鲁棒视频后训练解决方案。

关键词

引用

@article{arxiv.2601.00887,
  title  = {VideoCuRL: Video Curriculum Reinforcement Learning with Orthogonal Difficulty Decomposition},
  author = {Hongbo Jin and Kuanwei Lin and Wenhao Zhang and Yichen Jin and Ge Li},
  journal= {arXiv preprint arXiv:2601.00887},
  year   = {2026}
}