中文

查找、修复、推理:视频推理的上下文修复

计算机视觉与模式识别 2026-05-04 v3

摘要

强化学习已推动大型多模态模型中的视频推理,但主导性管道要么依赖于基于模型知识边界的自探索,出现性能平台化;要么采用混合回放,混合多种策略且需要精心正则化。动态上下文方法聚焦于关键证据,但往往需要精心策划的预训练和两阶段调优,其上下文受限于小模型的能力。相反,大型模型在指令遵循和多模态理解方面表现出色,能够为小型模型提供更丰富的上下文,快速通过简单工具聚焦目标区域。基于此能力,我们引入一种观察层面的干预:一个冻结的、集成工具的教师识别缺失的时空依赖关系,并从原始视频中提供最小证据片段(例如时间戳、区域等),而问题保持不变。学生在添加了上下文后再次作答,训练以选择的 rollout方案集成到组相对策略优化(GRPO)中。我们进一步提出了鲁棒性改进奖励(RIR),以两个目标进行优化:通过正确答案实现结果有效性,通过反思所引用证据来实现依赖对齐。优势在批次上进行组归一化,既保留了基于策略的探索,又通过最小化对训练堆栈的更改,将其引导沿有因果意义的方向。在various相关基准测试上的实验显示出一致的准确率提升和强大的概括能力。代码将在 https://jethrojames.github.io/FFR/ 上提供。

关键词

引用

@article{arxiv.2604.16243,
  title  = {Find, Fix, Reason: Context Repair for Video Reasoning},
  author = {Haojian Huang and Chuanyu Qin and Yinchuan Li and Yingcong Chen},
  journal= {arXiv preprint arXiv:2604.16243},
  year   = {2026}
}

备注

22 pages, 7 figures, 17 tables. Accepted by ICML 2026