中文

ReFoCUS:面向上下文理解的强化学习引导帧优化

计算机视觉与模式识别 2025-06-03 v1 人工智能

摘要

大型多模态模型(LMM)的最新进展使得有效的视觉-语言推理成为可能,然而理解视频内容的能力仍受限于次优的帧选择策略。现有方法通常依赖静态启发式规则或外部检索模块将帧信息输入 video-LLM,这可能无法提供与查询相关的信息。在本工作中,我们提出了 ReFoCUS(Reinforcement-guided Frame Optimization for Contextual UnderStanding,面向上下文理解的强化学习引导帧优化),一种新颖的帧级策略优化框架,将优化目标从文本响应转向视觉输入选择。ReFoCUS 通过强化学习学习帧选择策略,使用从参考 LMM 导出的奖励信号来反映模型对最能支持时间定位响应的帧的内在偏好。为了高效探索庞大的组合帧空间,我们采用自回归的条件选择架构,在降低复杂度的同时确保时间连贯性。我们的方法不需要帧级显式监督,并在多个视频问答基准上持续提升推理性能,凸显了将帧选择与模型内部效用对齐的优势。

关键词

引用

@article{arxiv.2506.01274,
  title  = {ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding},
  author = {Hosu Lee and Junho Kim and Hyunjun Kim and Yong Man Ro},
  journal= {arXiv preprint arXiv:2506.01274},
  year   = {2025}
}