中文

VideoZoomer:用于长视频推理的强化学习时序聚焦

计算机视觉与模式识别 2025-12-30 v1 人工智能

摘要

多模态大语言模型(MLLM)在视觉-语言任务中取得了显著进展,但由于上下文窗口有限,在长视频理解方面仍然受限。因此,主流方法倾向于依赖均匀帧采样或静态预选,这可能会忽略关键证据,并且无法在推理过程中纠正其初始选择错误。为了克服这些限制,我们提出了VideoZoomer,这是一个新颖的智能体框架,使MLLM能够在推理过程中动态控制其视觉焦点。VideoZoomer从一个粗略的低帧率概览开始,调用时序缩放工具,在自主选择的时刻获取高帧率片段,从而以多轮交互的方式逐步收集细粒度证据。为此,我们采用了两阶段训练策略:首先在一个由提炼的示例和反思轨迹构成的精选数据集上进行冷启动监督微调,然后通过强化学习进一步优化智能体策略。大量实验表明,我们的7B模型展现出多样且复杂的推理模式,在广泛的长期视频理解和推理基准测试中表现出色。这些涌现能力使其能够持续超越现有的开源模型,甚至在具有挑战性的任务上与专有系统相媲美,同时在减少帧预算的情况下实现卓越的效率。

关键词

引用

@article{arxiv.2512.22315,
  title  = {VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning},
  author = {Yang Ding and Yizhen Zhang and Xin Lai and Ruihang Chu and Yujiu Yang},
  journal= {arXiv preprint arXiv:2512.22315},
  year   = {2025}
}