中文

少选多思:为视频推理优先考虑证据纯度

计算机视觉与模式识别 2025-10-20 v1 人工智能

摘要

长视频推理对于视频大语言模型(Video LLMs)仍然是一个重大挑战,因为静态均匀帧采样会导致信息稀释并掩盖关键证据。此外,现有的像素空间视频推理代理旨在主动与视频交互以获取新的视觉信息,但由于缺乏严格的奖励机制来强制执行证据纯度,并且无法在预采样帧之外进行时间信息补充,因此仍然不是最优的。为了解决这一关键差距,我们提出了一种新颖的、以证据优先的自适应框架,该框架基于我们的核心理念:“少选多思”。我们的核心贡献是证据感知强化学习(EARL)框架,它将模型转变为一个主动的证据询问者。EARL经过精确设计,能够动态选择最相关的帧,并且关键的是,能够在选定的关键帧周围执行局部重采样,以获取细粒度的时间细节。在五个要求严苛的视频推理基准上的大量实验表明,我们经过EARL训练的模型在开源Video LLMs中达到了新的最先进水平,同时学习到了一个有效且高纯度的视觉证据选择策略。令人印象深刻的是,我们的7B模型在LongVideoBench上达到59.8%,在MVBench上达到69.0%,在VideoMME上达到64.9%。这些结果凸显了优先考虑证据纯度的重要性以及我们框架的有效性。

关键词

引用

@article{arxiv.2510.15440,
  title  = {Select Less, Reason More: Prioritizing Evidence Purity for Video Reasoning},
  author = {Xuchen Li and Xuzhao Li and Shiyu Hu and Kaiqi Huang},
  journal= {arXiv preprint arXiv:2510.15440},
  year   = {2025}
}

备注

Preprint, Under review