中文

面向视频问答的 A.I.R.:实现自适应、迭代与推理驱动的帧选择

计算机视觉与模式识别 2026-03-30 v3

摘要

有效地将 Vision-Language Models (VLMs) 应用于视频问答 (VideoQA) 取决于选择简洁且全面的帧集合,因为处理整个视频在计算上是不可行的。然而,当前的帧选择方法面临一个关键权衡:依赖轻量级相似性模型(如 CLIP)的方法往往无法捕捉复杂查询的细微差异,导致不准确的相似度得分,无法反映查询-帧的真实相关性,从而破坏帧选择。而利用 VLMs 进行深入分析的方法虽然准确率更高,但计算成本不可接受。为此,我们提出 A.I.R.,一种基于自适应、迭代和推理的训练-free 帧选择方法。我们利用强大的 VLMs 对复杂查询进行深层语义分析,并在成本效益高的迭代循环中部署该分析,该循环仅处理少量最具潜力的帧。广泛的实验表明,我们的方法在各种 VideoQA 数据集上超越了现有的帧选择方法,显著提升了基础 VLMs 的性能,并在其他基于 VLMs 的技术之间实现了显著的计算效率提升。

关键词

引用

@article{arxiv.2510.04428,
  title  = {A.I.R.: Enabling Adaptive, Iterative, and Reasoning-based Frame Selection For Video Question Answering},
  author = {Yuanhao Zou and Shengji Jin and Andong Deng and Youpeng Zhao and Jun Wang and Chen Chen},
  journal= {arXiv preprint arXiv:2510.04428},
  year   = {2026}
}

备注

ICLR 2026 Paper