中文

划分再定位:面向长视频理解的查询类型自适应帧选择

计算机视觉与模式识别 2026-03-26 v2 人工智能 机器学习

摘要

大型多模态模型(LMM)用于长视频理解时,受限于上下文长度以及处理稠密视频标记的计算成本 prohibitive,限制了其应用。因此,近期研究聚焦于查询感知式帧选择方法,这类方法常常计算开销显著。本文挑战了此类复杂搜索机制是否普适必要的假设。我们首先识别并验证了查询类型体系,将其区分为全局查询与局部查询。我们表明,针对全局查询,均匀抽样既有效又高效;而针对局部查询,确实需要查询感知式选择以获得最佳性能。基于此洞见,我们提出了DIG(Divide, then Ground)框架,实现查询类型自适应的帧选择策略。具体而言,DIG对全局查询采用高效的均匀抽样,对局部查询激活专用管道以提取查询相关帧。在三个长视频理解基准测试上进行实验,表明DIG始终优于现有基线方法,并能鲁健地提升LMM性能,即便将输入帧数扩展至256。

关键词

引用

@article{arxiv.2512.04000,
  title  = {Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding},
  author = {Jialuo Li and Bin Li and Jiahao Li and Yan Lu},
  journal= {arXiv preprint arXiv:2512.04000},
  year   = {2026}
}

备注

CVPR 2026