中文

基于查询条件证据关键帧采样用于 MLLM 长视频理解

计算机视觉与模式识别 2026-04-02 v1 人工智能 机器学习

摘要

多模态大语言模型 (MLLM) 在视频问答任务中表现出强大能力,但受限于上下文长度和计算成本,难以应用于长视频,使得关键帧采样变得必不可少。现有方法通常依赖语义相关性或强化学习,要么无法捕捉证据线索,要么 suffer from 低效的组合优化。本文提出一种基于信息瓶颈理论的证据驱动关键帧采样框架。我们将关键帧选择建模为在所选帧与查询之间的条件互信息最大化,提供了一个原则性目标,反映每帧对回答问题的贡献。为使该目标可实现,我们利用其结构导出分解优化,将子集选择简化为独立的帧级评分。我们进一步引入查询条件证据评分网络,采用对比目标进行训练,以高效估计证据重要性。实验在长视频理解基准测试上表明,我们的方法在严格的 token 预算下 consistently 优于先前采样策略,同时显著提高训练效率。

关键词

引用

@article{arxiv.2604.01002,
  title  = {Query-Conditioned Evidential Keyframe Sampling for MLLM-Based Long-Form Video Understanding},
  author = {Yiheng Wang and Lichen Zhu and Yueqian Lin and Yudong Liu and Jingyang Zhang and Hai "Helen" Li and Yiran Chen},
  journal= {arXiv preprint arXiv:2604.01002},
  year   = {2026}
}