中文

基于MLLM智能体的渐进式视频浓缩用于长视频理解

计算机视觉与模式识别 2026-04-06 v1

摘要

理解长视频需要在严格的计算预算下从长序列中提取与查询相关的信息。现有的文本-然后-LLM流水线会丢失细粒度的视觉线索,而基于视频的多模态大语言模型(MLLM)可以保留视觉细节,但需要处理过多帧且计算成本高昂。在本工作中,我们旨在利用MLLM实现高效的视频理解。我们提出了ProVCA,一个渐进式视频浓缩智能体,它在多个粒度上迭代定位关键视频帧。ProVCA首先采用片段定位模块识别与查询相关的视频片段,然后采用片段选择模块基于相似性选择重要片段,最后采用关键帧细化模块在这些片段中精确定位特定关键帧。通过从粗粒度片段逐步缩小到细粒度帧的范围,ProVCA为基于MLLM的推理识别出一组少量关键帧。ProVCA在EgoSchema上取得了69.3%、在NExT-QA上取得了80.5%、在IntentQA上取得了77.7%的零样本准确率,同时使用的帧数少于先前的无训练方法。

关键词

引用

@article{arxiv.2604.02891,
  title  = {Progressive Video Condensation with MLLM Agent for Long-form Video Understanding},
  author = {Yufei Yin and Yuchen Xing and Qianke Meng and Minghao Chen and Yan Yang and Zhou Yu},
  journal= {arXiv preprint arXiv:2604.02891},
  year   = {2026}
}

备注

Accepted to ICME 2026