APVR:基于自适应枢轴视觉信息检索的小时级长视频理解
计算机视觉与模式识别
2025-11-18 v3
摘要
当前多模态大语言模型(MLLM)在处理小时级视频理解方面面临重大挑战,不仅在于建模长视频的大量信息,还在于在训练和推理期间克服内存瓶颈和资源限制。虽然最近的无训练方法通过压缩视觉特征缓解了资源需求,但依赖不完整视觉信息的做法限制了性能潜力。为此,本文提出了自适应枢轴视觉信息检索(APVR)框架,一个无训练框架,通过层次化检索和保留充分且重要的视觉信息。APVR通过两个互补组件突破了内存瓶颈限制:枢轴帧检索采用查询扩展和迭代时空置信度评分以识别相关视频帧,枢轴标记检索在最多1024个枢轴帧内执行查询感知注意驱动的标记选择。这种双层次方法使我们能够在保持语义忠实度的同时处理长达数小时的视频。在三个不同基线MLLM上的实验验证表明,APVR在LongVideoBench、VideoMME和MLVU上的性能分别提升了9.5%、4.6%和9.7%。APVR在无训练和有训练方法中均实现了最佳结果。
引用
@article{arxiv.2506.04953,
title = {APVR: Hour-Level Long Video Understanding with Adaptive Pivot Visual Information Retrieval},
author = {Hong Gao and Yiming Bao and Xuezhen Tu and Bin Zhong and Linan Yue and Minling Zhang},
journal= {arXiv preprint arXiv:2506.04953},
year = {2025}
}
备注
Accepted by AAAI 2026