聚焦位置:基于查询调制的多模态长视频关键帧选择
计算机视觉与模式识别
2026-04-21 v1 多媒体
摘要
由于处理稠密帧序列的计算成本高昂,多模态大语言模型(MLLM)面临长视频理解的巨大挑战。现有方法通常依赖单一视觉中心指标(如CLIP相似性)或静态融合启发式分数,形成"一刀切"范式,常常失效:视觉唯一指标对剧情导向叙述查询无效,而无差别纳入文本分数则为纯视觉任务引入严重的"模态噪声"。为突破此瓶颈,我们提出Q-Gate,一个即插即用且无训练的框架,将关键帧选择视为动态模态路由问题。我们将检索过程解耦为三个轻量专家流:视觉定位用于获取局部细节,全局匹配用于场景语义,情境对齐用于字幕驱动叙述。关键在于,Q-Gate引入查询调制门控机制,利用LLM的上下文推理评估查询意图,并动态在专家之间分配注意力权重。该机制智能激活必要的模态,同时"静音"不相关模态,从而最大化信噪比。广泛实验表明,在LongVideoBench和Video-MME上,Q-Gate显著优于最先进的基线。通过有效抑制模态特定噪声,Q-Gate为可扩展的视频推理提供了稳健且高度可解释的解决方案。
引用
@article{arxiv.2604.17422,
title = {Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding},
author = {Shaoguang Wang and Weiyu Guo and Ziyang Chen and Xuming Hu and Hui Xiong},
journal= {arXiv preprint arXiv:2604.17422},
year = {2026}
}
备注
9 pages, 7 figures, 9 tables. Preprint