GridProbe:基于后验探测的长视频VLMs自适应推理计算
计算机视觉与模式识别
2026-05-12 v1 人工智能
摘要
长视频理解在VLMs中受限于对数千帧单一前向传递的二次注意力成本。常见做法是先选择小型信息丰富的帧子集,再进行前向传递;训练自由的选择器通常依赖辅助编码器空间相似性,此类信号受限于对比预训练,对推理密集型问题(如否定判断、跨帧计数、整体总结)效果不佳。我们提出GridProbe——一种高效的训练自由后验探测推理范式,通过冻结VLm自身推理的后验得分,对证据进行评分,再自适应选择与问题相关的帧,从而实现亚二次注意力成本且几乎无精度损失。我们将帧布置在网格中,运行轻量级行R与列C探针,每个探针读取其峰值后验作为查询条件置信度。R与C的外积得到可解释的重要性图,其偏度与峰度驱动形状自适应选择,此规则可可靠地用问题相关的取代固定帧预算。我们实证证明,在无需看到答案的情况下即可跟踪问题内在难度,体现了测试时自适应计算的特征。在Video-MME-v2上,GridProbe在TFLOPs降低下,仅比单一基线差pp平均准确率;在LongVideoBench上则实现Pareto优势(pp、计算)。由于选择器与QA模型可解耦,组合小型2B选择器与更强大的4B或8B QA模型,在平均计算下显著优于2B单体基线(提升最高达pp),且无需再训练。重要性图的可解释性为行为诊断、 grounding及帧选择蒸馏开辟了未来方向。
引用
@article{arxiv.2605.10762,
title = {GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs},
author = {Mohamed Eltahir and Lama Ayash and Ali Habibullah and Tanveer Hussain and Naeemullah Khan},
journal= {arXiv preprint arXiv:2605.10762},
year = {2026}
}