Video-LevelGauge:探究大型视频语言模型中的上下文位置偏差
计算机视觉与模式识别
2025-09-01 v3
摘要
大型视频语言模型(LVLMs)在视频理解方面取得了显著进展,推动了相应评估基准的发展。然而,现有基准通常评估整个视频序列的整体表现,忽略了上下文位置偏差这一关键但尚未充分探索的LVLM表现方面。我们提出Video-LevelGauge,一个专门用于系统评估LVLM中位置偏差的基准。我们采用标准化探针和定制化上下文设置,允许灵活控制上下文长度、探针位置和上下文类型以模拟多样化真实场景。此外,我们引入了一种结合统计量与形态模式识别的综合分析方法以刻画偏差。我们的基准包含438个手动策划的视频,涵盖多种类型,产生1177个高质量选择题和120个开放式问题,经过有效性验证以暴露位置偏差。基于这些,我们评估了27种最先进的LVLM,包括商业和开源模型。我们的发现揭示了许多领先开源模型中存在显著的位置偏差,通常表现出头部或邻居内容偏好。相比之下,像Gemini 2.5-Pro这样的商业模型在整个视频序列中展现出令人印象深刻且一致的表现。对上下文长度、上下文变化和模型规模的进一步分析为缓解偏差和指导模型改进提供了可操作的见解。
引用
@article{arxiv.2508.19650,
title = {Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models},
author = {Hou Xia and Zheren Fu and Fangcan Ling and Jiajun Li and Yi Tu and Zhendong Mao and Yongdong Zhang},
journal= {arXiv preprint arXiv:2508.19650},
year = {2025}
}