场景感知至关重要:借助场景感知的长视频基准揭示视频理解模型中的遗忘现象
计算机视觉与模式识别
2026-05-05 v2
摘要
长视频理解(LVU)仍然是多模态学习的核心挑战。尽管近期的视觉-语言模型(VLMs)取得了显著进展,现有基准主要聚焦于细粒度感知或粗粒度摘要,对长上下文中的时间理解提供有限洞察。在本工作中,我们将场景定义为视频中视觉和语义上下文均保持一致的连贯片段,与人类感知一致。这引出了一个关键问题:当前 VLMs 能否在长场景级上下文中有效推理?为回答这一问题,我们引入了一个新基准 SceneBench,旨在提供场景级挑战。我们的评估揭示 VLMs 在尝试回答场景级问题时准确率急剧下降,表明存在显著的长程上下文遗忘。为进一步验证这些发现,我们提出了场景检索增强生成(Scene-RAG),它通过跨场景检索和整合相关上下文来构建动态场景记忆。该 Scene-RAG 将 VLM 性能提升了 +2.50%,证实当前模型在长上下文保持方面仍然存在困难。我们希望 SceneBench 能鼓励未来研究朝着具有更强类人视频理解能力的 VLMs 方向发展。
引用
@article{arxiv.2603.27259,
title = {Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark},
author = {Seng Nam Chen and Hao Chen and Chenglam Ho and Xinyu Mao and Jinping Wang and Yu Zhang and Chao Li},
journal= {arXiv preprint arXiv:2603.27259},
year = {2026}
}
备注
Accepted to CVPR 2026 (Highlight)