VideoChat-A1:通过链式拍摄推理处理长视频
计算机视觉与模式识别
2026-03-17 v3
摘要
视频理解的最新进步由多模态大语言模型(MLLMs)推动。然而,这些 MLLMs 在分析短视频方面表现良好,但在理解长时序视频时面临挑战。为此,已提出多种代理方法,将 MLLMs 作为在长视频中检索额外上下文知识的代理。然而,大多数现有方法忽略了关键事实:长视频由多个镜头组成,即回答用户问题时,深入理解相关镜头至关重要。若缺乏这种洞察,代理方法常会错误地寻找冗余甚至噪声的时序上下文,从而限制了长视频理解能力。为填补这一空白,我们提出了 VideoChat-A1,这是一种新的长视频代理范式。不同于现有方法,VideoChat-A1 能够通过链式拍摄推理范式深入处理长视频。具体而言,它逐步选择用户问题相关的镜头,并以粗到细的方式分析这些镜头。通过沿着镜头链的多模态推理,VideoChat-A1 能有效模拟人类逐步思考的过程,实现对长视频中可交互发现优质时序上下文的深入理解。大量实验表明,VideoChat-A1 在主流长视频 QA 基准上实现了领先性能,例如在带字幕的 VideoMME 上达到 77.0,在 EgoSchema 上达到 70.1,相较于其强大基线(如 InternVL2.5-8B 和 InternVideo2.5-8B)分别提升了最高达 10.1% 和 6.2%。相较于领先的闭源 GPT-4o 和 Gemini 1.5 Pro,VideoChat-A1 在准确率方面表现具竞争力,但仅需 7% 的输入帧和 12% 的推理时间。代码已公开于 https://github.com/SpXace/VideoChat-A1。
引用
@article{arxiv.2506.06097,
title = {VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning},
author = {Zikang Wang and Boyu Chen and Zhengrong Yue and Yi Wang and Yu Qiao and Limin Wang and Yali Wang},
journal= {arXiv preprint arXiv:2506.06097},
year = {2026}
}