WAT:在线视频理解需要在思考前先观看
计算机视觉与模式识别
2026-03-17 v1
摘要
多模态大型语言模型 (MLLM) 在图像理解方面展现出强大能力,激励了最近的研究将其扩展到视频推理。然而,现有的视频 LLM 在在线流式场景中难以应对:必须在严格的内存限制下保持长时间的时序上下文。我们提出了 WAT (Watching Before Thinking),一个用于在线视频推理的两阶段框架。WAT 将处理分为查询无关的观看阶段和查询触发的思考阶段。观看阶段构建分层记忆系统,包含缓冲最近帧的短期记忆 (STM),以及采用冗余感知驱动驱逐策略,维护历史内容多样性摘要的固定容量长期记忆 (LTM)。在思考阶段,一个基于上下文的检索机制将查询与当前 STM 上下文组合,在 LTM 中检索相关历史帧,以进行跨时序推理。为支持在线视频任务的训练,我们引入了 WAT-85K,一个包含流式式标注的数据集,强调实时感知、逆向追踪和预测。实验表明,WAT 在在线视频基准测试中实现了状态-of-the-art 性能,包括在 StreamingBench 上的 77.7% 准确率和 OVO-Bench 上的 55.2%,在保持实时帧率的同时,超越了现有的开源在线视频 LLM。
引用
@article{arxiv.2603.13412,
title = {WAT: Online Video Understanding Needs Watching Before Thinking},
author = {Zifan Han and Hongbo Sun and Jinglin Xu and Canhui Tang and Yulong Lei and Xuchong Zhang and Hongbin Sun and Zhongjiang He and Hao Sun},
journal= {arXiv preprint arXiv:2603.13412},
year = {2026}
}