流式视频理解的简单基线
组合数学
2026-04-03 v1 群论
摘要
近期的流式视频理解方法日益依赖复杂的记忆机制来处理长视频流。我们挑战这一趋势,提出一个简单发现:仅将最近 N 帧输入到即插即用视觉语言模型(VLM)的滑动窗口基线即可匹配或超越已发表的流式模型。我们将该基线形式化为 SimpleStream,并在 OVO-Bench 和 StreamingBench 上对其进行评估,分别针对 13 个主要的离线和在线视频 LLM 基线进行测试。尽管方法简单,SimpleStream 仍能持续提供强劲性能。仅使用 4 帧最近的帧,就能在 OVO-Bench 上达到 67.7% 的平均准确率,在 StreamingBench 上达到 80.59%。受控消融实验进一步表明,更长上下文的价值取决于 backbone 而非随模型规模线性增长,并揭示了持续感知-记忆之间的一致性权衡:添加更多历史背景可改善召回率,但往往会削弱实时感知。这表明除非在相同协议下明显超越 SimpleStream,否则不应将更强的记忆、检索或压缩模块视为进步的证据。我们因此主张未来的流式基准应将最近场景感知与长程记忆分开,以便更清晰地评估来自添加复杂度的性能提升。
关键词
引用
@article{arxiv.2604.02316,
title = {A construction of 2-arc-transitive non-solvable covers of complete graphs},
author = {Jiyong Chen and Cai Heng Li and Ci Xuan Wu and Yan Zhou Zhu},
journal= {arXiv preprint arXiv:2604.02316},
year = {2026}
}
备注
10 pages, accepted for publication in European Journal of Combinatorics