中文

流式视频理解的简单基线

组合数学 2026-04-03 v1 群论

摘要

近期的流式视频理解方法日益依赖复杂的记忆机制来处理长视频流。我们挑战这一趋势,提出一个简单发现:仅将最近 N 帧输入到即插即用视觉语言模型(VLM)的滑动窗口基线即可匹配或超越已发表的流式模型。我们将该基线形式化为 SimpleStream,并在 OVO-Bench 和 StreamingBench 上对其进行评估,分别针对 13 个主要的离线和在线视频 LLM 基线进行测试。尽管方法简单,SimpleStream 仍能持续提供强劲性能。仅使用 4 帧最近的帧,就能在 OVO-Bench 上达到 67.7% 的平均准确率,在 StreamingBench 上达到 80.59%。受控消融实验进一步表明,更长上下文的价值取决于 backbone 而非随模型规模线性增长,并揭示了持续感知-记忆之间的一致性权衡:添加更多历史背景可改善召回率,但往往会削弱实时感知。这表明除非在相同协议下明显超越 SimpleStream,否则不应将更强的记忆、检索或压缩模块视为进步的证据。我们因此主张未来的流式基准应将最近场景感知与长程记忆分开,以便更清晰地评估来自添加复杂度的性能提升。

关键词

引用

@article{arxiv.2604.02316,
  title  = {A construction of 2-arc-transitive non-solvable covers of complete graphs},
  author = {Jiyong Chen and Cai Heng Li and Ci Xuan Wu and Yan Zhou Zhu},
  journal= {arXiv preprint arXiv:2604.02316},
  year   = {2026}
}

备注

10 pages, accepted for publication in European Journal of Combinatorics