StreamForest:基于持久事件记忆的高效在线视频理解
计算机视觉与模式识别
2025-09-30 v1
摘要
多模态大语言模型(MLLMs)近期在视频理解领域取得了显著进展。然而,由于历史视觉特征的存储限制以及实时时空推理的不足,它们在实时流场景中的有效性仍然受限。为了应对这些挑战,我们提出了 StreamForest,一种专门为流式视频理解设计的新型架构。StreamForest 的核心是持久事件记忆森林,这是一种将视频帧自适应地组织为多个事件级树状结构的记忆机制。该过程由基于时间距离、内容相似度和合并频率的惩罚函数引导,从而在有限计算资源下实现高效的长期记忆保持。为了增强实时感知,我们引入了细粒度时空窗口,用于捕获详细的短期视觉线索以改善当前场景感知。此外,我们提出了 OnlineIT,一个为流式视频任务量身定制的指令微调数据集。OnlineIT 显著提升了 MLLM 在实时感知和未来预测方面的性能。为了评估实际应用中的泛化能力,我们引入了 ODV-Bench,一个专注于自动驾驶场景中实时流式视频理解的新基准。实验结果表明,StreamForest 实现了 SOTA 性能,在 StreamingBench 上的准确率为 77.3%,在 OVBench 上为 60.5%,在 OVO-Bench 上为 55.6%。特别是,即使在极端视觉 token 压缩下(限制为 1024 个 token),相对于默认设置,该模型在八个基准测试中仍保留了 96.8% 的平均准确率。这些结果突显了 StreamForest 在流式视频理解方面的鲁棒性、高效性和泛化能力。
引用
@article{arxiv.2509.24871,
title = {StreamForest: Efficient Online Video Understanding with Persistent Event Memory},
author = {Xiangyu Zeng and Kefan Qiu and Qingyu Zhang and Xinhao Li and Jing Wang and Jiaxin Li and Ziang Yan and Kun Tian and Meng Tian and Xinhai Zhao and Yi Wang and Limin Wang},
journal= {arXiv preprint arXiv:2509.24871},
year = {2025}
}
备注
Accepted as a Spotlight at NeurIPS 2025