CurveStream:基于曲率感知的层次化视觉记忆管理提升多模态大语言模型流式视频理解
计算机视觉与模式识别
2026-03-23 v1
摘要
多模态大语言模型在离线视频理解方面取得了显著进展,但其应用于流式视频受限于视觉 token 的线性增长,常导致内存溢出(OOM)或灾难性遗忘。现有视觉保留和记忆管理方法通常依赖均匀抽样、低层物理指标或被动缓存驱逐。然而,这些策略缺乏内在语义感知能力,可能破坏语义连贯性,模糊临界且关键的语义转换。为此,我们提出 CurveStream,一个训练自由、曲率感知的层次化视觉记忆管理框架。我们的 method 受到这样一个关键观察的启发:连续特征轨迹上的高曲率区域与关键全局语义转换紧密对齐。基于此几何洞察,CurveStream 通过计算曲率分数评估实时语义强度度,并集成在线 K-Sigma 动态阈值以在严格的 token 预算下自适应地将帧路由到清晰或模糊记忆状态。跨不同时间尺度的评估表明,轻量级框架 CurveStream 在各种基线上 consistently 稳定地实现超过 10% 的绝对性能提升(例如在 StreamingBench 上的 10.69%,在 OVOBench 上的 13.58%),树立了流式视频感知的新 SOTA 成果。该代码将在 https://github.com/streamingvideos/CurveStream 发布。
引用
@article{arxiv.2603.19571,
title = {CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management},
author = {Chao Wang and Xudong Tan and Jianjian Cao and Kangcong Li and Tao Chen},
journal= {arXiv preprint arXiv:2603.19571},
year = {2026}
}