中文

语义感知自适应视觉记忆用于流式视频理解

计算机视觉与模式识别 2026-05-11 v1 人工智能

摘要

在线流式视频理解需要模型实时处理连续的视觉输入并响应用户查询,其中无界的流式输入和不可预测的查询时序将记忆管理问题置于核心位置。现有方法通常通过视觉相似性启发式方法压缩视觉记token,或在压缩基础上增添KV-cache级别的检索。然而,压缩决策很少融入语义信号,检索往往在压缩确定后才被添加,导致两个阶段难以协调。我们提出SAVEMem(Semantic-Aware Adaptive Visual Memory),一个无需训练的双阶段框架,将语义 awareness 引入记忆生成,并使检索范围适应于每个查询。在阶段1中,SAVEMem在恒定记忆预算下在线构建三层流式记忆。固定的伪问题库提供轻量级语义先验,使长期记忆由语义显著性而非仅依据视觉相似性来塑形。在阶段2中,SAVEMem对该记忆执行查询感知检索。锚框条件的新近门控根据查询针对当前时刻还是远程过去来适应检索范围,从短期内存扩展至中期和长期内存。在此范围内,查询与记忆token的晚期交互用于筛选答案候选帧。应用于Qwen2.5-VL,SAVEMem将OVO-Bench整体得分从52.27提升至62.69,在StreamingBench和ODV-Bench上均实现一致提升,同时在128帧时将峰值GPU内存降低48%。

关键词

引用

@article{arxiv.2605.07897,
  title  = {Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding},
  author = {Hang Wu and Sherin Mary Mathews and Yujun Cai and Ming-Hsuan Yang and Yiwei Wang},
  journal= {arXiv preprint arXiv:2605.07897},
  year   = {2026}
}