中文

ReWind:可学习记忆引导的长视频理解

计算机视觉与模式识别 2025-03-31 v2 人工智能

摘要

视觉语言模型 (VLM) 对需要集成文本和视觉信息的应用至关重要。然而,现有的 VLM 在处理长视频时因计算效率低、内存受限以及难以在延长序列上保持连贯理解而受到挑战。为解决这些问题,我们引入了 ReWind,一种新型基于记忆的 VLM,旨在在保持时序保真度的同时高效处理长视频理解。ReWind 在两个阶段运行。在第一个阶段,ReWind 维护一个动态可学习记忆模块,采用新颖的 read-perceive-write 循环将 instruction-relevant 视觉信息存储和更新 as 视频展开。该模块利用可学习查询和记忆内容与输入流之间的 cross-attention,确保通过与 token 数量成线性比例缩放来实现低内存要求。在第二个阶段,我们提出了一种由记忆内容引导的自适应帧选择机制,用于识别 instruction-relevant 的关键时刻。它通过选择少数高分辨率帧来丰富记忆表示中的空间信息,这些帧随后与记忆内容组合后输入到大语言模型 (LLM) 以生成最终答案。我们经验性地演示了 ReWind 在视觉问答 (VQA) 和时序锚定任务中的优越性能,在长视频基准测试中超越了之前的方法。值得注意的是,ReWind 在 MovieChat-1K VQA 数据集上实现了 +13% 的得分提升,在 Charades-STA 上实现了 +12% 的准确率提高,在时序锚定任务上实现了 +8% 的 mIoU 提升。

关键词

引用

@article{arxiv.2411.15556,
  title  = {ReWind: Understanding Long Videos with Instructed Learnable Memory},
  author = {Anxhelo Diko and Tinghuai Wang and Wassim Swaileh and Shiyan Sun and Ioannis Patras},
  journal= {arXiv preprint arXiv:2411.15556},
  year   = {2025}
}