中文

视觉代理记忆:通过在线索引、层次记忆和代理检索实现在线长视频理解

计算机视觉与模式识别 2026-05-19 v1 人工智能

摘要

长视频理解不仅需要大型上下文窗口,还需要一种记忆机制来决定保留哪些视觉证据,在长时间尺度上保持其可检索性,并以可恢复的观察而非仅压缩后的隐状态来作为后续推理的依据。我们提出了视觉代理记忆(VAM),这是一个无训练框架,包含三个组件。线上索引支持在流式约束下进行选择性证据保留。层次记忆将保留的证据组织为平行表示,使时间上下文与空间观察保持一致。代理检索搜索、检查和验证候选证据,然后生成以 grounding 为依据的答案。在 OVO-Bench 上,VAM 在所有已报告基线中实现最高的 RT+BT 平均值(68.41),超越了对同一底层 MLLM(Gemini 3 Flash,67.46)的端到端使用。在 MM-Lifelong train@month(105.6 小时,51 天)的时间尺度分割上,VAM 达到 17.11%,仅次于 ReMA 采用 GPT-5(17.62%)。这些结果表明,长期视视频理解受益于将视觉记忆视为显式、可检查和可查询的基质。代码已公开于 https://github.com/yiliu-li/Visual-Agentic-Memory。

关键词

引用

@article{arxiv.2605.16481,
  title  = {Visual Agentic Memory: Enabling Online Long Video Understanding via Online Indexing, Hierarchical Memory, and Agentic Retrieval},
  author = {Aiden Yiliu Li and Nels Numan and Anthony Steed},
  journal= {arXiv preprint arXiv:2605.16481},
  year   = {2026}
}