中文

VideoARM:面向长时段视频理解的基于层次记忆的代理推理

计算机视觉与模式识别 2026-03-31 v2 计算与语言

摘要

长时段视频理解因其扩展的时间结构和稠密的多模态线索而具有挑战性。尽管近期进展取得显著成果,许多现有方法仍依赖手工设计的推理管道,或采用代币消耗较大的视频预处理来指导大语言模型进行自主推理。为克服这些限制,我们引入 VideoARM,这是一种面向长时段视频理解的 Agentic Reasoning-over-hierarchical-Memory 范式。不同于静态、穷尽的预处理,VideoARM 执行自适应、即时发生的代理式推理和记忆构建。具体而言,VideoARM 执行一种自适应且持续的循环式观察、思考、行动和记忆,其中一个控制器自主调用工具,以粗到细的方式解释视频,从而大幅度减少代币消耗。并行地,一个层次化的多模态记忆持续捕获和更新操作中各层次的线索,为控制器在决策过程中提供精确的上下文信息。在流行基准测试上的实验表明,VideoARM 在长时段视频上超越最新方法 DVD,同时显著降低了代币消耗。

关键词

引用

@article{arxiv.2512.12360,
  title  = {VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding},
  author = {Yufei Yin and Qianke Meng and Minghao Chen and Jiajun Ding and Zhenwei Shao and Zhou Yu},
  journal= {arXiv preprint arXiv:2512.12360},
  year   = {2026}
}

备注

Accepted to CVPR 2026, code available at https://milvlg.github.io/videoarm/