VideoMem:通过自适应内存管理增强超长视频理解
计算机视觉与模式识别
2025-12-17 v2
摘要
超长视频理解仍然是一个开放挑战,因为现有的视觉语言模型(VLMs)由于有限的上下文长度和低效的长期记忆保持能力而在处理此类内容时表现不佳。为解决这一问题,近期研究尝试构建外部知识库及相应的检索增强生成(RAG)系统,但这些方法带来了巨大的存储和计算开销。在本文中,我们提出了VideoMem,一个将超长视频理解建模为序列生成任务的全新框架,其核心是自适应内存管理。具体而言,VideoMem动态更新全局内存缓冲区,在视频时间轴上自适应地保留关键信息并丢弃冗余内容。为高效训练VLMs以处理此类长期任务,VideoMem集成了渐进分组相对策略优化(PRPO)算法,配备两个核心模块:渐进状态传播(PSP)自适应地保留有效当前状态,将其传播到下一步rollout,并逐步缩小模型探索空间;时间级联奖励(TCR)进一步缓解奖励稀疏性,提升样本利用率并加速收敛。大量实验表明,VideoMem在超长视频理解任务的多样化基准测试中显著优于现有开源模型。
引用
@article{arxiv.2512.04540,
title = {VideoMem: Enhancing Ultra-Long Video Understanding via Adaptive Memory Management},
author = {Hongbo Jin and Qingyuan Wang and Wenhao Zhang and Yang Liu and Sijie Cheng},
journal= {arXiv preprint arXiv:2512.04540},
year = {2025}
}