中文

∞-Video:基于连续时间记忆整合的无训练长视频理解方法

计算机视觉与模式识别 2025-05-20 v2 机器学习

摘要

当前的视频语言模型由于上下文长度有限且依赖于稀疏帧子采样,常常导致信息丢失,因此在长视频理解方面存在困难。本文介绍了∞-Video,它通过一种连续时间长期记忆(LTM)整合机制,能够处理任意长的视频。我们的框架增强了视频Q-Former,使其能够高效处理无界视频上下文,且无需额外训练。通过连续注意力,我们的方法动态地为最相关的视频片段分配更高的粒度,形成随时间演化的“粘性”记忆。在Video-LLaMA和VideoChat2上的实验表明,在视频问答任务中性能有所提升,展示了连续时间LTM机制在实现可扩展且无训练的长视频理解方面的潜力。

关键词

引用

@article{arxiv.2501.19098,
  title  = {$\infty$-Video: A Training-Free Approach to Long Video Understanding via Continuous-Time Memory Consolidation},
  author = {Saul Santos and António Farinhas and Daniel C. McNamee and André F. T. Martins},
  journal= {arXiv preprint arXiv:2501.19098},
  year   = {2025}
}

备注

17 pages, 7 figures