Long-VMNet:通过固定内存加速长形式视频理解
计算机视觉与模式识别
2025-03-19 v1
摘要
长形式视频理解对于视频检索、摘要生成和问答等各种应用至关重要。然而,传统方法需要大量计算资源,常在 GPU 内存方面受到瓶颈制约。为解决此问题,我们提出了一种新的视频理解方法——Long-Video Memory Network(Long-VMNet),该方法采用固定大小的内存表示来存储从输入视频中抽样得到的判别性 patches。Long-VMNet 通过利用神经采样器识别判别性 tokens 来实现效率提升。此外,Long-VMNet 只需对视频进行一次扫描,显著提升了效率。在 Rest-ADL 数据集上的结果表明,Long-VMNet 在长形式视频检索和问答方面的推理时间提高了 18 倍至 75 倍,同时保持了具竞争力的预测性能。
引用
@article{arxiv.2503.13707,
title = {Long-VMNet: Accelerating Long-Form Video Understanding via Fixed Memory},
author = {Saket Gurukar and Asim Kadav},
journal= {arXiv preprint arXiv:2503.13707},
year = {2025}
}