高效长视频理解的紧凑视频表示学习
计算机视觉与模式识别
2026-02-23 v1
摘要
随着最近视频骨干网络架构的进步,结合大语言模型 (LLM) 的卓越成就,分析跨越数十分钟的长视频已变得可行且日益普及。然而,视频序列固有的冗余性为当今 SOTA 模型带来了显著挑战。这些挑战主要源于两个方面:1)在内存约束下有效地纳入更多帧;2)从海量输入数据中提取判别性信息。本文引入一种新型端到端架构用于长视频理解,包括基于信息密度的自适应视频采样器 (AVS) 和集成到多模态大语言模型 (MLLM) 中的基于自编码器的时空视频压缩器 (SVC)。我们提出的系统具有两个主要优势:它能自适应且有效地从时长各异的视频序列中捕获关键信息;它在保持关键判别性信息的同时实现了高压缩率。该框架在各种基准测试上显示出有前景的性能,尤其在长视频理解任务和标准视频理解基准测试中表现突出。这些结果凸显了该方法的多样性和有效性,尤其在处理延长视频序列的复杂性方面。
引用
@article{arxiv.2602.17869,
title = {Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models},
author = {Yuxiao Chen and Jue Wang and Zhikang Zhang and Jingru Yi and Xu Zhang and Yang Zou and Zhaowei Cai and Jianbo Yuan and Xinyu Li and Hao Yang and Davide Modolo},
journal= {arXiv preprint arXiv:2602.17869},
year = {2026}
}