中文

LongVU:用于长视频语言理解的时空自适应压缩

计算机视觉与模式识别 2024-10-24 v1

摘要

多模态大语言模型(MLLMs)在理解和分析视频内容方面取得了有前景的进展。然而,受到 LLM 上下文大小的限制,处理长视频仍然是一个重大挑战。为解决这一限制,我们提出了 LongVU,这是一种时空自适应压缩机制,通过保留长视频视觉细节的方式来减少视频标记的数量。我们的想法基于利用跨模态查询和帧间依赖关系来自适应地减少视频中的时空冗余。具体而言,我们利用 DINOv2 特征来消除具有高度相似性的冗余帧。然后我们利用文本引导的跨模态查询进行选择性帧特征压缩。进一步,我们根据帧的时序依赖性对帧进行空间标记压缩。我们的自适应压缩策略能够在给定上下文长度内有效处理大量帧,几乎不损失视觉信息。LongVU 在各种视频理解基准测试中 consistently 超过现有方法,尤其是在小时级视频理解任务(如 VideoMME 和 MLVU)方面。对于轻量级 LLM,LongVU 也能有效地扩展到更小的规模,并实现最先进的视频理解性能。

关键词

引用

@article{arxiv.2410.17434,
  title  = {LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding},
  author = {Xiaoqian Shen and Yunyang Xiong and Changsheng Zhao and Lemeng Wu and Jun Chen and Chenchen Zhu and Zechun Liu and Fanyi Xiao and Balakrishnan Varadarajan and Florian Bordes and Zhuang Liu and Hu Xu and Hyunwoo J. Kim and Bilge Soran and Raghuraman Krishnamoorthi and Mohamed Elhoseiny and Vikas Chandra},
  journal= {arXiv preprint arXiv:2410.17434},
  year   = {2024}
}

备注

Project page: https://vision-cair.github.io/LongVU