LongVLM:基于大语言模型的高效长视频理解
计算机视觉与模式识别
2024-07-23 v3
摘要
在大语言模型(LLM)的赋能下,近期基于视频的 LLM(VideoLLM)的进展推动了各类视频理解任务的发展。这些模型通过对大量视觉 token 进行池化或查询聚合来编码视频表征,使得计算与内存成本变得可承受。尽管现有 VideoLLM 成功提供了对视频内容的整体理解,但由于忽略了长视频中的局部信息,它们在实现细节理解方面仍面临挑战。为应对这一挑战,我们引入了 LongVLM,一种用于长视频理解的简单而强大的 VideoLLM,其构建基于长视频通常由连续关键事件、复杂动作和镜头运动组成的观察。我们的方法提出将长视频分解为多个短期片段,并通过分层 token 合并模块为每个片段编码局部特征。这些特征按时间顺序拼接,以保持连续短期片段间的故事情节。此外,我们提出将全局语义整合到每个局部特征中,以增强上下文理解。通过这种方式,我们编码了包含局部与全局信息的视频表征,使 LLM 能够为长视频生成全面的响应。在 VideoChatGPT 基准和零样本视频问答数据集上的实验结果展示了我们的模型相对于先前 SOTA 方法的优越能力。定性示例表明,我们的模型在长视频理解中能产生更精确的响应。代码可在 https://github.com/ziplab/LongVLM 获取。
引用
@article{arxiv.2404.03384,
title = {LongVLM: Efficient Long Video Understanding via Large Language Models},
author = {Yuetian Weng and Mingfei Han and Haoyu He and Xiaojun Chang and Bohan Zhuang},
journal= {arXiv preprint arXiv:2404.03384},
year = {2024}
}
备注
Accepted by ECCV 2024