LLM 处理长视频:利用 LLM 中的交互式视觉适配器推进长视频问答
计算与语言
2024-08-27 v2 计算机视觉与模式识别
摘要
长视频理解是多媒体与人工智能交叉领域中一项重大且持续的挑战。利用大语言模型(LLM)来理解视频正成为一种新兴且极具前景的方法。然而,由于存在大量的视频 token,该方法计算成本高昂;同时因 token 聚合导致视觉清晰度下降,并在回答视频相关问题时面临无关视觉 token 带来的挑战。为缓解这些问题,我们在 LLM 内部提出了一种交互式视觉适配器(Interactive Visual Adapter, IVA),旨在增强与细粒度视觉元素的交互。具体而言,我们首先利用视觉编码器与预训练因果 Transformer 将长视频转化为时间视频 token,随后将其与视频指令一同输入 LLM。接着,我们在 LLM 的内部模块中集成 IVA,该适配器包含一个轻量级时间帧选择器和一个空间特征交互器,用以捕获指令感知且细粒度的视觉信号。因此,所提出的 video-LLM 通过恰当的长视频建模和精确的视觉交互,促进了对长视频内容的全面理解。我们在九个视频理解基准上进行了大量实验,实验结果表明,我们的交互式视觉适配器显著提升了 video LLM 在长视频问答任务上的性能。消融研究进一步验证了 IVA 在理解长视频与短视频方面的有效性。
引用
@article{arxiv.2402.13546,
title = {LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs},
author = {Yunxin Li and Xinyu Chen and Baotain Hu and Min Zhang},
journal= {arXiv preprint arXiv:2402.13546},
year = {2024}
}
备注
12 pages; working in progress