中文

一种用于长程视频问答的简单大语言模型框架

计算机视觉与模式识别 2024-10-11 v3

摘要

我们提出了 LLoVi,一种用于长程视频问答(LVQA)的基于语言的框架。与以往通常需要昂贵成本且需要专门长程视频建模设计(如记忆队列、状态空间层等)的长程视频理解方法不同,我们的方法将帧/片段级视觉描述器(如 BLIP2、LaViLa、LLaVA)与大语言模型(GPT-3.5、GPT-4)相结合,构建了一个简单却令人惊讶地有效的 LVQA 框架。具体而言,我们将 LVQA 的短程和长程建模方面分解为两个阶段。首先,我们使用短期视觉描述器为从长输入视频中密集采样的短视频片段(长度为 0.5-8 秒)生成文本描述。随后,大语言模型聚合这些密集提取的短期描述,执行理解整个视频并回答问题所需的长程时间推理。为了分析为何我们这一简单框架如此有效,我们对系统的各个组件进行了全面评估。实证分析表明,视觉描述器和大语言模型的选择对于良好的 LVQA 性能至关重要。此外,我们展示了一种专用提示策略,即先让大语言模型总结嘈杂的短期视觉描述,再回答给定的输入问题,这可显著提升 LVQA 性能。在以最擅长处理超长形式视频问答基准而闻名的 EgoSchema 上,我们的方法达到了 50.3% 的准确率,比此前表现最佳的方法高出 18.1%(绝对增益)。此外,我们的方法在 NeXT-QA 和 IntentQA 上分别比此前的最先进方法高出 4.1% 和 3.1%。我们还将 LLoVi 扩展至接地式 LVQA,并显示其在 NeXT-GQA 数据集上优于所有先前方法。我们将代码发布在 https://github.com/CeeZh/LLoVi。

关键词

引用

@article{arxiv.2312.17235,
  title  = {A Simple LLM Framework for Long-Range Video Question-Answering},
  author = {Ce Zhang and Taixi Lu and Md Mohaiminul Islam and Ziyang Wang and Shoubin Yu and Mohit Bansal and Gedas Bertasius},
  journal= {arXiv preprint arXiv:2312.17235},
  year   = {2024}
}

备注

EMNLP 2024 main