Goldfish:任意长度视频的视觉-语言理解
计算机视觉与模式识别
2024-07-18 v1
摘要
当前大多数基于大语言模型(LLM)的视频理解模型仅能处理数分钟内的视频。然而,由于“噪声与冗余”以及“内存与计算”的限制,它们在处理长视频时面临困难。本文提出 Goldfish,一种专为理解任意长度视频而设计的方法。我们还引入了 TVQA-long 基准,专门用于评估模型在视觉和文本内容方面理解长视频的能力。Goldfish 通过一种高效的检索机制来应对这些挑战,该机制首先收集与指令最相关的 top-k 视频片段,然后再生成所需的回答。这种检索机制的设计使 Goldfish 能够高效处理任意长度的视频序列,从而便于其在电影或电视剧等场景中的应用。为辅助检索过程,我们开发了 MiniGPT4-Video,用于为视频片段生成详细描述。针对长视频评估基准稀缺的问题,我们通过聚合整集剧集的问题,将 TVQA 短视频基准适配用于扩展内容分析,从而将评估从部分理解转变为全剧集理解。我们在 TVQA-long 基准上达到了 41.78% 的准确率,超越先前方法 14.94%。我们的 MiniGPT4-Video 在短视频理解方面也表现出色,在 MSVD、MSRVTT、TGIF 和 TVQA 短视频基准上分别超出当前最优方法 3.23%、2.03%、16.5% 和 23.59%。这些结果表明,我们的模型在长视频和短视频理解方面均有显著提升。我们的模型和代码已在 https://vision-cair.github.io/Goldfish_website/ 公开。
引用
@article{arxiv.2407.12679,
title = {Goldfish: Vision-Language Understanding of Arbitrarily Long Videos},
author = {Kirolos Ataallah and Xiaoqian Shen and Eslam Abdelrahman and Essam Sleiman and Mingchen Zhuge and Jian Ding and Deyao Zhu and Jürgen Schmidhuber and Mohamed Elhoseiny},
journal= {arXiv preprint arXiv:2407.12679},
year = {2024}
}
备注
25 pages, 11 figures, accepted by ECCV 2024