中文

VideoAgent:以大语言模型作为智能体的长视频理解

计算机视觉与模式识别 2024-03-18 v1 人工智能 计算与语言 信息检索

摘要

长视频理解是计算机视觉领域的一项重大挑战,要求模型具备对长多模态序列进行推理的能力。受人类长视频理解认知过程的启发,我们强调交互式推理与规划,而非处理冗长视觉输入的能力。我们引入了一种新颖的基于智能体的系统 VideoAgent,该系统采用大语言模型作为中央智能体,迭代地识别并整合关键信息以回答问题,同时以视觉-语言基础模型作为工具来翻译和检索视觉信息。在具有挑战性的 EgoSchema 和 NExT-QA 基准上进行评估,VideoAgent 分别实现了 54.1% 和 71.3% 的零样本准确率,平均仅使用了 8.4 和 8.2 帧。这些结果证明了我们的方法在有效性和效率上均优于当前最先进方法,凸显了基于智能体的方法在推进长视频理解方面的潜力。

关键词

引用

@article{arxiv.2403.10517,
  title  = {VideoAgent: Long-form Video Understanding with Large Language Model as Agent},
  author = {Xiaohan Wang and Yuhui Zhang and Orr Zohar and Serena Yeung-Levy},
  journal= {arXiv preprint arXiv:2403.10517},
  year   = {2024}
}