中文

AutoEval-Video:评估大视觉语言模型开放式视频问答的自动基准

计算机视觉与模式识别 2024-07-16 v2

摘要

我们提出一个新颖且具挑战性的基准 AutoEval-Video,用于全面评估大视觉语言模型在开放式视频问答中的表现。AutoEval-Video 的全面性体现在两方面:1)AutoEval-Video 构建了跨越 9 项技能维度的开放式视频问题,涵盖感知、理解与生成能力。2)AutoEval-Video 包含新收集的视频,覆盖超过 40 个不同主题。为高效评估对开放式问题的回答,我们采用基于 LLM 的评估方法,但不同于仅提供参考答案,我们为每一个实例(视频-问题对)标注了独特的评估规则。为最大化这些规则的鲁棒性,我们开发了一种新颖的对抗式标注机制。通过使用实例特定规则作为提示,GPT-4 作为自动评估器可达到约 97.0% 的稳定评估准确率,与人类评估器 94.9%–97.5% 的准确率相当。此外,我们评估了八个大视觉语言模型在 AutoEval-Video 上的性能。其中 GPT-4V(ision) 显著优于其他模型,准确率达 32.2%。然而,相较于人类 72.8% 的准确率,仍有较大提升空间。通过广泛案例研究,我们揭示了 GPT-4V 的若干缺陷,如有限的时序与动态理解能力,以及过于泛化的回答。代码可在 https://github.com/Xiuyuan-Chen/AutoEval-Video 获取。

关键词

引用

@article{arxiv.2311.14906,
  title  = {AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering},
  author = {Xiuyuan Chen and Yuan Lin and Yuchen Zhang and Weiran Huang},
  journal= {arXiv preprint arXiv:2311.14906},
  year   = {2024}
}

备注

Accepted by ECCV 2024