EgoSchema:一个用于超长视频语言理解的评测基准
计算机视觉与模式识别
2023-08-21 v1 人工智能
计算与语言
摘要
我们提出EgoSchema,一个超长视频问答数据集与基准,用于评估现代视觉与语言系统的长视频理解能力。EgoSchema源自Ego4D,包含超过5000个人工标注的多项选择题答案对,覆盖超过250小时真实视频数据,涵盖极广泛的自然人类活动与行为。对于每个问题,EgoSchema要求基于一段三分钟长的视频片段,在五个给定选项中选出正确答案。尽管一些先前工作提出了具有长片段长度的视频数据集,我们认为仅视频片段的长度并不能真正刻画所考虑视频任务的时间难度。为此,我们引入时间凭证集,一种用于刻画广泛视频理解任务与数据集内在时间理解长度的通用概念。基于该指标,我们发现EgoSchema的内在时间长度比第二接近的数据集长5.7倍以上,比任何其他视频理解数据集长10至100倍。此外,我们对若干当前最先进视频与语言模型的评估显示它们严重缺乏长期视频理解能力。即便拥有数十亿参数的模型在EgoSchema多项选择题任务上的QA准确率也低于33%(随机为20%),而人类准确率约为76%。我们主张,EgoSchema凭借其长内在时间结构与多样复杂性,将作为未来开发有效长期视频理解系统的宝贵评测探针。数据与零样本模型评估代码已在Ego4D许可下开源供公众与商业使用,见 http://egoschema.github.io
引用
@article{arxiv.2308.09126,
title = {EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding},
author = {Karttikeya Mangalam and Raiymbek Akshulakov and Jitendra Malik},
journal= {arXiv preprint arXiv:2308.09126},
year = {2023}
}
备注
https://egoschema.github.io/