中文

面向专业动作识别的视频问答基准——ActionAtlas

计算机视觉与模式识别 2024-11-12 v4

摘要

我们的世界充满了各种专业领域中的多样化动作,我们作为人类不断努力去识别和理解这些动作。在某个单一领域中,动作往往看起来相当相似,这使得深度模型难以准确区分。为了评估多模态基础模型在帮助我们识别此类动作方面的效果,我们提出 ActionAtlas v1.0,一个包含多种体育项目中短视频的多选式视频问答基准。该数据集中的每个视频都配有问题和四到五个选项。问题指出特定个体,询问哪个选项“最好”地描述了其在特定时间上下文中的动作。总体而言,该数据集包括 934 个视频,展示 580 个独特动作,涵盖 56 项体育项目,共计 1896 个选项中的动作。与大多数现有视频问答基准仅覆盖简单动作(往往可从单帧中识别)不同,ActionAtlas 专注于复杂的动作,严格测试模型区分在每个领域内看起来相似的动作细微差别的能力。我们在本基准上评估了开放式和专有基础模型,发现最佳模型 GPT-4o 最高 achieves 45.52% 的准确率;而提供动作描述的非专家众所周知的普通工人 achieve 61.64% 的准确率,其中随机机会约为 21%。我们与最先进模型的发现表明,较高的帧采样率对在 ActionAtlas 上准确识别动作至关重要,而一些领先的专有视频模型(如 Gemini)在默认配置中未包含这一特征。

关键词

引用

@article{arxiv.2410.05774,
  title  = {ActionAtlas: A VideoQA Benchmark for Domain-specialized Action Recognition},
  author = {Mohammadreza Salehi and Jae Sung Park and Tanush Yadav and Aditya Kusupati and Ranjay Krishna and Yejin Choi and Hannaneh Hajishirzi and Ali Farhadi},
  journal= {arXiv preprint arXiv:2410.05774},
  year   = {2024}
}