中文

ExAct:专家动作分析视频语言基准

计算机视觉与模式识别 2025-12-12 v2

摘要

我们提出ExAct,一个新的视频语言基准,用于专家水平理解熟练的物理人类活动。该基准包含3521个专家精选的视频问答对,覆盖11类物理活动,涵盖6个领域:运动、自行车维修、烹饪、健康、音乐和舞蹈。ExAct要求正确答案从五个精心设计的候选选项中选择,从而需要对物理人类技能进行细致、精准的专家级理解。评估最近的最先进VLMs在ExAct上的表现,显示出与人类专家水平之间的显著差距。具体而言,最佳表现的GPT-4o模型仅达44.70%的准确率,远低于培训有素的专家人士达82.02%的准确率。我们认为ExAct对开发和评估能够准确理解人类技能于各种物理和程序领域的VLMs具有积极作用。数据集和代码已提供于https://texaser.github.io/exact_project_page/

关键词

引用

@article{arxiv.2506.06277,
  title  = {ExAct: A Video-Language Benchmark for Expert Action Analysis},
  author = {Han Yi and Yulu Pan and Feihong He and Xinyu Liu and Benjamin Zhang and Oluwatumininu Oguntola and Gedas Bertasius},
  journal= {arXiv preprint arXiv:2506.06277},
  year   = {2025}
}