EgoTaskQA:理解第一视角视频中的人类任务
计算机视觉与模式识别
2022-10-11 v1 人工智能
计算与语言
机器学习
摘要
通过视频观测理解人类任务是智能体的基本能力。该能力的挑战在于难以对情境化动作、其对物体状态的影响(即状态变化)及其因果依赖关系生成细致理解。这些挑战因多任务的自然并行性以及多智能体协作中的部分观测而进一步加剧。多数先前工作利用动作定位或未来预测作为从视频评估此类任务理解的间接指标。为进行直接评估,我们引入 EgoTaskQA 基准,通过对真实世界第一视角视频的问答,为任务理解的关键维度提供统一归属。我们精心设计与(1)动作依赖与效应、(2)意图与目标、以及(3)智能体对他人信念的理解相关的问题。这些问题分为描述性(什么状态?)、预测性(将会怎样?)、解释性(什么导致?)与反事实(如果怎样?)四类,以对面向目标任务的空间、时间与因果理解提供诊断分析。我们在基准上评估最先进的视频推理模型,并展示其在理解复杂面向目标第一视角视频上与人类存在显著差距。我们希望此努力能推动视觉社区在面向目标的视频理解与推理上继续前进。
引用
@article{arxiv.2210.03929,
title = {EgoTaskQA: Understanding Human Tasks in Egocentric Videos},
author = {Baoxiong Jia and Ting Lei and Song-Chun Zhu and Siyuan Huang},
journal= {arXiv preprint arXiv:2210.03929},
year = {2022}
}
备注
Published at NeurIPS Track on Datasets and Benchmarks 2022