AGQA:一种用于组合式时空推理的基准
计算机视觉与模式识别
2021-03-31 v1 计算与语言
摘要
视觉事件是由参与者与物体进行空间交互的时间动作的组合。在开发能够对组合式时空事件进行推理的计算机视觉模型时,我们需要能够分析进展并揭示缺陷的基准。现有的视频问答基准虽有用,但常将多种错误来源混淆为单一准确率指标,并存在模型可利用的强偏差,难以精确定位模型弱点。我们提出动作基因组问答(AGQA),一种用于组合式时空推理的新基准。AGQA包含针对个视频的个不平衡问答对。我们还提供了一个包含个问答对的平衡子集,比现有基准大3个数量级,其通过平衡答案分布与问题结构类型来最小化偏差。尽管人类评估者将我们的问答对标记为正确,最佳模型仅达到的准确率。此外,AGQA引入多种训练/测试划分以测试各类推理能力,包括泛化到新组合、间接指称以及更多组合步骤。利用AGQA,我们评估了现代视觉推理系统,表明最佳模型仅比利用语言偏差的非视觉基线略好,且现有模型均无法泛化到训练时未见的新组合。
引用
@article{arxiv.2103.16002,
title = {AGQA: A Benchmark for Compositional Spatio-Temporal Reasoning},
author = {Madeleine Grunde-McLaughlin and Ranjay Krishna and Maneesh Agrawala},
journal= {arXiv preprint arXiv:2103.16002},
year = {2021}
}
备注
8 pages, 15 pages supplementary, 12 figures. To be published in CVPR 2021